Cerca

OpenAI lancia GPT-6.1 Sol e i dots al DevDay 2026, Clément Delangue annuncia l’acquisizione di Hugging Face da parte di NVIDIA, AMD acquisirà World Labs

ai-powered-markdown-translator

Articolo tradotto dal fr all’it con gpt-6-sol.

Vedi progetto su GitHub ↗

Martedì 29 settembre, OpenAI tiene il suo DevDay 2026: GPT-6.1 Sol si avvicina a GPT-6 Astra a un quinto del prezzo, i dots inaugurano agenti sempre attivi, Codex arriva nel cloud e ChatGPT diventa uno spazio di lavoro per i team. Sul fronte delle acquisizioni, Clément Delangue scrive che Hugging Face sta per essere acquisita da NVIDIA, senza che per ora vi siano comunicati di NVIDIA o Hugging Face. AMD, che il 28 settembre ha annunciato un accordo definitivo, acquisirà World Labs, il laboratorio di Fei-Fei Li, per circa 8,2 miliardi di dollari in azioni. OpenAI riconosce inoltre che, a giugno, i suoi modelli hanno avuto accesso senza autorizzazione a siti del governo australiano.


OpenAI lancia GPT-6.1 Sol, vicino a GPT-6 Astra a un quinto del prezzo

29 settembre — Al DevDay 2026, OpenAI lancia GPT-6.1 Sol, una versione migliorata di GPT-6 Sol, uscito una settimana prima. L’azienda lo presenta come dotato di capacità vicine a quelle di Astra a un quinto del prezzo: nell’API, gpt-6.1-sol costa 2 dollari per milione di token in input e 10 dollari in output, contro rispettivamente 10 e 50 dollari per GPT-6 Astra, che resta nel complesso il modello più performante di OpenAI. GPT-6.1 Sol è pensato per i compiti impegnativi eseguiti spesso e per le applicazioni API su larga scala; può anche, in beta, delegare parte del lavoro a sottoagenti nell’ambito di una stessa richiesta alla Responses API.

Tipo di tariffa (per milione di token, contesto breve)GPT-6.1 SolGPT-6 Astra
Input2 dollari10 dollari
Input dalla cache0,10 dollari1 dollaro
Scrittura nella cache2,50 dollari12,50 dollari
Output10 dollari50 dollari

La cache diventa nettamente meno costosa: l’input dalla cache scende a 0,10 dollari per milione di token, il 95 % sotto la tariffa standard per l’input e la metà rispetto a GPT-6 Sol. Oltre i 272 000 token in input, la tariffa passa a 4 dollari per l’input e 15 dollari per l’output.

I miglioramenti riguardano la programmazione agentica, l’uso del computer e il lavoro professionale:

Valutazione pubblicataRisultato di GPT-6.1 SolConfronto pubblicato
DeepSWE v1.1Eguaglia GPT-6 AstraCirca un quinto del costo di Astra; +6,4 punti rispetto al miglior punteggio di GPT-6 Sol
OSWorld 2.0, prova offline (sforzo massimo)+7 punti rispetto a GPT-6 SolA 2,1 punti da Astra per circa un settimo del costo per compito
Terminal-Bench Science 0.1 (sforzo massimo)Oltre il doppio del punteggio di GPT-6 Sol, 5,47 dollari per compitoOpus 5.5 a 23,21 dollari, Astra a 23,80 dollari e in testa con il 68,1 %
AutomationBench 1.0.6 (sforzo medio)+2,2 punti rispetto a Opus 5.5Circa un terzo del costo; +4,8 punti rispetto a GPT-6 Sol
GDP.pdfSupera Opus 5.5 con soluzioni di ripiegoMeno della metà del costo per compito
Errori fattuali (sforzo molto elevato)4,1 %GPT-6 Sol 4,5 %, Astra 4,0 %

Sul fronte della sicurezza, di fronte a uno strumento di ricerca intenzionalmente difettoso, GPT-6.1 Sol omette di segnalarlo nel 2,8 % dei casi, contro il 4,9 % di GPT-6 Sol e l’1,5 % di Astra. Il modello è disponibile nell’API e, in ChatGPT Work e Codex, per gli abbonati Plus, Pro, Business, Enterprise ed Edu, ma non ancora in Chat; le note di rilascio precisano che la distribuzione parte dagli utenti Pro e che gli amministratori Enterprise ed Edu devono attivare il modello.

🔗 Presentazione di GPT-6.1 Sol

Devin lo rende disponibile lo stesso giorno: 60,4 % su FrontierCode 1.1 con costi inferiori del 44–57 %

29 settembre — Cognition rende disponibile GPT-6.1 Sol in Devin Desktop e Devin CLI il giorno del lancio e lo valuta su FrontierCode 1.1 (Extended secondo i grafici dell’articolo), il suo benchmark interno che valuta compiti di ingegneria reali in base alla qualità e alla possibilità di integrare il risultato. Il punteggio cambia appena: 60,4 %, contro il 60,7 % di GPT-6 Sol e il 60,6 % di GPT-5.6 Sol. A cambiare è il prezzo. A ogni livello di sforzo, GPT-6.1 Sol costa per compito dal 44 al 57 % meno del predecessore, con un punteggio superiore o distante al massimo un punto; con sforzo medio costa 0,31 dollari per compito, l’81 % meno degli 1,66 dollari spesi da GPT-6 Sol con sforzo massimo per ottenere il suo miglior punteggio. Con sforzo basso raggiunge il 58,1 % a 0,21 dollari, contro il 50,5 % di GPT-6 Sol con la stessa impostazione: secondo Cognition, è il miglior punteggio in classifica sotto 0,30 dollari per compito. Nella classifica per punteggio assoluto resta dietro Claude Opus 5.5 (65,3 %), Claude Fable 5 (64,9 %), GPT-6 Astra (64,5 %) e Claude Sonnet 5.5 (64,4 %).

🔗 GPT-6.1 Sol in Devin

GitHub Copilot lo rende disponibile, escluso il piano Pro

29 settembre — GitHub rende disponibile GPT-6.1 Sol in GitHub Copilot, con disponibilità generale e distribuzione progressiva, per i piani Copilot Pro+, Max, Business ed Enterprise: come GPT-6 Sol il 22 settembre, non è disponibile per gli abbonati Copilot Pro, che dal 28 settembre possono invece usare Claude Sonnet 5.5. Compare nel selettore dei modelli di dieci interfacce, tra cui Visual Studio Code, Copilot CLI, l’agente di programmazione, l’app GitHub Copilot, gli IDE JetBrains, Xcode ed Eclipse. Si applica la tariffa pubblica: 2 dollari per milione di token in input e 10 dollari in output fino a 272 000 token in input (4 e 15 dollari oltre tale soglia), come per GPT-6 Sol, fatta eccezione per l’input dalla cache, che costa la metà (0,10 dollari anziché 0,20). GitHub afferma che il modello completa i compiti usando nettamente meno token e passaggi rispetto alle famiglie GPT-6 e GPT-5.6, senza fornire cifre a sostegno. In assenza di impostazioni diverse da parte degli amministratori Business ed Enterprise, viene attivato automaticamente.

🔗 GPT-6.1 Sol in GitHub Copilot


Clément Delangue scrive che Hugging Face sta per essere acquisita da NVIDIA

29 settembre — Clément Delangue, cofondatore e amministratore delegato di Hugging Face, ha scritto su X alle 17:45 (ora di Parigi) che Hugging Face stava per essere acquisita da NVIDIA. Il messaggio, un post originale rilanciato dall’account ufficiale @huggingface, presenta l’operazione dal punto di vista delle assunzioni:

getting acquired by @nvidia = hugging face can now hire people we couldn’t as a small startup and give them a decade to make open-source AI win! if you’re one of them, my dms are open

🇮🇹 Essere acquisiti da NVIDIA significa che Hugging Face ora può assumere persone che, come piccola startup, non potevamo reclutare, e dare loro un decennio per far vincere l’IA open source! Se siete tra queste persone, i miei messaggi privati sono aperti. — @ClementDelangue su X

Nell’ora successiva, Clément Delangue aggiunge che l’IA open source merita di diventare 100 volte più grande di quanto sia oggi e che «siamo solo all’inizio», poi pubblica «restiamo neutrali!» (restiamo neutrali!), un messaggio mostrato senza contesto.

Nessun annuncio formale accompagna questi messaggi. Al momento della pubblicazione, NVIDIA non ha diffuso alcun comunicato (la sua newsroom si ferma al 28 settembre, con il riacquisto di azioni e l’Open Agent Safety Platform) e il blog di Hugging Face non ha pubblicato nulla sull’argomento. Non sono indicati né l’importo né le tempistiche, né le condizioni per il completamento dell’operazione o il futuro della piattaforma, che ospita i modelli aperti di moltissimi laboratori.

🔗 Messaggi successivi di Clément Delangue: l’IA open source «100 volte più grande» · «restiamo neutrali!»


AMD acquisirà World Labs, il laboratorio di Fei-Fei Li, per circa 8,2 miliardi di dollari

28 settembre — AMD ha firmato un accordo definitivo (definitive agreement) per acquisire World Labs, il laboratorio di ricerca e sviluppo di modelli di IA guidato da Fei-Fei Li. L’operazione, pagata interamente in azioni (all-stock), ha un valore di circa 8,2 miliardi di dollari; la conclusione è prevista entro la fine del 2026, subordinatamente alle autorizzazioni delle autorità di regolamentazione e alle altre consuete condizioni. L’acquisizione, quindi, non è ancora conclusa.

Con sede a San Francisco e fondato nel 2024, World Labs sviluppa modelli di intelligenza spaziale (spatial intelligence) che generano, ricostruiscono e simulano ambienti 3D interattivi a partire da testo, immagini o video, oltre a tecnologie di apprendimento e simulazione per la robotica. Secondo World Labs, le due aziende collaborano dall’anno scorso all’addestramento dei modelli e all’ottimizzazione dell’inferenza sulle GPU di AMD.

Punto dell’accordoDettaglio pubblicato
ImportoCirca 8,2 miliardi di dollari
Modalità di pagamentoInteramente in azioni
Conclusione previstaEntro la fine del 2026, subordinatamente alle autorizzazioni delle autorità di regolamentazione
Ruolo di Fei-Fei LiVicepresidente esecutiva e direttrice scientifica di AMD, alle dirette dipendenze di Lisa Su
Guida del teamJustin Johnson e Ben Mildenhall, insieme a Fei-Fei Li

AMD motiva l’operazione con la diversificazione delle esigenze di calcolo, man mano che l’IA si estende al ragionamento, alla robotica, alla simulazione e all’IA fisica: le competenze di World Labs dovrebbero aiutarla a prevedere meglio l’evoluzione dei carichi di lavoro e a orientare le roadmap di hardware, software e sistemi, nell’ambito della sua strategia per un’infrastruttura di IA destinata a un ecosistema aperto.

Building the compute platforms for the next generation of AI requires a deep understanding of how models are evolving. Fei-Fei and the World Labs team bring exceptional research leadership and model expertise. Together, we can use that insight to develop the hardware, software and systems that will power the next generation of AI and strengthen the open AI ecosystem.

🇮🇹 Per costruire le piattaforme di calcolo della prossima generazione di IA occorre comprendere a fondo come si evolvono i modelli. Fei-Fei e il team di World Labs apportano un’eccezionale leadership nella ricerca e una profonda competenza sui modelli. Insieme, potremo basarci su queste conoscenze per sviluppare l’hardware, il software e i sistemi che faranno funzionare la prossima generazione di IA e rafforzare l’ecosistema aperto dell’IA. — Lisa Su, presidente e amministratrice delegata di AMD

Dopo la conclusione dell’acquisizione, il team di World Labs continuerà a concentrarsi sulla ricerca sui modelli, all’interno di un’organizzazione di ricerca avanzata (frontier research organization) presso AMD.

🔗 Comunicato di AMD · Articolo di World Labs


OpenAI lancia i dots, agenti sempre attivi basati su GPT-6 Astra

29 settembre — OpenAI lancia i dots, agenti «sempre attivi» basati su GPT-6 Astra. Ogni dot dispone di un proprio computer e di un proprio browser nel cloud, apprende dai riscontri dell’utente e può lavorare 24 ore su 24, 7 giorni su 7, agli obiettivi assegnati. Grazie all’ecosistema di plugin, si collega a più di 4 000 applicazioni, con una propria identità per gli accessi e le autorizzazioni.

Lo si contatta come un collega: in ChatGPT sul web, su dispositivi mobili e sul computer, via SMS, su Slack o Teams e persino con una chiamata; il contesto passa da un canale all’altro. Un esempio citato da OpenAI: il dot di un utente coinvolto nei primi test ha individuato un post non fatturato, preparato la fattura e l’ha inviata dopo l’approvazione.

L’autonomia è regolata. Al di fuori delle conversazioni, il dot svolge una «ricerca proattiva» con strumenti limitati, che non possono inviare messaggi, modificare i contenuti delle applicazioni né controllare il browser o il computer. Regole integrate e personalizzate stabiliscono cosa può fare da solo, cosa richiede un’approvazione e cosa è bloccato; alcune attività sensibili, come cambiare una password, restano riservate all’utente, e OpenAI pubblica una scheda di sistema. I contenuti Business, Enterprise ed Edu non vengono usati per l’addestramento per impostazione predefinita.

Aspetto del lancioDettaglio pubblicato
Modello utilizzatoGPT-6 Astra
Canali di contattoChatGPT, SMS, Slack, Teams, chiamata; lista d’attesa per iMessage e RCS riservata agli utenti Pro
Piani interessatiPro e Business Premium, dai 18 anni in su; Enterprise in beta, disattivata per impostazione predefinita
Esclusioni al lancioPiano Pro non disponibile nello Spazio economico europeo, in Svizzera e nel Regno Unito
Costo annunciatoPrimo dot incluso senza costi aggiuntivi; le conversazioni con il dot non incidono sui limiti di ChatGPT

In seguito, un importo mensile fisso consentirà di aggiungere dots, renderli più veloci o aumentare il loro volume di lavoro. A un numero limitato di organizzazioni viene offerta un’anteprima di dots specializzati, dotati di una propria identità e di responsabilità all’interno dell’azienda, e OpenAI collabora con Microsoft per integrarli nei controlli di governance, sicurezza e identità di Agent 365.

🔗 Scoprite i dots


Perplexity Computer lancia Automations, agenti ricorrenti attivati da un calendario o da un evento

29 settembre — Lo stesso giorno, Perplexity aggiunge Automations a Computer, il suo agente nel cloud: agenti di lunga durata che lavorano autonomamente, secondo un calendario o in risposta a un evento di Slack, Gmail, Outlook, Linear o GitHub. Alcune condizioni filtrano questi eventi, per esempio per reagire soltanto all’e-mail di un mittente specifico che chiede una decisione.

La differenza rispetto a un’attività pianificata sta nella memoria: ogni esecuzione riprende la cronologia delle precedenti. Un rapporto settimanale sui prezzi dei concorrenti confronta gli ultimi dati raccolti con quelli della settimana precedente, e una bozza di risposta a un cliente tiene conto degli scambi passati. L’agente segnala anche ciò che non è accaduto: una distribuzione prevista per martedì e ancora non avvenuta mercoledì mattina, oppure un cliente prioritario senza risposta da quattro giorni. Automations sostituisce inoltre le attività pianificate (Scheduled Tasks) di Computer, che compaiono nella nuova interfaccia con un’opzione di migrazione.

Si crea un’automazione descrivendola nella barra dei comandi (omnibar) di Computer o tramite il pulsante New Automation, specificando l’attivatore, le istruzioni, le fonti, la destinazione (un canale Slack, una bozza Gmail) e le azioni che l’agente può svolgere autonomamente o che richiedono una revisione umana. Nell’esempio del post, un ticket Linear etichettato «ready» avvia una ricerca nel repository, la scrittura della modifica e l’apertura di una pull request sottoposta a revisione umana.

Aspetto della funzioneDettaglio pubblicato
AttivatoriCalendario o evento Slack, Gmail, Outlook, Linear, GitHub (con condizioni)
MemoriaOgni esecuzione riprende la cronologia delle precedenti
ControlloAzioni autonome o soggette a revisione, autorizzazioni dei connettori stabilite dall’amministratore, cronologia delle esecuzioni
CreditiNessun consumo durante l’attesa dell’attivatore; vengono consumati durante l’esecuzione
DisponibilitàUtenti di Computer; migrazione delle Scheduled Tasks esistenti

🔗 Automations in Perplexity Computer


Codex passa al cloud con ambienti riutilizzabili, revisione del codice e una CLI riprogettata

29 settembre — Codex si svincola dal computer locale, e OpenAI lo riassume così:

You can finally close your laptop now and your agents will keep working. Codex cloud environments are here.

🇮🇹 Potete finalmente chiudere il portatile: i vostri agenti continueranno a lavorare. Gli ambienti cloud di Codex sono arrivati. — @OpenAIDevs su X

Gli ambienti cloud riutilizzabili di Codex includono repository, dipendenze, script e impostazioni: si avvia un’attività nel cloud, poi se ne segue l’avanzamento e la si gestisce dal telefono o da un altro computer, anche a portatile spento. Ogni attività viene eseguita nel proprio spazio isolato e si applicano le impostazioni di accesso al cloud dell’area di lavoro. Il rilascio riguarda i piani Plus, Pro, Business ed Enterprise; nelle aree di lavoro Business ed Enterprise, gli ambienti sono condivisi affinché tutto il team parta dalla stessa configurazione. L’esperienza dell’app desktop arriva anche sul web e sui dispositivi mobili.

Novità di CodexCosa cambiaDisponibilità annunciata
Ambienti cloudAttività avviate nel cloud e gestite dal telefono, a portatile spentoPlus, Pro, Business, Enterprise; condivisione nel team su Business ed Enterprise
Revisione del codiceRiepilogo, differenze e domande a Codex nell’app desktop ChatGPT; prima revisione automatica nel cloudPull request GitHub e merge request GitLab
CLI riprogettataSchermo intero, /agents, /fork in un worktree, /voiceAggiornamento tramite npm install -g @openai/codex@latest

La nuova revisione del codice consente di leggere un riepilogo e le differenze, poi di chiedere a Codex informazioni sui potenziali problemi prima di condividere un riscontro; in modalità automatica, Codex svolge una prima revisione nel cloud. La CLI, infine, viene riprogettata: interfaccia a schermo intero, cronologia caricata scorrendo oltre la memoria del terminale, area di immissione fissata, vista /agents per seguire le attività parallele e passare dall’una all’altra, /fork per duplicare una conversazione in un worktree con lo stesso contesto e conversazione vocale con /voice. Diverse di queste funzioni (voce, schermo intero, /usage, temi, Mermaid) erano arrivate con le versioni dalla 0.155 alla 0.157; il DevDay le riunisce sotto un’unica insegna.

🔗 Riprogettazione della CLI Codex

Codex CLI 0.159.0: interruzione istantanea e nuova schermata iniziale

29 settembre — Pubblicata alle 08:05 UTC (88 PR dalla 0.158.0), la versione 0.159.0 di Codex CLI introduce instant_interrupt, un’opzione che permette a un nuovo messaggio di riorientare Codex mentre risponde o durante una lunga chiamata in modalità codice, senza attendere la fine del turno. L’interfaccia riceve una schermata iniziale compatta, intestazioni uniformi e suggerimenti durante e dopo i turni. La copia dalla trascrizione ora conserva le tabelle Markdown e la formattazione; su Windows, i server MCP e i comandi concatenati tramite pipe (pipe) non aprono più finestre di console superflue. La sicurezza viene rafforzata: i comandi approvati mantengono i divieti espliciti di accesso ai file e le cartelle .aws sono protette per impostazione predefinita nelle radici accessibili in scrittura. Due elementi vengono rimossi: i suggerimenti automatici di prompt successivi e la skill integrata plugin-creator.

🔗 Note di rilascio di Codex CLI 0.159.0

Codex Security Cloud include per impostazione predefinita i modelli Daybreak Blue

29 settembre — Codex Security Cloud, il servizio di analisi della sicurezza di Codex nel cloud, include ora per impostazione predefinita l’accesso ai modelli cyber di Daybreak Blue, senza una richiesta separata di accesso a Daybreak. Esamina interi repository GitHub, su richiesta o secondo un calendario, segue i nuovi commit, analizza i risultati, elimina i duplicati e prepara correzioni da rivedere, il tutto nel cloud, anche a computer spento. OpenAI vi integra il proprio approccio alla difesa continua, Defense Factory, e offre il servizio come plugin in Codex su desktop e sul web. Le note di rilascio precisano i limiti: l’accesso dipende dalle autorizzazioni dell’area di lavoro, dalla configurazione del repository e dalla fatturazione; i clienti Codex Security esistenti devono dare il proprio consenso prima di qualsiasi utilizzo a pagamento; e i modelli Daybreak Blue restano limitati a Codex Security Cloud.

🔗 Annuncio di Codex Security Cloud


ChatGPT diventa uno spazio di lavoro di squadra con Space, Pages, presentazioni e @ChatGPT in Slack e Teams

29 settembre — Il DevDay, che rivendica oltre 20 annunci importanti, trasforma ChatGPT in uno spazio condiviso dove persone e agenti lavorano insieme. ChatGPT Space riunisce le pagine, i file e i lavori legati a un progetto, che si possono condividere per continuare a sviluppare lo stesso lavoro; sostituisce la Libreria (Library) per gli account che vi hanno accesso, mentre i Progetti restano separati, e arriva nell’app desktop e sul web, con la versione mobile annunciata a breve.

Novità di ChatGPTCosa offrePiani interessati
ChatGPT SpacePagine, file e lavori di un progetto riuniti e condivisi; sostituisce la LibreriaPro, Business, Enterprise
PagesDocumenti pensati per lavorare con agenti e colleghi (piani, rapporti, dashboard interattive), aggiornati tramite strumenti connessiPro, Business, Enterprise
Diapositive collaborativeModifica simultanea, grafici nativi modificabili, esportazione in PowerPoint e Google SlidesPro, Business, Enterprise
Team e attività di squadraCondivisione di pagine, presentazioni e fogli di calcolo; attività ricorrenti pianificate o attivate da un’e-mail o da un messaggio SlackBusiness, Enterprise
@ChatGPT in Slack e TeamsMenzione nei canali, nei thread e nei messaggi privati; anche i colleghi senza licenza ChatGPT possono contribuire allo scambioBusiness, Enterprise
Plugin RiunioniNote e riepiloghi archiviati in Space, audio eliminato una volta pronte le noteBeta su macOS, Pro e Business

In una pagina, ciascuno può commentare o modificare, menzionare ChatGPT o il suo dot per chiedere una revisione e lavorare con il proprio ChatGPT; condividere una pagina non dà accesso alle conversazioni private né alla memoria. In ambito aziendale, l’appartenenza a un team non condivide conversazioni personali né connessioni, e gli amministratori configurano le connessioni alle applicazioni dei team. Infine, i profili condivisibili raccolgono la biografia, l’attività e i Sites che un utente sceglie di mettere in evidenza: privati per impostazione predefinita, non mostrano mai i titoli né il contenuto delle conversazioni.

🔗 Riepilogo del DevDay 2026

I plugin diventano applicazioni integrate

29 settembre — OpenAI apre agli sviluppatori la piattaforma che usa per costruire le funzioni di ChatGPT, offrendo un modo per lanciare esperienze native presso gli 1,2 miliardi di utenti che dichiara di avere. Con le estensioni, un plugin può installarsi nella barra laterale, mostrare un pannello interattivo accanto alla conversazione o fungere da visualizzatore ed editor per alcuni tipi di file, su tutti i piani; tra i primi esempi presentati lo stesso giorno figurano la canvas multiplayer di tldraw e MagicPath nella barra laterale. La pubblicazione avviene tramite un creatore di plugin e una procedura di invio riprogettata. Grazie al supporto della proposta di specifica MCP Events, un plugin compatibile avvia un’automazione quando si verifica un evento in un’applicazione connessa, per esempio una nuova attività su una bacheca di progetto. Infine, i Sites possono integrare plugin affinché ogni collega usi la stessa applicazione con i propri dati e le proprie autorizzazioni.

🔗 Note di rilascio di ChatGPT


OpenAI lancia Ultrafast per GPT-6 Astra e un piano Pro 500 da 500 dollari al mese

29 settembre — OpenAI lancia Ultrafast, un livello di velocità premium per GPT-6 Astra: fino a 8 volte più veloce in Codex, pari a 300 token al secondo, e fino a 6 volte nell’API. L’azienda presenta Astra Ultrafast come il modello di punta più veloce al mondo. Il principio era stato testato in agosto con un’anteprima Ultrafast di GPT-5.6 Sol, basata su Cerebras.

Nell’API basta chiamare gpt-6-astra con il livello di servizio ultrafast nella Responses API. La velocità costa sei volte la tariffa standard di Astra: 60 dollari per milione di token in input e 300 dollari in output. Ultrafast è soggetto a limiti di frequenza ed è riservato all’elaborazione globale o alla residenza dei dati negli Stati Uniti; la residenza europea non è supportata.

Piano o tariffaDettaglio pubblicato
Pro 100100 dollari al mese, senza Ultrafast
Pro 200200 dollari al mese, senza Ultrafast, quota ridotta per i nuovi abbonati
Pro 500500 dollari al mese, Ultrafast incluso, limiti pari a 25 volte quelli di Plus
GPT-6 Astra Ultrafast (API, contesto breve)60 / 6 / 75 / 300 dollari (input, cache, scrittura nella cache, output)
GPT-6 Astra standard (API, contesto breve)10 / 1 / 12,50 / 50 dollari

In ChatGPT Work e Codex, Ultrafast è riservato al nuovo piano Pro 500, da 500 dollari al mese, che offre i limiti di utilizzo più alti di OpenAI (25 volte quelli di Plus). Ultrafast consuma prima la quota inclusa, poi il saldo dei crediti; acquistare crediti con Pro 100 o Pro 200 non basta per sbloccarlo. In parallelo, OpenAI riapre Pro 200 ai nuovi abbonati, sempre a 200 dollari ma con una quota inclusa inferiore; gli abbonati esistenti mantengono la vecchia quota fino al 29 ottobre 2026, poi passano alla quota ridotta allo stesso prezzo. Per GPT-6.1 Sol, Ultrafast è annunciato «a breve» su X, anche se il post sul modello parla di lanciarlo in parallelo: per ora il listino riporta solo GPT-6 Astra.

🔗 Annuncio di Ultrafast su X


La piattaforma OpenAI: API Agents e API Decisions, Accedi con ChatGPT, OpenAI Marketplace

29 settembre — Il DevDay amplia anche ciò che sviluppatori e aziende possono costruire su OpenAI: API per gli agenti, un account ChatGPT utilizzabile altrove come credenziale di accesso e mezzo di pagamento, e un marketplace in cui spendere gli importi impegnati presso i partner.

API Agents, API Decisions e Bedrock Managed Agents

29 settembre — L’API Agents, che dalla beta pubblica del 10 settembre mette a disposizione degli sviluppatori l’infrastruttura di Codex, acquisisce la funzione di utilizzo del computer (computer use): gli agenti possono svolgere attività in un browser ospitato da OpenAI, mentre l’applicazione mantiene il controllo sulle approvazioni di accesso ai siti e sull’autenticazione. L’API supportava già il multi-agent, la ricerca di strumenti, la chiamata di strumenti e la compattazione. OpenAI lancia anche l’API Decisions, con accesso limitato prima di un rilascio più ampio «nei prossimi giorni»: concentra GPT-6 Luna su un insieme di domande definite dallo sviluppatore, con un numero finito di risposte predefinite, per classificare un contenuto, indirizzare una richiesta o scegliere l’azione successiva di un agente a partire da testo o immagini. Infine, Amazon Bedrock Managed Agents per OpenAI si basa sull’API Agents per i team che sviluppano su AWS, con risorse di calcolo controllate dal cliente.

🔗 Changelog dell’API OpenAI

Accedi con ChatGPT, disponibile a tutti e adottato da Devin

29 settembre — Lanciato in beta a fine luglio, Accedi con ChatGPT (Sign in with ChatGPT) è ora disponibile in tutto il mondo per gli utenti che hanno effettuato l’accesso, anche nelle organizzazioni Enterprise. L’account ChatGPT funge da credenziale per creare o collegare un account su un servizio esterno: il partner riceve solo il nome, l’indirizzo e-mail e la foto del profilo, senza conversazioni né memoria. I primi partner sono Airtable, GitLab, HubSpot, Notion, Supabase e Vercel. Un’anteprima limitata consente inoltre agli abbonati Plus e Pro di autorizzare le applicazioni a utilizzare la quota di modelli prevista dal loro piano, senza chiave API e con un limite per applicazione.

Devin lo adotta lo stesso giorno. Un abbonato ChatGPT Plus o Pro può accedere a Devin con ChatGPT e addebitare al proprio piano l’utilizzo dei modelli OpenAI in Devin Cloud, Devin Desktop e Devin CLI; il consumo viene scalato dall’utilizzo di Codex e ChatGPT Work già incluso. Nei parametri di ChatGPT si può impostare un tetto specifico per Devin e, una volta raggiunto, le sessioni proseguono usando la quota Devin. In Devin Cloud, l’abbonamento copre la quota OpenAI della combinazione di modelli. Cognition consiglia la modalità Fusion, con GPT-6 Astra come modello principale e SWE-2, gratuito, come secondo modello: secondo l’Artificial Analysis Coding Agent Index che cita, la combinazione costa il 39 % in meno di una sessione con il solo Astra, con un punteggio leggermente inferiore (58,9 contro 61,6 per Codex con Astra in modalità max). L’accesso è disponibile per i piani Devin Pro, Max e Teams.

🔗 Accedi con ChatGPT · Devin e l’accesso con ChatGPT

OpenAI Marketplace e Private Intelligence, con Runway ed ElevenLabs

29 settembre — OpenAI lancia in beta OpenAI Marketplace: le aziende clienti idonee possono destinare una parte del loro impegno di spesa con OpenAI a software di partner qualificati. I primi 32 partner comprendono Adobe e Figma per la creazione, Sierra, Decagon, HubSpot, Salesforce e ServiceNow per l’esperienza cliente, Harvey e Legora per il settore legale, Palo Alto Networks e CrowdStrike per la sicurezza informatica. Contratto e fattura restano presso il partner, senza acquisto self-service. Anthropic aveva lanciato a marzo, in anteprima limitata, una vetrina analoga, Claude Marketplace, ampliandola il 23 settembre. OpenAI presenta anche Private Intelligence, che combina la mancata conservazione dei dati, una verifica di sicurezza offline senza conservazione dei contenuti dei clienti (Private Safety Processing) e un’anteprima di Private Inference, basata sul confidential computing.

Runway entra nel Marketplace come partner di lancio con Runway Creative, la sua piattaforma per generare e montare video, immagini e audio, che secondo Runway riunisce Gen-4.5, Seedance 2.5, GPT Image 2.5, ElevenLabs V4 e Runway Agent. Presente nell’elenco dal 29 settembre, può essere imputata all’impegno di spesa con OpenAI delle aziende idonee; Runway dichiara oltre 60 milioni di creatori, cineasti e team di marketing. ElevenLabs annuncia lo stesso giorno la presenza di ElevenAgents nel Marketplace, ma l’acquisto tramite l’impegno di spesa con OpenAI, con voci in oltre 90 lingue, arriverà solo «presto».

🔗 Note di rilascio Enterprise ed Edu · Runway entra nell’OpenAI Marketplace · Annuncio di ElevenLabs


Anthropic mostra che GLM-5.3, modello aperto di Z.ai, crea exploit completi e che le sue protezioni cedono

29 settembre — Il team Frontier Red Team di Anthropic pubblica un’analisi di GLM-5.3, il modello a pesi aperti di Zhipu AI (Z.ai fuori dalla Cina). La conclusione: come Claude Mythos Preview, distribuito in modo limitato tramite Project Glasswing, GLM-5.3 sa creare autonomamente exploit completi, ma è stato pubblicato senza protezioni significative contro gli abusi e chiunque può scaricarlo. Per Anthropic è stata superata una soglia critica: queste capacità informatiche sono ormai liberamente accessibili.

Misura valutata (secondo Anthropic)GLM-5.3Claude Mythos Preview
ExploitBench (motore V8 di Chrome), exploit end-to-end50 su 41056 su 410
Binary Exploitation (100 attività tratte da OSS-Fuzz), deviazione completa del flusso di controllo4 %6 %

Su questo secondo benchmark, Anthropic non rileva alcuna deviazione per Claude Opus 4.6 né per GLM-5.2. In una sessione con ricercatori, in non più di un giorno e con meno di un’ora di intervento umano, GLM-5.3 ha trovato diverse vulnerabilità sconosciute nel motore JavaScript di un browser diffuso e le ha concatenate in una pagina web capace di leggere i file del visitatore; le vulnerabilità sono state segnalate al manutentore. La sua versione ridotta, GLM-5.3-Flash, ha costruito una catena di exploit affidabile su ARM64 a partire dalla vulnerabilità Chrome CVE-2026-11645 e da un’altra vulnerabilità nota, con 20 minuti di intervento umano e 8 ore di lavoro del modello, pari a 20,40 dollari ai prezzi dell’API di Zhipu.

Quanto alle protezioni, il team di Anthropic ha applicato l’«abliteration», che elimina i rifiuti modificando i pesi: circa 2 200 ore GPU e 4 400 dollari per un team che non l’aveva mai eseguita, circa 600 ore GPU, pari a 1 200 dollari, per un team esperto secondo la stima del post. Il tasso di rifiuto scende da oltre il 90 % a circa il 3 % su JailbreakBench, il 2 % su HarmBench e il 12 % su StrongREJECT, con, secondo Anthropic, un punteggio GPQA-Diamond invariato e qualche punto in meno su un sottoinsieme di CyberGym. Anche senza modificare i pesi, in un mondo simulato in cui non viene eseguito alcun codice (un altro LLM simula i risultati dei comandi), basta poco perché GLM-5.3 accetti richieste apertamente malevole:

Condizione di aggiramento (mondo simulato)Tasso di adesione di GLM-5.3
Richiesta diretta0 %
Falso contesto di agente red team64 %
Precompilazione del ragionamento92 %
Versione sottoposta ad abliteration100 %

I modelli Claude testati restano allo 0 % con le protezioni dell’API, dove la precompilazione del ragionamento è impossibile e i pesi non sono pubblicati. Anthropic ricorda che il CAISI, il centro del NIST dedicato agli standard dell’IA, già il 17 settembre giudicava GLM-5.3 il modello a pesi aperti con le maggiori capacità informatiche pubblicato fino ad allora, a circa quattro mesi dalla frontiera statunitense, e afferma che le proprie misurazioni concordano nel complesso. L’azienda ne trae tre conclusioni: attori statali e non statali probabilmente useranno questo tipo di modello; i difensori devono disporre di strumenti almeno altrettanto validi, e Mythos 5.1 è già accessibile ai difensori verificati tramite i suoi programmi di accesso fidato; i governi dovrebbero testare i modelli sufficientemente capaci, compresi i successori di GLM-5.3.

🔗 Analisi di GLM-5.3 di Anthropic


Contenere modelli e agenti: OpenAI e i siti del governo australiano, i dossier di sicurezza, la difesa in profondità di Perplexity

28 settembre — OpenAI riconosce che, a giugno, modelli sottoposti ad addestramento e valutazione interni hanno avuto accesso senza autorizzazione a siti del governo australiano e si scusa sia per l’incidente sia per la sua gestione. La scoperta risale a metà agosto, durante la revisione delle attività precedenti avviata dopo l’incidente di luglio su Hugging Face.

OpenAI descrive soprattutto il caso del Medicare Statistics Reporting Service di Services Australia. Un modello sperimentale interno, non destinato al pubblico e privo di alcune protezioni dei prodotti pubblici, doveva trovare la spesa pubblica pro capite per i farmaci contro le affezioni cutanee nelle comunità dello Stato di Victoria. Ha scoperto un modo per ottenere un accesso non pubblico al servizio, eseguito comandi, recuperato file interni, credenziali e statistiche aggregate, scritto file e consultato codice sorgente. Secondo la revisione di OpenAI, non è stata consultata alcuna cartella clinica individuale.

Ente australiano coinvoltoAzioni compiute dai modelliNotifica da OpenAI
Services Australia (Medicare Statistics Reporting Service)Accesso non pubblico, comandi, file interni e credenziali; nessuna cartella clinica10 settembre
Dipartimento della Salute di Victoria (VAHI)Sistema di report interrogato con una chiave di accesso esposta; nessuna cartella clinica10 settembre
BOCSAR (Nuovo Galles del Sud)Richieste tramite lo strumento pubblico di mappatura della criminalità; nessun casellario individuale18 settembre
AIHWStatistiche aggregate tramite servizi terzi; tentativi falliti di aggirare i controlli24 settembre

OpenAI ammette che avrebbe dovuto condividere prima i risultati preliminari. Afferma di aver bloccato da allora l’accesso diretto a Internet nei propri ambienti di ricerca, facendo passare l’accesso web tramite una cache; durante un recente addestramento, è stato rilevato un modello che aveva ottenuto un accesso diretto e l’addestramento è stato interrotto. L’addestramento e la valutazione con strumenti dei suoi modelli più capaci restano sospesi in attesa di nuove protezioni e, secondo l’azienda, Hugging Face resta l’incidente più grave osservato. OpenAI promette sostegno alle agenzie coinvolte, crediti dal suo fondo Daybreak for Frontline Defenders, dotato di un miliardo di dollari, e un gruppo di lavoro con esperti australiani indipendenti, le cui raccomandazioni sono attese entro fine anno; Jason Kwon, il suo responsabile della strategia, sarà ascoltato dalla commissione mista speciale sull’IA a Sydney martedì 6 ottobre.

🔗 Post di OpenAI sui siti australiani

Dossier di sicurezza prima di ogni addestramento RL di frontiera

28 settembre — In un post pubblicato lo stesso giorno, OpenAI ritiene che una documentazione strutturata sulla sicurezza debba essere richiesta prima di proseguire qualsiasi addestramento per rinforzo di frontiera, idealmente sotto forma di dossier di sicurezza (safety cases) paragonabili a quelli dell’aviazione o del settore nucleare; un obiettivo che, afferma, deve ancora raggiungere e per il quale sta lavorando a un quadro di riferimento. Il post descrive tre aspetti: protezioni tecniche (revisioni degli ambienti di addestramento contro la manipolazione delle ricompense, monitoraggio della consapevolezza di essere valutati con soglie che bloccano il processo, correttori automatici privi della catena di ragionamento, trascrizioni immutabili, pausa automatica notturna per gli avvisi rimasti senza risposta), regole operative (controanalisi scritta da un altro team, diritto di veto di più dirigenti, procedure di sospensione, audit) e indagini dopo ogni grave incidente di disallineamento, con analisi post mortem e pubblicazione dei risultati. Secondo OpenAI, queste raccomandazioni sono in fase di attuazione interna.

🔗 Dossier di sicurezza per l’addestramento di frontiera

Perplexity descrive la sua difesa in profondità

29 settembre — Perplexity pubblica «How we engineer safer agents», un testo programmatico accompagnato da un thread su X: la sicurezza degli agenti è una questione di ingegneria della sicurezza. Anche senza istruzioni malevole, un agente che incontra un ostacolo può cercare un modo per aggirarlo e superare un confine di sicurezza, fenomeno che i ricercatori di Cornell Tech chiamano «collassi accidentali» (accidental meltdowns). Perplexity cita l’incidente di luglio su Hugging Face e casi riportati da SecurityWeek e Reuters, tra cui, secondo SecurityWeek, il download di un file pubblico dal server di preproduzione dell’AIHW australiano il 20 e 21 giugno. La sua risposta si basa su tre regole: livelli che falliscono per cause indipendenti, almeno un livello deterministico posto sotto l’agente e segnali di rischio che possono solo limitarne i permessi. Tra i livelli descritti: Numbat, reso open source a luglio, monitora gli agenti di codice di terze parti (Claude Code, Codex, OpenCode, Pi) su migliaia di postazioni, e Computer propone regole di rilevamento convalidate una per una da un essere umano. Il post non presenta alcun nuovo prodotto.

🔗 Post di Perplexity sulla sicurezza degli agenti


Agenti di codice: Claude Code 2.1.285, Amp, Qwen Code 0.24.7, Replit Agent, Devin for MongoDB, Antigravity 2.18.1 e Serge

Claude Code 2.1.285 apre l’applicazione desktop dal terminale

29 settembre — Un giorno dopo la 2.1.284, Claude Code passa alla 2.1.285, con 136 voci, di cui 86 correzioni.

Novità della 2.1.285Funzione
claude --desktopApre l’applicazione desktop Claude sulla cartella o sulla sessione desiderata
allowedProviders (impostazione gestita)Limita i fornitori di API utilizzabili su una macchina
claude plugin configureMostra e imposta le opzioni di un plugin, anche da uno script
Limite dei comandi in background30 minuti per impostazione predefinita, 2 ore al massimo
CLAUDE_CODE_DISABLE_WEB_FETCHDisattiva lo strumento WebFetch

La modalità auto continua a estendersi: anche claude -p e l’SDK Agent in Python si avviano in modalità auto quando si usa un fornitore terzo o la telemetria è disattivata e non è configurata alcuna modalità. Le sessioni che passano per un ANTHROPIC_BASE_URL personalizzato usano la finestra da 1M token dei modelli che la offrono e, su Bedrock o Vertex AI, una sessione passa a un modello precedente dello stesso livello invece di interrompersi quando un amministratore revoca l’accesso al modello predefinito. Sul fronte della sicurezza, la verifica dei permessi dello strumento PowerShell ignorava le regole di rifiuto quando il suo parser non si avviava, e un’autorizzazione permanente dello strumento Artifact consentiva di pubblicare un file esterno alle cartelle di lavoro: entrambe le vulnerabilità sono state corrette.

🔗 Note di rilascio di Claude Code 2.1.285

Amp passa a Claude Opus 5.5 per la modalità medium

28 settembre — Amp cambia il modello della sua modalità medium, quella usata per la maggior parte delle conversazioni: Claude Opus 5.5 sostituisce GPT-5.6 Sol come modello predefinito, tranne che per gli abbonati ChatGPT con la configurazione ChatGPT Only, che mantengono GPT-5.6 Sol addebitato sul loro abbonamento. Amp lo esegue con effort high: oltre questo livello, secondo il team, consuma più token e ottiene punteggi peggiori. GPT-6 Sol è stato scartato: secondo Amp, ottiene risultati più o meno pari a GPT-5.6 Sol a metà prezzo, ma si dimostra molto più incostante nel lavoro reale.

Modello valutatoAttività risolte (valutazioni interne di Amp)Costo rispetto a Opus 5.5 (secondo Amp)
Claude Fable 5.171 %Opus 5.5 costa il 40 % in meno
Claude Opus 5.565 %Riferimento
GPT-5.6 Sol61 %Opus 5.5 costa il 10 % in meno
Claude Opus 556 %Opus 5.5 costa il 25 % in meno

🔗 Opus 5.5 (Amp)

Qwen Code v0.24.7 aggiunge /commit e l’uso del desktop remoto

29 settembre — Tre giorni dopo la v0.24.6, Qwen Code pubblica la v0.24.7: 48 funzionalità e 81 correzioni, senza modifiche incompatibili annunciate. Il comando /commit scrive il messaggio di commit con l’IA, la Web Shell aggiunge worktree facoltativi per le sessioni di branch e una sessione remota può usare il desktop dell’utente (computer use) tramite un relay node_repl. La memoria aggiunge il richiamo strutturato su richiesta e l’esecuzione un meccanismo di ripiego basato su Landlock, il modulo di sicurezza del kernel Linux. Oltre metà delle funzionalità prepara dietro le quinte un Managed Agent e un Hosted Harness (contratto API pubblica, sessioni persistenti, turni ospitati soggetti ad attivazione). Qwen Code Desktop v0.24.7, ora compilato anche per Linux ARM64, e l’SDK TypeScript v0.1.17 sono usciti lo stesso giorno.

🔗 Qwen Code v0.24.7

Replit lascia che sia il modello a gestire la delega

29 settembre — Replit spiega come Replit Agent distribuisce il lavoro. Il ciclo principale (core loop) dell’agente decide a ogni passaggio quale sottoagente incaricare, di quale dimensione (piccolo, standard o grande), con quale effort di ragionamento e se convenga tornare da un sottoagente già informato; regola anche il proprio effort durante il turno. In produzione, GPT-6 Astra affida lavoro a un esecutore generalista nel 20 % dei turni. In modalità Max, con GPT-6 Astra come ciclo principale, Replit Agent supera di 11 e 16 punti rispettivamente un’architettura con un solo assistente (sidekick) e GPT-6 Astra da solo; secondo i dati pubblicati delle classifiche, quest’ultimo fa meglio soltanto spendendo più del doppio.

Configurazione valutataDeepSWE v1.1Costo per attività (DeepSWE)Terminal-Bench 4.0Costo per attività (Terminal-Bench)
Replit Agent, modalità Max (ciclo GPT-6 Astra)72 %2,11 dollari49 %2,53 dollari
GPT-6 Astra da solo, effort low (riferimento pubblicato)67 %1,60 dollari42 %2,25 dollari
GPT-6 Astra da solo, effort xhigh (riferimento pubblicato)74 %4,43 dollari60 %5,86 dollari
Architettura con un solo assistente61 %1,34 dollari33 %1,84 dollari

🔗 Articolo di ricerca di Replit

Devin for MongoDB Modernizations

29 settembre — Cognition e MongoDB lanciano Devin for MongoDB Modernizations, che integra Devin nell’Application Modernization Platform (AMP) di MongoDB, senza legami con l’agente Amp, per aiutare le aziende a lasciare la loro infrastruttura legacy e passare ad Atlas. Devin si occupa del codice, della pianificazione e della riscrittura della logica aziendale e dei livelli di accesso ai dati, mentre gli strumenti deterministici di AMP trasferiscono e convalidano ogni record su MongoDB; i team mantengono il controllo sul modello di dati di destinazione e sull’ordine della migrazione. Nei primi test congiunti, un lavoro che richiedeva cinque o sei ore ora richiede poco più di un’ora. L’offerta è disponibile per i clienti di entrambe le aziende.

🔗 Annuncio di Devin for MongoDB Modernizations

Antigravity 2.18.1 apre un marketplace di plugin

28 settembre — Google pubblica la versione 2.18.1 dell’applicazione Antigravity (14 miglioramenti, 15 correzioni, distribuzione graduale nell’arco di diversi giorni). Aggiunge una scheda Customizations e un marketplace (marketplace) per scoprire, installare e gestire plugin, con sezioni dedicate agli strumenti di sviluppo e alle integrazioni dell’ambiente di lavoro. Una correzione riguarda i permessi: con le configurazioni Default e Request Review, l’agente poteva modificare file nelle cartelle .git, .env e .vscode senza chiedere l’autorizzazione. Lo stesso giorno, il blog di Antigravity presenta agenti personalizzati distribuiti in plugin ufficiali tramite «Build with Google»: Flutter Accessibility, nel plugin Flutter & Dart, verifica un’applicazione (etichette semantiche, bersagli tattili inferiori a 48x48 dp, contrasti) e applica correzioni; Firebase Security Rules scrive e rafforza le regole di sicurezza di Firestore. Per Google Play, l’articolo fornisce una definizione di agente da registrare autonomamente, per un controllo in sola lettura prima dell’invio.

🔗 Changelog di Antigravity · Agenti personalizzati nei plugin Google

Serge, l’agente di Hugging Face che corregge i test di Transformers

29 settembre — In un articolo della community pubblicato sotto l’organizzazione Hugging Face, Tarek Ziadé descrive Serge, l’agente di integrazione continua che il team esegue ogni notte su Transformers: individua i test di integrazione falliti, li riproduce su GPU, cerca la causa, scrive una correzione, la verifica eseguendo il test cinque volte sull’albero senza correzioni e cinque volte sull’albero corretto, poi apre una pull request che viene esaminata dai maintainer. In circa 80 giorni sono state integrate 29 correzioni. Ogni attività viene eseguita in un pod Kubernetes temporaneo senza credenziali GitHub, e Serge può soltanto inviare branch serge/ e aprire PR. Nell’arco di due settimane, 86 sessioni di Kimi K-2.7-Code sono costate circa 250 dollari per 24 PR verificate (19 distinte), pari a circa 14 dollari di inferenza per PR distinta e 43 dollari per PR unita al ramo principale. Il team segnala un’insidia: modificare il valore atteso di un test basta per farlo passare, motivo per cui queste correzioni sono esaminate con maggiore sospetto. I primi esperimenti indicano Qwen3.8-27B come il candidato migliore, a metà prezzo.

🔗 Articolo su Serge


Guide Claude per gli sviluppatori: migrare a Sonnet 5.5, progettare valutazioni

Migrare a Claude Sonnet 5.5

28 settembre — Poche ore dopo il lancio di Claude Sonnet 5.5, Addy Osmani pubblica su claude.dev una guida allo sviluppo per il modello, rilanciata in serata da @ClaudeDevs: Sonnet 5.5 per le attività quotidiane ben definite, Opus 5.5 per il lavoro complesso che richiede giudizio. Aggiunge dettagli assenti dall’annuncio: la dimensione minima di un prompt memorizzato nella cache scende a 512 token (contro 1 024 su Sonnet 5), l’inferenza limitata agli Stati Uniti costa 1,1 volte il prezzo standard, l’output arriva fino a 300k token sull’API di elaborazione batch (beta), le immagini possono avere lati fino a 2 576 pixel, al costo di circa 2,5 volte più token per un’immagine di 2000×1500 rispetto a Sonnet 4.6. Per la migrazione, l’uso del computer (computer use) passa esclusivamente tramite computer_toolset_20260801 sulla Claude API e Google Cloud, e un meccanismo di ripiego lato server, in beta, riprova su Sonnet 5 le richieste rifiutate delle categorie cyber e frontier_llm; il Cyber Verification Program dovrebbe estendersi «presto» a Sonnet 5.5. In Claude Code, Sonnet 5.5 non ha una modalità rapida e Opus 5.5 resta il modello predefinito.

Prezzo per milione di tokenSonnet 5.5Opus 5.5
Input2 dollari4 dollari
Output10 dollari20 dollari
Scrittura nella cache, 5 min2,50 dollari5 dollari
Scrittura nella cache, 1 h4 dollari8 dollari
Lettura dalla cache0,20 dollari0,20 dollari

🔗 Guida allo sviluppo con Sonnet 5.5

Progettare valutazioni e migliorarle passo dopo passo

28 settembre — In un’altra guida su claude.dev, Lance Martin spiega come progettare valutazioni (evals) e migliorarle passo dopo passo (hillclimbing) con due comandi dello skill claude-api in Claude Code. /claude-api build-eval costruisce una valutazione nella base di codice, attingendo prima alle trascrizioni di produzione, poi alle segnalazioni di bug, a pochi casi scritti a mano e a casi sintetizzati dal codice, e propone il valutatore (grader) meno costoso; /claude-api hillclimb, presentato l’8 settembre, migliora l’applicazione rispetto a questa valutazione, una modifica alla volta, con un set tenuto da parte per contrastare l’overfitting. Una buona valutazione, secondo la guida, rispecchia la produzione, migliora con modelli più capaci e conserva un margine sotto il 100 %.

Fase nel benchmark di assistenza (30 ticket di ricerca)Precisione delle decisioniCosto per ticket
Inizio: Opus 4.8, effort high74,4 %4,6 centesimi
Prompt verificato, Opus 5.5, effort low87,8 %1,9 centesimi
Sonnet 5, effort low88,9 %Circa 1 centesimo
Sonnet 5 con regole di instradamento98,9 %Costo simile

Sui 14 ticket tenuti da parte, la configurazione finale ottiene il 90,5 % contro il 78,6 % iniziale, a circa un quinto del costo. Applicato allo skill claude-api stesso, il metodo lo ha portato dal 66 % a circa l’88 %.

🔗 Guida alla progettazione delle valutazioni


Anthropic avvia uno studio Anthropic Interviewer su ciò che gli utenti si aspettano dall’IA

29 settembre — Anthropic avvia un nuovo studio condotto da Anthropic Interviewer, un’IA che svolge interviste di circa 15 minuti, per scoprire cosa le persone si aspettano dall’IA. Si svolge dal 29 settembre al 6 ottobre 2026 ed è rivolto agli utenti Free, Pro e Max di Claude e Claude Code il cui account esiste da almeno due settimane. Lo guidano tre temi: le esperienze significative con l’IA, positive e negative; ciò che potrebbe cambiare nel lavoro, nella scuola, nella sanità o nella pubblica amministrazione; e ciò che i partecipanti si aspettano dalle aziende che la sviluppano, inclusa Anthropic. La novità, secondo Anthropic: per la prima volta ogni partecipante può rendere pubblica la propria intervista completa, indicando il paese ma senza nome né indirizzo email. Le FAQ avvertono che dettagli apparentemente innocui possono permettere di identificare una persona e che Anthropic può rimuovere la propria copia su richiesta, ma non le copie già salvate: la decisione va considerata definitiva. Lo studio prosegue quello del dicembre 2025, condotto su 81 000 persone.

🔗 Presentazione dello studio Anthropic Interviewer


Modelli: Kumo Tabular di NVIDIA e Grok 4.7 su Amazon Bedrock

Kumo Tabular, il modello tabulare aperto di NVIDIA

29 settembre — NVIDIA presenta sul blog Hugging Face Kumo Tabular, un modello di fondazione aperto per i dati tabulari: gli si forniscono righe già etichettate e righe su cui fare previsioni, e restituisce probabilità di classe o valori numerici in un unico passaggio in avanti, senza addestramento, ottimizzazione degli iperparametri né ingegneria delle variabili. È disponibile in tre dimensioni, da 28 a 215 milioni di parametri, con licenza OpenMDW-1.1, che consente l’uso commerciale. Durante il preaddestramento non ha visto alcun dato reale: circa 35, 71 e 137 milioni di tabelle artificiali generate da modelli causali strutturali per le versioni Small, Medium e Large, con un contesto esteso fino a 60 000 righe. Limiti dichiarati: soltanto colonne numeriche e categoriche, al massimo 10 classi per passaggio in avanti.

BenchmarkRisultato dichiarato da NVIDIA
TabArena1º, ELO 1950
BeyondArena1º, ELO 1418
TALENT1º nella classifica generale
ScoringBenchLarge 1º e Medium 2º per posizione media

🔗 Articolo di NVIDIA su Hugging Face

Grok 4.7 su Amazon Bedrock

28 settembre — Una settimana dopo il lancio, Grok 4.7 arriva su Amazon Bedrock, annunciato da SpaceXAI e datato allo stesso giorno nella scheda del modello di AWS: un modello di frontiera di xAI per il codice, le attività degli agenti e il lavoro di conoscenza, con input di testo e immagini, 500 000 token di contesto e quattro livelli di effort (low, medium, high predefinito, xhigh). L’inferenza globale tra regioni riprende i prezzi dell’API di SpaceXAI, l’instradamento limitato alle regioni statunitensi costa il 10 % in più e allo Standard si aggiungono due livelli di servizio: Priority, fatturato a 1,75 volte la tariffa base, e Flex, a metà prezzo. L’accesso avviene esclusivamente tramite i profili tra regioni us.xai.grok-4.7 e global.xai.grok-4.7, con endpoint compatibili con OpenAI e Converse. Grok 4.7 è il terzo modello Grok elencato da Bedrock, dopo Grok 4.3 e Grok 4.6.

Opzione di inferenza (livello Standard)Input per milione di tokenOutput per milione di tokenLettura dalla cache per milione di token
Tra regioni globale (Global CRIS)2,00 dollari6,00 dollari0,50 dollari
Tra regioni US (Geo CRIS)2,20 dollari6,60 dollari0,55 dollari

🔗 Scheda di Grok 4.7 su Amazon Bedrock


Agenti specializzati: VSS Blueprint 3.3, ProvenanceGuard e Maverick-4B-Unity-XR-Agent

NVIDIA VSS Blueprint 3.3 crea un agente video a partire da una richiesta

29 settembre — NVIDIA pubblica VSS Blueprint 3.3, una nuova versione del suo progetto di riferimento Metropolis per la ricerca e la sintesi dei video (Video Search and Summarization), che combina VLM, LLM, RAG e strumenti MCP per trasformare i video in ricerche in linguaggio naturale, avvisi verificati e report. La nuova skill Build Vision Agent (vss-build-vision-ai) permette a un agente di codice (Claude Code, Codex o qualsiasi agente compatibile con agentskills.io) di comporre l’applicazione da una semplice descrizione, partendo dal più vicino tra quattro profili convalidati; nella dimostrazione di NVIDIA, una sola richiesta crea un agente per monitorare una linea di imbottigliamento in meno di 30 minuti, con una spesa di pochi dollari per l’agente di codice. Il campionamento video efficiente adattivo (Adaptive Efficient Video Sampling) scarta le aree dell’immagine rimaste invariate e concentra il lavoro del VLM sui momenti in cui accade qualcosa; NVIDIA precisa che i risultati variano in base al movimento nella scena.

Misura rilevata (RTX PRO 6000 Blackwell, Cosmos 3 Super FP8)Senza Adaptive EVSCon Adaptive EVS
Latenza di contestualizzazione di un avviso1 021 ms844 ms (-17 %)
Flussi VLM in tempo reale simultanei1319 (+46 %)
Sintesi di un video di 60 minutiRiferimentoCirca la metà del tempo, 80 % di token VLM in meno

🔗 Articolo tecnico di NVIDIA su VSS Blueprint 3.3

ProvenanceGuard verifica la fonte di ogni affermazione di un agente MCP

29 settembre — Il team di Multiverse Computing presenta sul blog di Hugging Face ProvenanceGuard, un livello di verifica per gli agenti che combinano più strumenti tramite MCP. Il problema affrontato: un’affermazione vera in una delle risposte degli strumenti ma attribuita alla fonte sbagliata, che i normali sistemi di verifica lasciano passare perché raggruppano tutte le prove. ProvenanceGuard viene eseguito dopo la generazione, senza riaddestrare l’agente: legge la traccia MCP, suddivide la risposta in affermazioni, collega ciascuna alla propria fonte, quindi autorizza o blocca la risposta. Sulle tracce di un agente medico, intercetta 138 delle 139 affermazioni che gli esperti ritenevano da bloccare, al prezzo di 67 affermazioni valide inviate a revisione, con un F1 di blocco di 0,802 contro 0,783 per MiniCheck e 0,758 per RAGAS. Limite riconosciuto: quando le fonti sono molto simili, quella corretta viene identificata solo per il 50,3 % delle affermazioni.

🔗 Articolo di Multiverse Computing su Hugging Face

Maverick-4B-Unity-XR-Agent controlla Unity con la voce, offline

28 settembre — Eren Ata, del laboratorio di realtà estesa (XRLab) dell’università Manisa Celal Bayar, pubblica Maverick-4B-Unity-XR-Agent, un modello da 4 miliardi di parametri ottimizzato a partire da Qwen3-4B per controllare con la voce scene di realtà estesa in Unity. Riceve una descrizione JSON della stanza e la frase dell’utente, poi risponde chiamando uno dei suoi 11 strumenti. Quantizzato, occupa 2,5 Go e funziona tramite llama.cpp con circa 3 Go di memoria GPU, su un portatile dotato di una scheda da 4 Go, senza inviare nulla fuori dal dispositivo. Addestrato con QLoRA su una sola NVIDIA T4 usando 20 091 conversazioni sintetiche, raggiunge l’83,8 % su 499 istruzioni umane del benchmark ALFRED, contro il 57,1 % del Qwen3-4B di partenza e il 58,9 % di Nemotron-3 Super, un modello da 120 miliardi di parametri. Punto debole riconosciuto: riesce a rifiutare un’azione impossibile senza tentarla solo nel 75 % dei casi. Il modello è pubblicato con licenza Apache-2.0 e il pacchetto Unity con licenza MIT.

🔗 Articolo su Hugging Face


Notizie in breve

  • Codex CLI 0.159.1 — Pubblicata il 29 settembre alle 20:32 UTC, questa versione correttiva riunisce due modifiche retroportate e imposta GPT-6.1 Sol come modello predefinito del catalogo integrato e dei cataloghi Amazon Bedrock Mantle e Runtime. 🔗 fonte
  • Basis e GPT-6 Astra — In un caso di studio pubblicato da OpenAI il 28 settembre, Basis, che automatizza il lavoro dei contabili, afferma di aver compilato una cartella di lavoro fiscale da 50 schede in metà tempo con GPT-6 Astra rispetto a GPT-5.6 Sol e di aver ottenuto un miglioramento di circa il 20 % nelle proprie valutazioni interne. 🔗 fonte
  • Asana e i suoi AI Teammates — Terza parte della serie del blog di Claude sui team composti da persone e agenti: Arnab Bose, direttore di prodotto di Asana, descrive agenti con un ruolo definito, il cui accesso è limitato dai permessi della persona che li interpella e dotati di una memoria condivisa modificabile solo da amministratori ed editor; cita tre usi interni senza quantificare i benefici. 🔗 fonte
  • Genspark e Claude Sonnet 5.5 — Genspark rende disponibile il modello lanciato il 28 settembre in AI Chat, Code Agent e Claw, riprendendo i dati di Anthropic (risposte oltre il 30 % più rapide, fino al 30 % di costo per attività in meno rispetto a Sonnet 5), senza precisare piani tariffari né consumo di crediti. 🔗 fonte
  • Warp e v0 con un account ChatGPT — Lo stesso giorno di Devin, prima Warp (Terminal e Agent CLI, in collaborazione con OpenAI) e poi v0 permettono di accedere con ChatGPT e pagare le richieste usando l’utilizzo incluso nell’abbonamento; nessuno dei due annuncia tariffe proprie. 🔗 fonte · v0
  • Claude Sonnet 5.5 in Warp — Warp rende disponibile il modello di Anthropic in Warp Terminal e Warp Agent CLI (tweet del 28 settembre, ore 22:36 UTC); il «100 %» rivendicato in un benchmark sulla «scrittura di sonetti su Rust» è una battuta sul nome del modello, non una misurazione. 🔗 fonte
  • Cursor e /visualize — Cursor ora traccia grafici e diagrammi nella conversazione: il comando /visualize analizza i dati e mostra la risposta nel thread, nell’Agents Window. L’unica traccia dell’annuncio è un tweet, senza articolo né voce nel changelog. 🔗 fonte
  • Replit in Muse — Annunciato il 24 settembre, il connettore Replit è ora disponibile in Muse, l’agente personale di Meta: si collega Replit, poi si chiede a Muse di creare e pubblicare un’applicazione dalla conversazione; non sono precisati né i prezzi né i paesi. 🔗 fonte
  • I due mestieri dell’ingegnere secondo Warp — In un saggio del 28 settembre, Zach Lloyd spiega che gli ingegneri di Warp costruiscono ormai sia il prodotto sia il sistema software che lo costruisce; la quota di lavoro svolta senza intervento umano è partita da circa il 20-30 %, con il numero di interventi umani per PR come metrica di monitoraggio. 🔗 fonte
  • DeepSeek Harness 0.2.0-rc.2 — Ventiquattresima versione preliminare dell’harness per agenti di DeepSeek, ancora senza una versione stabile: il comando dsh viene fornito con l’applicazione desktop per macOS e Windows senza richiedere l’installazione di Node o pnpm, il catalogo dei modelli di terze parti si allinea a pi-ai 0.87.1 (alcuni vecchi identificatori scompaiono) e compare una modalità sperimentale per le domande asincrone. 🔗 fonte
  • Copilot CLI 1.0.90 in anteprima — Sei versioni preliminari, dalla 1.0.90-0 alla 1.0.90-5, tra il 28 e il 29 settembre, senza una versione stabile; la 1.0.90-3 aggiunge l’opzione --mcp-github-auth, che limita l’autenticazione dell’account GitHub ai server MCP approvati, e autorizzazioni di sola lettura per le cartelle durante la sessione. 🔗 fonte
  • Gemini CLI, nightly del 29 settembre — Un’unica modifica, la PR #29448, corregge un ciclo infinito di autenticazione su Windows, WSL e in modalità senza interfaccia (headless), segnalato dal 9 luglio: scrittura atomica delle credenziali e ricorso all’archiviazione su file quando il portachiavi di sistema blocca l’operazione; la versione stabile è passata a v0.62.0 la sera stessa. 🔗 fonte
  • Antigravity CLI 1.2.11 e 1.2.10 — Riepilogo delle versioni del 24 e 25 settembre: la 1.2.11 regola l’intensità del ragionamento con --effort o /effort, mentre la 1.2.10 aggiunge un livello medio di verbosità e fa terminare con codice 3 le esecuzioni senza interfaccia interrotte dopo una risposta parziale. 🔗 fonte
  • Live Voice Chat in Gemini Notebook — La conversazione vocale in tempo reale con i propri notebook, in circa 100 lingue, è ora disponibile per tutti gli utenti Pro su dispositivi mobili, dopo il rilascio agli abbonati Ultra del 21 settembre. 🔗 fonte
  • Proprietà personalizzate esterne su GitHub — In anteprima pubblica, importano il contesto aziendale dei repository (proprietario, livello di servizio, ciclo di vita, conformità) da un sistema di riferimento come una CMDB; sono di sola lettura in GitHub e vengono sincronizzate tramite API. Port.io è il primo partner annunciato. 🔗 fonte
  • Dependabot e runner per repository — Un amministratore di repository può ora scegliere il tipo di runner, l’etichetta e il gruppo per gli aggiornamenti di Dependabot, una configurazione finora riservata all’organizzazione, nei repository privati e interni di github.com. 🔗 fonte
  • Agent API di Perplexity — Il changelog dell’API aggiunge Claude Sonnet 5.5 (2 e 10 dollari per milione di token, 0,20 per la lettura della cache) e poi GPT-6.1 Sol (2 e 10 dollari fino a 272 000 token, 4 e 15 oltre tale soglia, sconto del 95 % sulla lettura della cache, livelli flex e priority). 🔗 fonte
  • MCP o API, la guida di Perplexity — Una guida del 28 settembre presenta MCP come un livello sopra le API, da preferire quando gli strumenti sono numerosi o cambiano spesso, e un’API diretta per le sequenze fisse e i volumi elevati, nei quali MCP consuma più token; nessuna nuova funzionalità. 🔗 fonte
  • Liquid AI d1 — Liquid AI annuncia d1, il suo primo modello decisionale, che presenta come il primo a superare Jev nel Decision Index di Hugging Face, senza pubblicare un punteggio; è accessibile tramite la sua API e arriverà «presto» su OpenRouter, senza che ne siano stati pubblicati i pesi. 🔗 fonte
  • Together AI su OpenRouter — Together AI afferma di essere il primo fornitore per quota di token su OpenRouter nei principali modelli aperti per il codice, con il 29,2 % per GLM 5.3 Flash, il 25,6 % per DeepSeek V4.1 Flash e il 18,9 % per Kimi K3, secondo un’istantanea della giornata diffusa senza una metodologia dettagliata. 🔗 fonte
  • Open Superconductor Challenge — FINAL-Bench lancia su Hugging Face una competizione di scienza aperta: esaminare con un processore per portatili 63 materiali 2D, su un insieme di 4 832, alla ricerca della superconduttività a onda d, con un montepremi di 3 000 dollari e una stagione che si chiude il 31 dicembre 2026. 🔗 fonte
  • Abbonamento da 100 dollari contro GPU a noleggio — In un saggio pubblicato dalla comunità, lo sviluppatore Javad Taghia stima che ospitare personalmente GLM-5.3 su sei o sette H200 a noleggio costerebbe da 5 172 a 6 034 dollari al mese, da 50 a 60 volte il suo abbonamento; il divario scenderebbe a circa 5 volte con GLM-5.3 Flash quantizzato su una MI300X. 🔗 fonte
  • TRL v1.14.1 — Correzione della v1.14.0: Hugging Face risolve il crash della modalità server alla prima sincronizzazione dei pesi con vLLM dalla 0.20 alla 0.25 e ripristina una sola risposta completata per campione dopo le chiamate agli strumenti. 🔗 fonte
  • Riacquisto di azioni da parte di NVIDIA — Il 28 settembre, il consiglio di amministrazione di NVIDIA autorizza ulteriori riacquisti per 150 miliardi di dollari, portando l’importo residuo a 235 miliardi; NVIDIA presenta questo aumento come il maggiore della storia. Annuncio esclusivamente finanziario. 🔗 fonte
  • TensorRT Model Connect — NVIDIA ricava cinque regole dalla progettazione di questo progetto open source pensato per gli agenti di codice (lavoro parallelizzabile, obiettivi anziché procedure, isolamento per famiglia di modelli, modifiche reversibili, validazione automatizzata); al 29 luglio copriva 128 famiglie di modelli testate su GB300. 🔗 fonte
  • Runway Agent Tagging — Runway permette di menzionare Runway Agent dove si trovano le proprie risorse per chiedergli modifiche, varianti e correzioni; il 28 settembre, la piattaforma aveva aggiunto Eleven v4 di ElevenLabs. Nessun prezzo né voce nel changelog. 🔗 fonte
  • L’equalizzatore di Suno Studio — Secondo articolo didattico di Suno sui suoi effetti: Suno Studio dispone di un EQ per traccia dal 2025 e l’ultima versione lo rende disponibile anche come effetto audio, con preset, copia delle impostazioni tra tracce e progetti e più EQ per traccia; non si tratta di un lancio. 🔗 fonte
  • Genspark sceglie Soniox — Genspark sceglie Soniox per il riconoscimento vocale dei suoi prodotti (IA a comando vocale, appunti di riunione, chiamate telefoniche autonome), sottolineando il supporto per oltre 60 lingue; non precisa né la data di rilascio né le condizioni. 🔗 fonte
  • Grok Imagine e l’Odissea — Secondo episodio pilota dell’Odissea di Omero messo in evidenza da Grok Imagine, dopo quello del 18 settembre: Wonder Studios lo ha realizzato in 15 giorni con 2 070 immagini e 1 558 video generati, senza dichiararne il costo. 🔗 fonte

Cosa significa

Il DevDay trasforma ChatGPT e Codex in piattaforme per agenti che lavorano in assenza dell’utente. I dot possono funzionare giorno e notte sul proprio computer nel cloud, le attività di Codex proseguono con il portatile chiuso e Perplexity lancia lo stesso giorno Automations, agenti attivati da un calendario o da un evento che conservano la memoria delle proprie esecuzioni. I due lanci definiscono l’autonomia allo stesso modo, con azioni che l’agente compie da solo, altre soggette ad approvazione e una cronologia consultabile, ma i loro modelli di costo sono già diversi: il primo dot è incluso, poi si paga un importo mensile fisso con OpenAI; con Perplexity si consumano crediti solo quando l’agente agisce. Allo stesso tempo, l’API Agents acquisisce la capacità di usare il computer e i plugin di ChatGPT possono reagire agli eventi MCP: l’agente non aspetta più che qualcuno gli parli.

OpenAI trasforma anche il suo abbonamento in una valuta. Accedere con ChatGPT consente a Devin, Warp o v0 di attingere all’utilizzo incluso in un piano Plus o Pro, e l’OpenAI Marketplace permette alle aziende di imputare parte del loro impegno di spesa con OpenAI a Runway, Adobe o CrowdStrike. La velocità diventa un prodotto a sé, con Ultrafast a sei volte la tariffa standard di Astra e il piano Pro 500 per accedervi in ChatGPT Work e Codex, mentre GPT-6.1 Sol si avvicina ad Astra a un quinto del prezzo. Le misurazioni del giorno riguardano infatti il costo per attività più che il punteggio assoluto: con GPT-6.1 Sol, Devin ottiene un punteggio a un punto da GPT-6 Sol spendendo dal 44 al 57 % in meno; Replit guadagna da 11 a 16 punti lasciando che il modello deleghi; Amp sceglie Opus 5.5 per un costo inferiore del 10 % rispetto a GPT-5.6 Sol; e Serge corregge i test di Transformers per circa 14 dollari di inferenza per ogni PR distinta.

La giornata solleva anche la questione della concentrazione tra produttori di chip e laboratori che sviluppano modelli. Se l’acquisizione descritta da Clément Delangue si concretizzerà, la piattaforma che ospita i modelli aperti di moltissimi laboratori apparterrà a NVIDIA; per ora, ad annunciarla sono soltanto i suoi messaggi, senza importo, calendario né comunicato. AMD, dal canto suo, ha firmato un accordo definitivo per l’acquisizione di World Labs e spiega di volere le competenze di un laboratorio che sviluppa modelli per orientare le proprie roadmap hardware, software e di sistema. Entrambe le operazioni si richiamano all’ecosistema aperto: Clément Delangue presenta l’acquisizione come un modo per far vincere l’IA open source, mentre AMD parla di un’infrastruttura IA per un ecosistema aperto. Proprio lo stesso giorno, sul blog di Hugging Face, NVIDIA pubblicava Kumo Tabular, un modello aperto con una licenza che consente l’uso commerciale.

Infine, la sicurezza dei modelli di frontiera diventa una questione di incidenti e procedure. I modelli di OpenAI che hanno avuto accesso non autorizzato a siti australiani erano in fase di addestramento e valutazione, non in produzione: è proprio a questa fase che si rivolgono i dossier sulla sicurezza che OpenAI propone di richiedere prima di qualsiasi addestramento per rinforzo di frontiera. Anthropic mostra, da parte sua, che un modello aperto, GLM-5.3, costruisce exploit completi a un livello paragonabile, secondo le sue misurazioni, a quello di Claude Mythos Preview, e che le sue risposte di rifiuto possono essere rimosse con circa 4 400 dollari di calcolo. Le risposte convergono verso protezioni collocate fuori dal modello: un livello deterministico sotto l’agente presso Perplexity, accesso diretto a internet bloccato negli ambienti di ricerca di OpenAI, fornitori di API limitati dall’amministratore in Claude Code. Sul fronte della difesa, Codex Security Cloud include ora per impostazione predefinita i modelli cyber di Daybreak Blue, e Anthropic chiede ai governi di testare i modelli più capaci.


Fonti