ai-powered-markdown-translatorArticolo tradotto dal francese all’italiano con gpt-6.1-sol.
Anthropic aggiunge due funzioni a Claude, Claude Dashboards per dashboard mantenute aggiornate e Claude Motion per animazioni scritte in codice, e porta Docs, Slides e Design fuori dalla beta su tutti i piani, Free compreso. Lo stesso giorno, l’azienda lancia la sua Cyber Mission, con un programma di difesa delle infrastrutture critiche e OSS Scanner, che offre ai progetti open source scansioni gratuite con i suoi modelli più potenti. OpenAI introduce invece il livello Ultrafast per GPT-6.1 Sol, fino a 8 volte più veloce della modalità Standard, mentre Anthropic e NVIDIA si impegnano nella Genesis Mission, rispettivamente con 150 milioni e 1 miliardo di dollari.
Claude Dashboards e Claude Motion in beta, Docs, Slides e Design su tutti i piani
8 ottobre — Anthropic aggiunge due funzioni a Claude. Con Claude Dashboards, in beta sui piani a pagamento, si collega una piattaforma di dati aziendale (Amazon Redshift, BigQuery, ClickHouse, Databricks o Snowflake) o un altro connettore, come le opportunità di Salesforce, poi si pone una domanda in linguaggio comune: Claude scrive la query, costruisce la dashboard e la tiene aggiornata quando i dati cambiano. Un clic su un numero mostra la query che lo genera, e ogni grafico indica quando i suoi dati sono stati aggiornati. Anthropic lo destina a domande rapide ed esplorative; per approfondire, la dashboard viene trasferita ad Amplitude, Grafana, Hex, Mixpanel, Omni, Perplexity, PostHog o Sigma, in attesa di Looker, monday.com e Tableau.
Claude Motion, in beta su Team ed Enterprise, punta alle animazioni brevi: un video esplicativo di 30 secondi ricavato da un rapporto trimestrale, un grafico animato in una presentazione o una dimostrazione di prodotto. Poiché non interviene alcun modello di generazione video, l’animazione non contiene né sequenze né persone generate dall’IA.
Claude Motion turns reports, charts, or product walkthroughs into short animations. Claude writes each one as code, with no video model involved, so you can change any word, number, or timing, then export an MP4. In beta on Team and Enterprise plans.
🇮🇹 Claude Motion trasforma rapporti, grafici o dimostrazioni di prodotto in brevi animazioni. Claude scrive ciascuna di esse in codice, senza alcun modello video, così potete modificare qualsiasi parola, numero o tempistica, poi esportare un MP4. In beta sui piani Team ed Enterprise. — @claudeai su X
Lo stesso giorno, Claude Docs, Slides e Design perdono l’etichetta beta e diventano disponibili su tutti i piani, Free compreso. Secondo Anthropic, sono stati creati oltre 45 milioni di documenti, presentazioni e design dal loro arrivo nelle conversazioni, il 16 settembre. L’uscita dalla beta introduce il supporto a CMEK per gli artefatti, la scelta dei modelli di artefatti da parte degli amministratori, la modifica collaborativa con Claude, la condivisione al di fuori dell’organizzazione se l’amministratore la autorizza, esportazioni PowerPoint e PDF fedeli all’editor, l’invio diretto a Google Slides e la modifica dall’applicazione mobile.
| Funzione interessata | Stato all’8 ottobre | Piani interessati |
|---|---|---|
| Claude Dashboards | Beta | Piani a pagamento |
| Claude Motion | Beta | Team ed Enterprise |
| Claude Docs, Slides e Design | Uscita dalla beta | Tutti, Free compreso |
| claude.ai/design (sito autonomo) | Aperto fino al 14 dicembre | — |
Conseguenza pratica: il sito autonomo claude.ai/design, ora integrato in Claude, resta aperto fino al 14 dicembre. I sistemi di design (design systems) di un’organizzazione si migrano in un’unica operazione dalla pagina Artifacts, ma le conversazioni e i commenti del sito autonomo, così come i suoi link pubblici, scompariranno alla chiusura. In Enterprise, Dashboards e Motion sono disattivati per impostazione predefinita, mentre Docs, Slides e Design saranno attivati per impostazione predefinita il 15 ottobre.
🔗 Post di Claude: Dashboards e Motion · Thread di @claudeai
Runway e Luma, partner di lancio di Claude Motion
8 ottobre — Due aziende della generazione video si presentano come partner di lancio di Claude Motion. In Runway, qualsiasi animazione può essere esportata per aggiungervi sequenze generate, ritoccare le inquadrature descrivendo la modifica desiderata e far assemblare a Runway Agent un montaggio più lungo intorno all’animazione; lo stesso contenuto in 16:9 può anche essere adattato ai formati verticale e quadrato. In Luma, le animazioni si aprono direttamente grazie al connettore Luma (MCP) aggiunto in Claude: i modelli video Ray e Uni ne modificano lo stile mantenendo il movimento, le ritagliano in 9:16, 1:1, 4:3 o 21:9, e l’agente Luma ne produce altre versioni. Né Runway né Luma specificano tariffe o costi in crediti. Anthropic cita anche Adobe, Descript, HeyGen, Higgsfield e invideo tra gli strumenti con cui sviluppare ulteriormente un’animazione, mentre Canva e Captions sono annunciati in arrivo.
🔗 Post di Runway · Post di Luma
Anthropic Cyber Mission: un programma per le infrastrutture critiche e OSS Scanner per l’open source
8 ottobre — Due giorni dopo aver ampliato il suo Cyber Verification Program, Anthropic lancia l’Anthropic Cyber Mission, presentata come un impegno a lungo termine per rendere sicuri i sistemi da cui tutti dipendono. La constatazione iniziale viene da Project Glasswing: trovare vulnerabilità non è mai stato così facile, ma verificarle, stabilirne la priorità e correggerle resta difficile. La missione parte da due ambiti, le infrastrutture critiche e il software open source; sono annunciati altri ambiti, senza una data.
Per le infrastrutture critiche, il Critical Infrastructure Defense Program (CIDP) mette a disposizione dei fornitori di servizi degli operatori di tecnologie operative modelli Claude di frontiera, ingegneri sul posto e le ricerche di Anthropic sulle minacce: controllori, software di controllo e reti industriali nei settori dell’elettricità, dell’acqua o dei trasporti, che spesso non possono essere fermati per applicare una patch. Vi partecipano undici partner fondatori: Accenture, Booz Allen, CrowdStrike, Deloitte, Dragos, Hitachi, Insane Cyber, Nozomi Networks, Palo Alto Networks, PwC e Rockwell Automation. Il programma comincia con un piccolo gruppo e dovrebbe estendersi ad altri partner e settori nei prossimi mesi.
Per l’open source, OSS Scanner, ispirato a OSS-Fuzz di Google, offre gratuitamente ai progetti iscritti scansioni periodiche con i modelli più potenti di Anthropic, Claude Mythos compreso. Ogni rapporto comprende un caso per riprodurre la vulnerabilità, una spiegazione e, quando disponibile, una patch candidata, ma viene inviato senza revisione umana: Anthropic si aspetta un tasso di veri positivi superiore al 90 % e avverte che alcuni rapporti conterranno errori, come una gravità valutata male. Il servizio risponde al collo di bottiglia descritto dal team Frontier Red Team: le vulnerabilità individuate superano di gran lunga quelle che gli esseri umani possono vagliare.
| Indicatore pubblicato da Anthropic | Valore pubblicato |
|---|---|
| Vulnerabilità candidate individuate in sei mesi | Oltre 29 000 |
| Vulnerabilità esaminate e classificate manualmente | Circa 6 000 |
| Vulnerabilità di gravità critica o elevata verificate (48 progetti) | 97 |
| Accettate secondo i criteri richiesti per la divulgazione coordinata (CVD) | 85, ovvero 88 % |
| Reali ma duplicate, oppure non valide | 11 e 1 |
| Quota delle vulnerabilità individuate dagli LLM sul benchmark CyberGym | Meno del 20 % all’inizio dell’anno scorso, oltre l’85 % quest’anno |
wolfSSL indica che, su 74 rapporti ricevuti, tutti tranne due erano validi e cinque sono diventati CVE. L’iscrizione avviene tramite una pull request sul repository GitHub anthropics/oss-scanner, riservata ai maintainer principali di progetti ritenuti critici, valutati caso per caso, e il Defender Advantage Fund lanciato ad agosto mantiene gratuito il servizio. La previsione di Anthropic è prudente: entro due anni, l’IA favorirà la difesa, ma non necessariamente nel breve termine, poiché lo sfruttamento delle vulnerabilità costa meno mentre verifica, divulgazione e correzione restano lente.
🔗 Post di Anthropic: Anthropic Cyber Mission · Post di Frontier Red Team su OSS Scanner · Repository anthropics/oss-scanner
Ultrafast per GPT-6.1 Sol: fino a 8 volte più veloce, a 12 e 60 dollari per milione di tokens
8 ottobre — Annunciato come «in arrivo» il 29 settembre, il livello Ultrafast arriva su GPT-6.1 Sol. OpenAI Developers indica che viene distribuito il giorno stesso nell’API, in Codex e in ChatGPT Work, con un’intelligenza presentata come vicina a quella di GPT-6 Astra. OpenAI lo destina ai lavori in cui ogni secondo conta: eseguire il debugging di un guasto, far navigare agenti nelle applicazioni o offrire esperienze in tempo reale.
Ultrafast is rolling out today for GPT-6.1 Sol in the API, Codex, and ChatGPT Work. Near-Astra intelligence at up to 8x faster speeds than Sol Standard, so you can build as fast as the ideas come.
🇮🇹 Ultrafast viene distribuito oggi per GPT-6.1 Sol nell’API, in Codex e in ChatGPT Work. Un’intelligenza vicina a quella di Astra, fino a 8 volte più veloce di Sol in modalità Standard, per costruire alla stessa velocità con cui nascono le idee. — @OpenAIDevs su X
Nell’API, basta chiamare gpt-6.1-sol con service_tier: "ultrafast" nella Responses API. La modalità è disponibile a tutti gli utenti dell’API, nel rispetto dei rate limit, con elaborazione globale e residenza dei dati negli Stati Uniti e nell’Unione europea, mentre GPT-6 Astra in Ultrafast resta limitato alla residenza statunitense. La tariffa segue la regola già applicata ad Astra: sei volte il prezzo Standard, ovvero 12 dollari per milione di tokens in input e 60 dollari in output, cinque volte meno di GPT-6 Astra in Ultrafast (60 e 300 dollari).
| Modalità di elaborazione di gpt-6.1-sol | Prezzo in input | Input in cache | Scrittura della cache | Prezzo in output |
|---|---|---|---|---|
| Standard, contesto breve | 2,00 dollari | 0,10 dollari | 2,50 dollari | 10,00 dollari |
| Fast, contesto breve | 4,00 dollari | 0,20 dollari | 5,00 dollari | 20,00 dollari |
| Ultrafast, contesto breve | 12,00 dollari | 0,60 dollari | 15,00 dollari | 60,00 dollari |
| Ultrafast, contesto lungo | 24,00 dollari | 1,20 dollari | 30,00 dollari | 90,00 dollari |
Tariffe per milione di tokens, pagina Pricing dell’API all’8 ottobre.
In Codex e ChatGPT Work, l’accesso è riservato al piano Pro 500, agli spazi Enterprise idonei con fatturazione a consumo e alle offerte Edu a crediti. In Enterprise, Ultrafast è disattivato per impostazione predefinita e i proprietari dello spazio di lavoro devono attivarlo, per alcuni utenti o per tutti. La documentazione di Codex dettaglia il costo: le quote incluse nell’abbonamento si consumano 8 volte più rapidamente rispetto alla modalità Standard, e i crediti acquistati, così come l’utilizzo Enterprise a richiesta, vengono fatturati a un prezzo sei volte maggiore. Gli altri piani self-service non vi hanno accesso al lancio, nemmeno con crediti acquistati.
🔗 Changelog dell’API OpenAI · Tariffe dell’API OpenAI · Ultrafast in Codex (documentazione)
Scienza: 150 milioni di dollari di Anthropic e 1 miliardo di NVIDIA per la Genesis Mission, una mappa del cielo nell’ultravioletto
Due impegni nella Genesis Mission, il programma federale statunitense che vuole accelerare la scoperta scientifica tramite l’IA, sono stati annunciati l’8 ottobre allo stesso vertice, «Science: A New Golden Age», organizzato a Washington dall’Office of Science and Technology Policy (OSTP) della Casa Bianca. Lo stesso giorno, Anthropic mostra ciò che Claude Science può produrre per un astrofisico.
Anthropic: 150 milioni di dollari in tre anni e Claude per oltre 15 agenzie federali
8 ottobre — Anthropic impegna 150 milioni di dollari in tre anni nella Genesis Mission. Il finanziamento deve rendere Claude accessibile a oltre 15 agenzie che fanno parte della missione, tra cui la NASA, i National Institutes of Health e la National Science Foundation. Concretamente, Anthropic fornirà Claude, Claude Code e crediti API a diverse centinaia di progetti di ricerca, lavorerà con le agenzie e i laboratori nazionali sulle priorità dell’amministrazione, tra cui l’energia da fusione e l’informatica quantistica, e garantirà formazione e supporto tecnico. L’impegno prolunga la partnership avviata nel dicembre 2025 con il Dipartimento dell’Energia; a luglio, Google DeepMind (40 milioni di dollari) e OpenAI (17 milioni di dollari) avevano annunciato i propri impegni nella missione.
🔗 Post di Anthropic: impegno nella Genesis Mission · Tweet di @AnthropicAI
NVIDIA: 1 miliardo di dollari in cinque anni per la scienza statunitense
8 ottobre — Allo stesso evento, NVIDIA annuncia impegni per un valore di 1 miliardo di dollari in cinque anni, per sviluppare la capacità degli Stati Uniti nella ricerca e nello sviluppo sulla superintelligenza in ambiti come l’informatica quantistica, la salute e la sicurezza energetica. Il comunicato cita tre filoni, senza suddividere l’importo: il sostegno agli istituti di ricerca universitari, investimenti per accelerare la leadership statunitense nell’informatica quantistica e il sostegno ai fornitori cloud che supportano le missioni del governo. NVIDIA afferma inoltre di collaborare a diversi progetti finanziati durante la fase 2 della Genesis Mission, annunciati lo stesso giorno, nell’informatica quantistica, nella fusione, nella progettazione di acceleratori e nella microelettronica, e ricorda la sua partnership con il DOE, che comprende il più grande supercomputer scientifico del dipartimento, presso l’Argonne National Laboratory.
La prima mappa completa del cielo nell’ultravioletto, realizzata con Claude Science
8 ottobre — Il blog Anthropic Science racconta come Brice Ménard, astrofisico all’università Johns Hopkins e ricercatore presso Anthropic, abbia realizzato con Claude Science quella che Anthropic presenta come la prima mappa completa del cielo nell’ultravioletto. Il rilevamento spaziale GALEX (NASA, 2003-2013) ne copriva solo circa due terzi, con circa 38 000 osservazioni. Claude ha orchestrato agenti che hanno raccolto e calibrato tra loro i rilevamenti pubblici, poi colmato il terzo mancante mediante ricostruzione (inpainting), a partire dalla relazione tra l’ultravioletto e le altre lunghezze d’onda. Nelle zone mascherate intenzionalmente, le stime si discostano di circa il 10 % dalle misurazioni reali.
The work would have taken humans weeks of work, but, with Claude, just took a few days while Ménard worked on other projects.
🇮🇹 Questo lavoro avrebbe richiesto settimane alle persone, ma, con Claude, sono bastati pochi giorni mentre Ménard lavorava ad altri progetti. — @AnthropicAI su X
🔗 Articolo di Anthropic Science
Usi vietati e abusi: la politica d’uso 2026 di Anthropic e due operazioni di influenza smantellate da OpenAI
Due pubblicazioni dell’8 ottobre mostrano cosa vietano i laboratori e come individuano gli abusi: Anthropic riscrive la propria politica d’uso, OpenAI descrive due operazioni di influenza che ha bloccato.
Anthropic pubblica la versione 2026 della propria politica d’uso, in vigore dal 12 novembre
8 ottobre — Anthropic pubblica l’aggiornamento annuale della propria politica d’uso (Usage Policy), che entrerà in vigore il 12 novembre. Si tratta soprattutto di chiarimenti, basati sugli abusi osservati. Una nuova sezione raggruppa le regole sulle campagne ingannevoli e sull’attività artificiale, finora sparse nel testo, e riguarda qualsiasi attività ingannevole, politica o commerciale, compresa la creazione di strumenti per operazioni di influenza. La sezione elettorale, rinominata «non compromettere i processi democratici» (Do Not Undermine Democratic Processes), abbandona il divieto generale di targeting personalizzato degli elettori, che bloccava usi civici come l’informazione agli elettori in altre lingue. Il testo precisa anche che il divieto sulle armi comprende i relativi software e componenti, nonché l’armamento dei droni, vieta di tracciare persone senza il loro consenso e proibisce, solo nei casi estremi, comportamenti abusivi persistenti e gratuiti nei confronti dei modelli.
🔗 Articolo di Anthropic: aggiornamento 2026 della politica d’uso
OpenAI smantella Dark Clark e Bogus Bylines, tra cui la sua prima operazione di categoria 5
8 ottobre — OpenAI pubblica un rapporto su due operazioni di influenza clandestine che ha bloccato, le quali mantenevano attive entità fittizie (false front) con l’aiuto dei suoi modelli. «Dark Clark», di origine russa, prendeva di mira l’America Latina: i suoi operatori redigevano soprattutto i rapporti interni con ChatGPT e gestivano uno pseudo-centro di ricerca, il Social Research Center, animato da un personaggio fittizio, «Mia Clark». «Bogus Bylines», di origine iraniana, ha inserito quasi 100 articoli con sette false firme di giornalisti occidentali in una dozzina di testate online, una delle quali contava quasi 2 milioni di follower su Facebook. OpenAI afferma di aver portato alla luce 30 operazioni di questo tipo in due anni e mezzo.
| Operazione smantellata | Origine degli account | Bersaglio principale | Categoria sulla IO Breakout Scale (1 a 6) |
|---|---|---|---|
| Dark Clark | Russia | America Latina | 5, la prima secondo OpenAI |
| Bogus Bylines, articoli | Iran | Testate online internazionali | 4 |
| Bogus Bylines, commenti | Iran | Social network | 2 |
🔗 Rapporto di OpenAI sulle operazioni con entità di facciata fittizie
Claude Haiku 5.5 negli strumenti di terzi: GitHub Copilot lo rende disponibile già dal piano Pro, Devin lo valuta al 58,4 %
Lanciato il 7 ottobre, Claude Haiku 5.5 è arrivato lo stesso giorno in due strumenti per il codice, che lo confrontano entrambi con Claude Sonnet 5.
GitHub Copilot: Haiku 5.5 su tutti i piani a pagamento, Pro compreso
7 ottobre — Poco più di due ore dopo il lancio da parte di Anthropic, Claude Haiku 5.5 diventa generalmente disponibile in GitHub Copilot per i piani Pro, Pro+, Max, Business ed Enterprise: Pro compreso, come Claude Sonnet 5.5 e diversamente da GPT-6.1 Sol a fine settembre. Si può selezionare in dieci interfacce, da VS Code a Xcode. GitHub lo destina ai sottoagenti, alle modifiche rapide e alle attività nel terminale; secondo i suoi primi test, ha eguagliato Claude Sonnet 5 in numerose attività di programmazione con molti meno tokens e passaggi, senza pubblicare cifre. Viene fatturato al prezzo di listino: 0,10 dollari per milione di tokens in input e 0,50 dollari in output fino a 100 000 tokens in input, poi 0,50 e 2,50 dollari, ossia dieci volte meno di Claude Haiku 4.5 nella prima fascia.
🔗 Claude Haiku 5.5 in GitHub Copilot · Modelli e prezzi di GitHub Copilot
Devin: 58,4 % su FrontierCode 1.1, davanti a Claude Sonnet 5
7 ottobre — Cognition rende disponibile Claude Haiku 5.5 in Devin. Su FrontierCode 1.1, il suo benchmark proprietario che valuta i modelli su attività di ingegneria reali in base alla qualità del codice e alla sua idoneità al merge, Haiku 5.5 ottiene il 58,4 %, davanti a Claude Sonnet 5, a circa un ottavo del suo costo per attività secondo Cognition, che non fornisce un importo preciso. Entra anche tra gli assistenti (sidekicks) di Devin Fusion, che abbina un modello principale a un modello di supporto: con Claude Opus 5.5 come modello principale e Haiku 5.5 come supporto, Fusion mantiene un punteggio di 66,2 riducendo al contempo costo e latenza.
| Modello valutato da Cognition | Punteggio FrontierCode 1.1 Extended |
|---|---|
| Claude Sonnet 5 | 56,2 |
| Kimi K3 | 58,2 |
| Claude Haiku 5.5 | 58,4 |
| GPT-6.1 Sol | 60,4 |
| Claude Sonnet 5.5 | 64,4 |
| Claude Opus 5.5 | 65,3 |
Agenti per il codice: Claude Code 2.1.295, Codex CLI 0.162.0, Antigravity CLI 1.3.1, VS Code 1.141 e Delta 0.19
Cinque strumenti di agenti per il codice si evolvono: Claude Code rafforza i suoi hooks, Codex CLI gestisce i worktrees, Antigravity CLI ripensa la revisione delle modifiche, VS Code dispone le sessioni degli agenti in una griglia e Delta si apre al lavoro di squadra.
Claude Code 2.1.295: hooks che bloccano l’azione quando falliscono
8 ottobre — Claude Code ha ricevuto due versioni nella giornata. La 2.1.294 corregge gli hooks prompt e agent scritti come istruzioni in linguaggio naturale, che potevano lasciar passare ciò che avrebbero dovuto bloccare. La 2.1.295 conta 143 voci, di cui 97 correzioni. Con la nuova opzione onFailure: "block" degli hooks command e HTTP, un hook che non si avvia, supera il timeout o restituisce un codice inatteso blocca l’azione invece di lasciarla passare; diverse correzioni vanno nella stessa direzione, per le protezioni dei mods e le opzioni --tools e --restricted. Claude Code supporta anche il Program Status Protocol (OSC 7501), che consente ai terminali compatibili di mostrare se l’agente sta lavorando, è in attesa o ha terminato, e le descrizioni degli strumenti MCP caricate dalla ricerca degli strumenti passano da 2 048 a 16 384 caratteri.
🔗 Claude Code 2.1.295 · Claude Code 2.1.294
Codex CLI 0.162.0: worktrees gestiti e attività fissate
8 ottobre — Codex CLI 0.162.0, prima versione stabile dopo la 0.161.0 del giorno precedente, elenca 225 PR. Quando la funzione worktrees è attivata, Codex dispone di strumenti per creare ed elencare worktrees Git gestiti a partire da progetti locali attendibili, e il centro di comando degli agenti permette di fissare un’attività con il tasto p, in un gruppo «Pinned» condiviso quando il server lo consente. Il terminale introduce /copy per scorrere e copiare i blocchi della trascrizione, Ctrl+Insert per copiare una selezione e un’impostazione della velocità di scorrimento, e gli URL diventano cliccabili anche nelle approvazioni e nei prompt MCP. I provider di modelli personalizzati compatibili con la Responses API possono dichiarare l’accesso al web in tempo reale e la compattazione remota. Quanto alle correzioni, apply_patch preserva i fine riga CRLF, la sandbox Linux viene rafforzata e le versioni Windows ricevono un installer PowerShell firmato.
🔗 Note di rilascio di Codex CLI 0.162.0
Antigravity CLI 1.3.1: revisione ripensata in /diff, verbosità media predefinita
7 ottobre — La CLI di Antigravity ha pubblicato cinque versioni tra il 2 e il 7 ottobre. La 1.3.1 migliora la revisione del codice nel terminale: nella vista file di /diff, le frecce sinistra e destra aprono il file adiacente alla sua prima modifica, ogni file conserva la propria posizione, n e N passano al file successivo o precedente, e l’intestazione indica dove ci si trova. Le sue dieci correzioni riguardano in particolare /rewind nelle conversazioni molto lunghe, i plugins su Windows e le sessioni tramite chiave GEMINI_API_KEY, che ritentano quando la connessione all’API Gemini si interrompe. La 1.3.0 del 6 ottobre porta la verbosità predefinita da «high» a «medium», che raggruppa chiamate agli strumenti e riflessioni in riepiloghi concisi; /config permette di tornare indietro. In precedenza, la 1.2.16 affidava la generazione di immagini a un sottoagente integrato e la 1.2.15 introduceva binari Android per Termux.
🔗 Changelog di Antigravity, scheda CLI
VS Code 1.141: sessioni degli agenti in griglia e pulizia dei worktrees
7 ottobre — VS Code 1.141 si concentra sulle sessioni degli agenti di Copilot. La finestra Agents può disporre più sessioni in una griglia, e il comando Chat: Open Worktree Cleanup mostra lo spazio su disco occupato dai worktrees delle sessioni inattive per eliminarli, su richiesta o automaticamente una volta effettuato il merge della pull request. Le conversazioni avviate in Copilot CLI o nell’app GitHub Copilot compaiono fin dalla prima richiesta, senza ricaricare l’editor, e una conversazione Codex aperta nell’app ChatGPT o in Codex CLI può proseguire al suo interno con la propria cronologia: scegliendo un modello Copilot, si continua con il proprio abbonamento GitHub Copilot, per esempio dopo aver raggiunto il limite di utilizzo di ChatGPT. Per le aziende, la sandbox dell’harness Copilot può essere imposta tramite le impostazioni gestite, in anteprima, e questo harness diventa gradualmente la scelta predefinita per gli utenti con le sperimentazioni attivate.
🔗 Note di rilascio di VS Code 1.141
Delta 0.19: menzioni tra membri del team e posta in arrivo
7 ottobre — Zed Industries pubblica Delta 0.19.0, il suo ambiente per programmare insieme con gli agenti, seguito l’8 ottobre da una versione correttiva 0.19.1. Ora si può menzionare un membro del team in un messaggio o in un commento digitando @ seguito dal suo nome utente, e la notifica arriva in una nuova casella di posta in arrivo (Inbox). L’agente @delta legge e modifica gran parte delle impostazioni dalla conversazione. Un’impostazione, Agent Thread Creation, impedisce agli agenti di creare conversazioni di primo livello senza disattivare i sottoagenti, l’agente può unire i worktrees di più thread, e i comandi della CLI vengono eseguiti senza aprire una finestra. In totale, le note elencano 11 novità, 22 miglioramenti e 45 correzioni. L’8 ottobre, un articolo condiviso da Zed racconta come il team abbia sostituito Google Docs con Delta per i propri documenti interni.
🔗 Note di rilascio di Delta · Articolo di Delta sull’abbandono di Google Docs
Media generativi: Nano Banana 2.1, Brand Kit ed ElevenReader in Brasile per ElevenLabs, SemanTok di Stability AI
Quattro annunci su immagini, video e voce: un modello di immagini a metà prezzo da Google, un’identità visiva riutilizzabile e un’applicazione di lettura audio da ElevenLabs, e una ricerca sulla generazione video da Stability AI.
Nano Banana 2.1 generalmente disponibile nell’API Gemini, a metà prezzo
6 ottobre — Google ha reso Nano Banana 2.1 (gemini-nano-banana-2.1) generalmente disponibile nell’API Gemini e in Google AI Studio, senza un articolo sul blog. Questo modello di generazione e modifica delle immagini aggiorna Nano Banana 2, con una migliore qualità visiva, una migliore resa del testo, personaggi più coerenti da un turno all’altro e formati panoramici, da 1:4 a 8:1, senza artefatti di tiling in 2K e 4K. Accetta fino a 14 immagini di riferimento e si basa sulla ricerca Google. Il prezzo per immagine viene dimezzato in 1K e 2K, e Google depreca Nano Banana 2 (gemini-3.1-flash-image), senza una data di dismissione.
| Prezzo di output | Nano Banana 2.1 | Nano Banana 2 |
|---|---|---|
| Immagine 1K | 0,0336 dollar | 0,067 dollar |
| Immagine 2K | 0,0504 dollar | 0,101 dollar |
| Immagine 4K | 0,113 dollar | 0,151 dollar |
| Milione di tokens d’immagine | 30 dollars | 60 dollars |
🔗 Note di rilascio dell’API Gemini · Scheda di Nano Banana 2.1
Brand Kit di ElevenLabs: l’identità visiva raccolta nello spazio di lavoro
8 ottobre — ElevenLabs aggiunge Brand Kit a ElevenCreative, la sua suite creativa. Colori, font, loghi con le relative regole d’uso, immagini di riferimento e regole del brand, compreso ciò che il brand non fa mai, formano un unico oggetto dello spazio di lavoro, richiamabile con @ in Image & Video, in Flows o tramite l’agente ElevenCreative. Secondo il thread di ElevenLabs, un kit si crea in pochi minuti incollando l’indirizzo di un sito o caricando le risorse dell’organizzazione; tutto il team genera quindi contenuti a partire dalle stesse istruzioni, e un’agenzia può creare un kit per ogni cliente. ElevenLabs vuole estendere i kit alla voce e al suono del brand, senza indicare una data. Brand Kit è disponibile da subito, senza un prezzo specificato; HeyGen (agosto) e Runway (settembre) offrono già strumenti comparabili.
🔗 Articolo di ElevenLabs: Brand Kit · Thread di @ElevenLabs
SemanTok di Stability AI: un modello da 201M che eguaglia un modello 3,4 volte più grande
7 ottobre — Il team Interactive Research di Stability AI presenta SemanTok, un tokenizer video per i modelli del mondo (world models) che generano video token per token, annunciato su X l’8 ottobre. Nei tokenizers «dal grossolano al fine» (coarse-to-fine), i primi tokens descrivono la scena nel suo insieme e i successivi aggiungono i dettagli; SemanTok rende questi primi tokens più ricchi di significato, quindi più facili da prevedere. Per farlo, introduce nel proprio encoder caratteristiche DINO congelate e aggiunge teste leggere che le ricostruiscono a partire da ogni prefisso di tokens. Secondo Stability AI, un modello autoregressivo da 201M di parametri costruito su SemanTok eguaglia o supera un modello VideoFlexTok 3,4 volte più grande, e i prefissi brevi costano meno da prevedere. L’articolo è su arXiv; non vengono menzionati né codice né pesi.
🔗 Articolo di ricerca di Stability AI · Articolo su arXiv
ElevenReader arriva in Brasile con la voce di Fábio Porchat e 70 000 libri
8 ottobre — ElevenLabs lancia in Brasile ElevenReader, la sua applicazione che trasforma libri, documenti e articoli in contenuti da ascoltare, gratuita su iOS e Android, con la voce dell’attore e comico Fábio Porchat. Il catalogo si basa su una collaborazione con Bookwire Brasil: 70 000 titoli in portoghese brasiliano, concessi in licenza dai principali editori del paese, la maggior parte dei quali non aveva un’edizione audio. ElevenLabs ha anche prodotto Dom Casmurro, di Machado de Assis, letto da Fábio Porchat con musica originale e design sonoro. Secondo il direttore generale di Bookwire Brasil, è la più ampia selezione di libri brasiliani mai proposta in formato audio.
| Offerta in Brasile | Condizioni di accesso |
|---|---|
| Applicazione ElevenReader (iOS, Android) | Gratuita |
| Dom Casmurro letto da Fábio Porchat | Gratuito per tutti |
| 70 000 titoli su licenza Bookwire | Con ElevenReader Ultra, prezzo non indicato |
🔗 Articolo ElevenLabs: ElevenReader in Brasile
Modelli specializzati: LightOnOCR-3 per i documenti, Falcon-ASR per l’arabo, Carbon-A per i genomi
Tre modelli specializzati, di cui due con pesi aperti, per leggere documenti, trascrivere l’arabo e annotare genomi.
LightOnOCR-3: tre modelli OCR aperti che riconoscono anche l’impaginazione
8 ottobre — LightOn pubblica con licenza Apache 2.0 LightOnOCR-3, in tre dimensioni (0.8B, 1B e 4B). Oltre a trascrivere una pagina, i modelli sanno individuarne ogni regione: con il prompt di ancoraggio visivo (grounding), ogni blocco è preceduto da un riquadro di delimitazione etichettato, le immagini ricevono una breve descrizione e i grafici diventano tabelle HTML di dati. Su una H100, il 4B elabora il 21 % di pagine al secondo in più rispetto a Chandra-OCR-2, basato anch’esso su Qwen3.5. LightOn precisa che i suoi punteggi sono calcolati dopo una normalizzazione degli output, pubblicata insieme al repository, che modifica sensibilmente quelli di tutti i modelli di punta.
| Benchmark | LightOnOCR-3-4B | LightOnOCR-3-0.8B | LightOnOCR-3-1B | Riferimento citato |
|---|---|---|---|---|
| olmOCR-Bench, punteggio complessivo | 86,3 | 85,5 | 84,5 | Infinity Parser Pro (35,1B) 87,6 ; Chandra 2 85,8 |
| ParseBench, cinque categorie | 75,1 | 74,6 | 71,4 | Infinity Parser Pro 74,3 |
| fr-bench-pdf2md, documenti francesi | 74,1 | 70,5 | 69,6 | Chandra 2 69,0 ; MistralOCR4.1 54,1 |
Falcon-ASR: 1,6 miliardi di parametri per l’arabo emiratino, senza pesi pubblicati
7 ottobre — Il Technology Innovation Institute (TII) di Abu Dhabi presenta Falcon-ASR, un modello di riconoscimento vocale da 1,6 miliardi di parametri incentrato sull’arabo, e in particolare sul dialetto emiratino. Lo stesso insieme di pesi trascrive anche l’inglese, il francese, lo spagnolo e il portoghese, senza dover specificare la lingua, con un timestamp per ogni parola. Come Falcon-OCR-Arabic e Falcon-Emirati, presentati il giorno prima, è disponibile solo come demo: TII annuncia un accesso tramite API e applicazioni native, senza pubblicare i pesi.
| Valutazione del tasso di errore sulle parole (WER) | Punteggio di Falcon-ASR | Riferimento citato |
|---|---|---|
| Media di sei dataset arabi (Open Universal Arabic ASR) | 20,92 % | 23,17 %, miglior risultato pubblicato al 30 settembre |
| Emiratino, valutazione interna di TII | 22,73 % | Qwen3-Omni, secondo, 4,07 punti sopra |
| Media di sette dataset inglesi (Open ASR Leaderboard) | 5,74 % | Nessun riferimento citato |
Carbon-A: 566 milioni di geni candidati su 22 617 specie
8 ottobre — Il team di biologia di Hugging Face (HuggingFaceBio) pubblica Carbon-A, un modello da 1,2 miliardi di parametri con licenza MIT che individua le regioni codificanti proteine direttamente nell’ADN, con un unico modello per mammiferi, piante, funghi e protisti. Su 42 genomi di riferimento, raggiunge un F1 nucleotidico medio di 0,944 e supera, secondo gli autori, i sette strumenti messi a confronto, tra cui AUGUSTUS, Helixer e Tiberius. Il team lo ha eseguito sui genomi eucariotici di GenBank per costruire la Carbon Annotation Database: 48 167 assemblaggi di 22 617 taxa e 566 milioni di loci codificanti predetti, ossia 11 volte più taxa rispetto al corpus di addestramento. Una validazione in laboratorio con ActiveSite e l’UCSD, mediante sequenziamento dell’ARN a lunghezza completa, conferma una parte dei geni; gli autori precisano che ciò dimostra la trascrizione, ma non ancora la produzione delle proteine. Un nuovo lotto è previsto tra tre settimane.
Addestramento con apprendimento per rinforzo: i 1 004 ambienti di TermGrade e TRL v1.15.0
Due pubblicazioni per l’apprendimento per rinforzo: ambienti di terminale con punteggi e una libreria che permette di addestrare su sequenze più lunghe.
TermGrade: 1 004 ambienti di terminale valutati da sei modelli
8 ottobre — La società ai& pubblica TermGrade, 1 004 ambienti di terminale per addestrare e valutare agenti mediante apprendimento per rinforzo. Ogni attività viene eseguita in un container Linux con un’istruzione e dei test, ed è stata selezionata solo se la sua soluzione di riferimento superava i relativi test: su 66 165 attività candidate scritte da DeepSeek-V4-Pro, l’1,5 % ha superato questo filtro. Sei configurazioni di modelli aperti, da Kimi-K3 a gemma-4-31B-it, hanno affrontato ogni attività, e i 36 144 tentativi sono pubblicati, fallimenti compresi. Un modello impara di più dalle attività che riesce a completare circa una volta su due: addestrato su 151 attività in questa fascia, gemma-4-31B-it raggiunge 46,1 su Terminal-Bench 2.1, ossia 3,1 punti in più rispetto al modello di base, e 2,1 punti in media su cinque addestramenti. Tutto è pubblicato con licenza Apache-2.0.
🔗 Articolo TermGrade · Collezione TermGrade su Hugging Face
TRL v1.15.0: una testa LM fusa per sequenze fino a 6,9 volte più lunghe
8 ottobre — TRL v1.15.0, la libreria di addestramento di Hugging Face, introduce una testa LM fusa (fused LM head) che calcola direttamente le log-probabilità e l’entropia di ogni token con un kernel Triton, senza mai costruire il tensore completo dei logits; è attivata per impostazione predefinita per SFT, DPO, KTO, GRPO, RLOO e la distillazione. A 8 192 tokens, il picco di memoria si riduce dal 52 all’82 % a seconda del metodo. Queste misurazioni sono state effettuate su una B300 limitata a 79 Gio con i pesi casuali di gemma-3-1b, il cui vocabolario conta 262 000 tokens; il guadagno è maggiore per i modelli piccoli con un vocabolario ampio. La versione introduce anche incompatibilità: termina il supporto a Python 3.10, use_liger_kernel è deprecato e il trainer sperimentale MiniLLM viene rimosso.
| Metodo di addestramento | Lunghezza massima in v1.14.2 (tokens) | Lunghezza massima in v1.15.0 (tokens) | Fattore di guadagno |
|---|---|---|---|
| DPO | 10 240 | 59 392 | ×5,80 |
| KTO (batch di 2) | 9 216 | 63 488 | ×6,89 |
| GRPO | 28 672 | 114 688 | ×4,00 |
| RLOO | 23 552 | 100 352 | ×4,26 |
| SFT (perdita nll) | 20 480 | 107 520 | ×5,25 |
Inferenza: llama.cpp in Windows ML, ML Drift open source, Together AI su B300 di IBM Cloud
Tre annunci per eseguire i modelli, dal PC Windows al cluster di GPU.
llama.cpp arriva in Windows ML, in via sperimentale
7 ottobre — Durante il suo evento Windows, Microsoft aggiunge a Windows ML, il suo framework per l’inferenza locale, un supporto sperimentale per llama.cpp: si scarica un modello GGUF da Hugging Face e lo si esegue in locale tramite lo stesso stack Windows ML, usando nuove API dedicate a compiti specifici. Anche un’API di esecuzione nativa di Windows, di livello più basso, entra in anteprima sperimentale. Microsoft afferma di contribuire direttamente al progetto llama.cpp con NVIDIA e la community: kernel CUDA ottimizzati, migliore scheduling tra processore e GPU, CUDA graphs, decodifica speculativa (Eagle-3, MTP, D-Flash2), esecuzione su più GPU e formato NVFP4. L’articolo colloca queste novità sui PC dotati di chip NVIDIA RTX Spark, come il Surface Laptop Ultra. Su X, Georgi Gerganov, di llama.cpp, accoglie con favore la presenza del progetto all’evento Windows e vi vede il segno che gli stack software e hardware stanno finalmente convergendo.
🔗 Articolo Microsoft Foundry on Windows · Tweet @ggerganov
ML Drift: il motore GPU di LiteRT pubblicato in open source
8 ottobre — Il team Google AI Edge pubblica in open source, con licenza Apache 2.0, ML Drift, il suo motore di calcolo GPU per l’inferenza sul dispositivo. Nasconde le differenze tra OpenGL ES, OpenCL, Metal e WebGPU, funge da motore di accelerazione GPU per LiteRT, è disponibile come libreria autonoma e succede al delegato GPU di TensorFlow Lite, che non riceverà più nuove funzionalità. Il motore cambia kernel a seconda che il LLM legga il prompt o generi i suoi tokens, e fornisce una guida SKILL.md affinché gli agenti di programmazione scrivano e verifichino gli shader. È già in uso in produzione: fino al 40 % di latenza in meno per fotogramma per gli effetti di YouTube Shorts, e fino al 30 % di miglioramento per Lightroom e Photoshop su dispositivi mobili secondo l’articolo; su Gemma, Google misura fino al 12 % di memoria in meno rispetto ad altri framework software (frameworks).
🔗 Annuncio di ML Drift sul Google Developers Blog · Repository google-ai-edge/ml-drift
Together AI, primo cliente di un cluster di inferenza con GPU B300 su IBM Cloud
6 ottobre — Together AI annuncia di collaborare con IBM e NVIDIA per ampliare la propria capacità di inferenza destinata alle imprese, iniziando da un grande cluster di GPU NVIDIA B300 ospitato su IBM Cloud e collegato dalla rete Ethernet Spectrum-X di NVIDIA. Secondo Together AI, è il primo cluster dedicato all’inferenza di queste dimensioni su IBM Cloud, e la società ne è il primo cliente: gestisce il livello di inferenza, IBM fornisce il cloud e NVIDIA i chip e la rete. Together AI giustifica questa espansione con la domanda di modelli aperti: afferma di erogare ogni mese centinaia di migliaia di miliardi di tokens a più di un milione di sviluppatori. L’articolo non indica né le dimensioni del cluster né una tempistica.
🔗 Articolo di Together AI · Tweet @togethercompute
Notizie in breve
- Controllo più rapido di Codex — Nell’applicazione desktop ChatGPT, Codex recepisce prima un messaggio di follow-up inviato durante un’attività, per correggere un approccio o cambiare direzione; l’impostazione Follow-up behavior determina se questi messaggi orientano l’esecuzione in corso o attendono quella successiva. 🔗 fonte
- ChatGPT Go in Warp — Gli abbonati al piano ChatGPT Go possono ora usarlo in Warp per qualsiasi domanda sul terminale o attività di coding; secondo un membro del team Sign in with ChatGPT di OpenAI, citato da Warp, l’utilizzo incluso è disponibile per i clienti Go, oltre a Plus e Pro, in tutte le applicazioni partner. 🔗 fonte
- Oracle — Secondo un caso di studio di OpenAI, Oracle conta 130 000 utenti attivi di ChatGPT e oltre 95 000 di Codex; una ricerca sul mercato dei talenti che richiedeva da 2 a 4 giorni viene preparata in 15 a 20 minuti, e Codex traduce le domande aziendali in query SQL. 🔗 fonte
- Pollo AI — Questa piattaforma di creazione video, che dichiara oltre 26 milioni di utenti, instrada le richieste del proprio agente con GPT-5.6, affida i compiti difficili a GPT-6 Astra e tutte le immagini a GPT-Image-2.5, e afferma di ridurre di oltre il 50 % il tempo dedicato alla scelta di un modello. 🔗 fonte
- Note di rilascio di Devin del 7 ottobre — Un centro notifiche raccoglie gli avvisi delle sessioni, con invio al telefono configurabile, lo stato della coda di merge viene visualizzato in tutta l’applicazione e le chiavi private salvate come segreti vengono mascherate riga per riga nell’output dei comandi. 🔗 fonte
- Copilot CLI 1.0.94 — Diventata stabile dopo sei versioni preliminari, aggiunge Claude Haiku 5.5 al selettore dei modelli, trasmette il codice shell visualizzato al valutatore delle Assisted Permissions per evitare approvazioni inutili e permette di attivare un server MCP prima della sua discovery. 🔗 fonte
- Gemini CLI v0.65.0-nightly.20261008 — La telemetria accetta header OTLP personalizzati (
telemetry.otlpHeaders), una richiesta aperta dall’ottobre 2025; la CLI non entra più in un loop tra verifica e OAuth e la cronologia termina sempre con un messaggio dell’utente, evitando così un errore 400 dopo/rewind. 🔗 fonte - L’SDK Antigravity 0.1.21 isola le API sperimentali e configura le skills dei sottoagenti — Prima versione inserita nel changelog dalla 0.1.18 del 21 settembre: un decoratore
@betae un modulogoogle.antigravity.betaseparano le versioni preliminari dall’API stabile, eskills_configpermette a un sottoagente di ereditare le skills dell’agente padre, sostituirle o farne a meno. 🔗 fonte - Developer Knowledge API — Google presenta l’ecosistema di questa API, che fornisce la sua documentazione per sviluppatori (Google Cloud, Firebase, Android) in Markdown aggiornato: un comando
gcloud developer-knowledgepreinstallato in Cloud Shell, una skill per agenti di coding collegata a un server MCP, con riferimenti ad Antigravity, Claude Code, Cursor e GitHub Copilot, e librerie in sette linguaggi. 🔗 fonte - AQuA — Google Cloud pubblica, come implementazione di riferimento, questo agente di qualità (Ambient Quality Agent) che campiona fino a 1 000 sessioni di un agente ADK in produzione, raggruppa gli errori, li monitora in BigQuery e avvia una diagnosi delle cause con Gemini 3.8 Flash. 🔗 fonte
- Le bozze contano nei limiti delle pull request — Di fronte ai contributi di bassa qualità, GitHub permette di includere le pull request in bozza nei limiti per utente, mentre finora un collaboratore poteva aprirne senza alcun limite. 🔗 fonte
- Archiviazione delle pull request — Non è più riservata agli amministratori: i ruoli triage, write, maintain e admin possono archiviare una pull request, chiudendola, nascondendola al pubblico e bloccando ogni nuova attività, compresi i commenti degli amministratori. 🔗 fonte
- Cronologie di GitHub e lettori di schermo — I lettori di schermo percorrono le cronologie delle issue e delle pull request come elenchi, con il numero di elementi e la posizione corrente, e annunciano gli eventi caricati, su github.com e GitHub Enterprise Server 3.23. 🔗 fonte
- Paper Reproductions with ML Intern — Abubakar Abid annuncia presso Hugging Face una funzione che affida ad agenti la riproduzione indipendente degli esperimenti di un articolo pubblicato, a partire dalle Paper Pages, per produrre artefatti aperti che aiutino a individuare i lavori solidi; nessun dato numerico né documentazione. 🔗 fonte
- La chat di Hugging Face via SSH — Adrien Carreira, responsabile dell’infrastruttura di Hugging Face, presenta una chat con modelli aperti accessibile tramite il comando
ssh chat.hf.co, senza configurazione né chiave; non è accompagnata da documentazione né da un elenco di modelli. 🔗 fonte - huggingface_hub 2.2.0 — Piccola versione correttiva:
hf jobs statsrestituisce ora uno snapshot e poi restituisce il controllo (-fper seguire in tempo reale), tutti i download paralleli passano attraverso hf_xet e due modifiche interrompono la compatibilità. 🔗 fonte - swarmlab — Hugging Face ha reso disponibile, senza annunci, questo banco di prova che studia come sciami di agenti LLM di diversi fornitori trovino la verità o si dividano, in funzione della topologia degli scambi, dei ritardi e dei ruoli; basta una riga di YAML per testare un’ipotesi. 🔗 fonte
- Darwin-27B-ZTC — VIDRAFT pubblica sotto Apache-2.0 un valutatore che restituisce in un solo passaggio una distribuzione di probabilità sulle risposte possibili, senza generare token: 0,743 di accuratezza in zero-shot su 2 000 valutazioni di typed-decisions e un punteggio di Brier di 0,097, secondo i suoi autori. 🔗 fonte
- Superfluid — basecompute pubblica sotto Apache-2.0 questo server LLM locale, compatibile con le API di OpenAI, Anthropic e Ollama, che dà priorità alle domande interattive rispetto al lavoro degli agenti: 0,36 secondi di risposta con otto agenti attivi, contro oltre 10 secondi per llama-server, secondo i suoi autori. 🔗 fonte
- funes 1.8.0 — Lo strumento che indicizza le sessioni degli agenti di coding aggiunge un modello di embeddings multilingue: su 30 domande relative a 2 000 conversazioni in cinese, la conversazione corretta compare tra i primi otto risultati 30 volte su 30, contro 23, e il rango reciproco medio passa da 0,601 a 0,983. 🔗 fonte
- GLiNER e le lingue indiane — Un post della community mostra che, mantenendo i segni combinanti nelle parole, senza riaddestramento, il F1 medio in zero-shot di GLiNER2 passa da 13,2 a 68,0 su nove lingue indiane, e quello di un fine-tuning in hindi da 59,9 a 82,6. 🔗 fonte
- Multilingual Terminal-Bench — LILT descrive il proprio banco di prova di 324 attività di coding in dieci lingue: Claude Opus 5.5 supera Opus 5 di circa 3 punti con il 30 % di token in meno, per un costo per attività inferiore di circa il 45 %; Gemini 3.8 Flash richiede una mediana di 41 turni per attività, contro 5 per GPT-6 Sol. 🔗 fonte
- Primitive collettive GPU — Milos Kotlar prevede il tempo di comunicazione di cinque primitive su quattro RTX 4090 con il 10,9 % di errore medio, contro il 22,9 % per un modello comune, ma con un caso peggiore del 61,6 %. 🔗 fonte
- Best-of-N nel ragionamento video — facebookresearch pubblica online, senza annunci e sotto licenza non commerciale CC BY-NC 4.0, il codice dello studio Selecting or Solving? sulla selezione best-of-N e le giurie di verificatori nel ragionamento video. 🔗 fonte
- KDD Cup 2026 Data Agents — NVIDIA descrive l’harness che ha portato il suo team KGMON al secondo posto con un piccolo LLM imposto: dati convertiti in tabelle SQLite, schema fornito fin dall’inizio, un piccolo insieme di strumenti, lettura mirata dei documenti; il post non fornisce né un punteggio né il nome del modello. 🔗 fonte
- Microduck — Matthieu Lapeyre, di Pollen Robotics, annuncia oltre tre ore di autonomia con una batteria da 2 600 mAh per questo piccolo robot bipede dotato della nuova scheda elettronica interna, con un processore che raggiunge al massimo 60 °C invece di 114 °C. 🔗 fonte
- Album su Suno — Presentata il 5 ottobre, la funzione è operativa: si riuniscono i propri brani in una pubblicazione completa, si sceglie la copertina, si ordinano i brani e si pubblica al momento desiderato; non vengono precisati né il piano né il limite di brani. 🔗 fonte
- HeyGen e Ryan Serhant — HeyGen lancia una serie video quotidiana presentata dall’avatar ufficiale dell’agente immobiliare Ryan Serhant, apparso nella serie Netflix Owning Manhattan, su Instagram, TikTok e X; nessun dettaglio finanziario. 🔗 fonte
- Runway e la Tech Coalition — Runway aderisce a questa alleanza contro lo sfruttamento sessuale dei minori online e al suo programma Lantern di condivisione di segnali tra piattaforme, e ricorda le proprie misure di protezione: filtraggio dei dati, test avversariali, hashing, segnalazione al NCMEC e provenienza C2PA. 🔗 fonte
- SpaceXAI e Omarchy — SpaceXAI diventa sostenitore fondatore dell’Omacom Foundation con 1,5 milioni di dollari in token Grok; Grok 4.7 e i suoi successori alimenteranno gli agenti del progetto, tra cui Omabot, che esamina le pull request. 🔗 fonte
- Guida alle misure di protezione di Perplexity — Perplexity pubblica una guida che colloca le misure di protezione dell’IA in tre momenti (input, azione degli agenti, output), confronta cinque tipi di protezioni e illustra sette casi, dalla prompt injection all’allucinazione; nessuna nuova funzionalità. 🔗 fonte
- pplx-decider-v1.1-27b su OpenRouter — Il modello decisionale a pesi aperti di Perplexity arriva su OpenRouter alla tariffa della Decisions API: 0,02 dollari per milione di token in input, output gratuito, contesto di 262 000 token. 🔗 fonte
- Cohere a Ottawa — Cohere apre il suo primo ufficio a Ottawa, vicino al parco Lansdowne, dove lavorano già quasi 30 dipendenti (commercializzazione, ingegneria, infrastruttura, sicurezza, IA sovrana); non vengono indicate né la superficie né un obiettivo per il numero di dipendenti. 🔗 fonte
Che cosa significa
L’assistente ora produce oggetti di lavoro, non più soltanto risposte. Una dashboard Claude Dashboards si aggiorna quando cambiano i dati, un’animazione Claude Motion resta modificabile parola per parola perché è scritta in codice, e Docs, Slides e Design, usciti dalla beta per tutti i piani, dichiarano già oltre 45 milioni di creazioni. Questi oggetti circolano poi negli strumenti esistenti: la dashboard passa a Grafana o PostHog, l’animazione a Runway o Luma, che vi aggiungono sequenze generate. Il Brand Kit di ElevenLabs segue la stessa logica: l’identità visiva diventa un oggetto dello spazio di lavoro, richiamato tramite @, anziché un’istruzione da ripetere in ogni prompt.
La sicurezza cambia scala, sia sul versante della difesa sia su quello dell’applicazione delle regole. Anthropic constata che trovare vulnerabilità non è mai stato così facile: oltre 29 000 potenziali vulnerabilità in sei mesi, di cui circa 6 000 vagliate manualmente. OSS Scanner si assume la responsabilità di inviare rapporti senza revisione umana, con oltre il 90 % di veri positivi attesi, per ridurre questo collo di bottiglia. Parallelamente, le regole d’uso diventano più precise: la policy 2026 di Anthropic raggruppa le campagne ingannevoli in una sezione dedicata, e OpenAI presenta Dark Clark come la prima operazione di categoria 5 che abbia smantellato dall’inizio dei suoi rapporti. Negli strumenti, Claude Code 2.1.295 consente ora a un hook che fallisce di bloccare l’azione anziché lasciarla proseguire.
La velocità e il prezzo diventano impostazioni da scegliere. Ultrafast vende GPT-6.1 Sol a un prezzo sei volte superiore per raggiungere una velocità fino a 8 volte maggiore; secondo GitHub e Cognition, Claude Haiku 5.5 eguaglia o supera Sonnet 5 nel coding, a circa un ottavo del costo per attività secondo Cognition; Nano Banana 2.1 dimezza il prezzo di un’immagine 1K. L’inferenza si estende dal dispositivo, con llama.cpp in Windows ML e ML Drift sulle GPU di telefoni e computer, fino al cluster di B300 di cui Together AI è il primo cliente su IBM Cloud, e TRL riduce dal 52 all’82 % il picco di memoria di un addestramento a 8 192 token.
Infine, molti dei dati di oggi sono misurati da chi li pubblica. FrontierCode è il benchmark proprietario di Cognition, GitHub afferma che Haiku 5.5 eguaglia Sonnet 5 senza pubblicare dati numerici, LightOn calcola i propri punteggi dopo una normalizzazione che modifica quelli di tutti i modelli di punta, TII valuta Falcon-ASR in emiratino soltanto su un dataset interno e non ne pubblica i pesi, e gli autori di Carbon-A lo confrontano personalmente con sette strumenti. La scienza aperta offre un contrappunto: TermGrade pubblica i suoi 36 144 tentativi, compresi quelli falliti, Carbon-A la sua banca dati di 566 milioni di geni candidati, e la mappa ultravioletta di Claude Science distingue pixel per pixel ciò che è misurato da ciò che è previsto. I 150 milioni di dollari di Anthropic e il miliardo di NVIDIA per la Genesis Mission spingono nella stessa direzione: mettere questi strumenti nelle mani dei ricercatori.
Fonti
- Claude Dashboards e Claude Motion (post di Claude)
- Thread di lancio di Dashboards e Motion (@claudeai)
- Claude Motion (@claudeai)
- Runway e Claude Motion (Runway)
- Luma e Claude Motion (Luma)
- Anthropic Cyber Mission (Anthropic)
- OSS Scanner (Frontier Red Team di Anthropic)
- Repository anthropics/oss-scanner
- Ultrafast per GPT-6.1 Sol (@OpenAIDevs)
- Changelog dell’API OpenAI
- Tariffe dell’API OpenAI
- Ultrafast in Codex (documentazione)
- Impegno nella Genesis Mission (Anthropic)
- Annuncio della Genesis Mission (@AnthropicAI)
- NVIDIA si impegna a investire 1 miliardo di dollari per promuovere la scienza statunitense (NVIDIA)
- La mappa del cielo mancante (Anthropic Science)
- Mappa del cielo nell’ultravioletto (@AnthropicAI)
- Aggiornamento 2026 della politica di utilizzo (Anthropic)
- Smantellare le operazioni di facciata abilitate dall’AI (OpenAI)
- Claude Haiku 5.5 in GitHub Copilot (GitHub Changelog)
- Modelli e tariffe di GitHub Copilot
- Claude Haiku 5.5 in Devin (blog di Devin)
- Claude Code 2.1.295
- Claude Code 2.1.294
- Codex CLI 0.162.0
- Changelog di Antigravity, scheda CLI
- Note di rilascio di VS Code 1.141
- Note di rilascio di Delta
- Post di Delta sull’abbandono di Google Docs
- Note di rilascio dell’API Gemini
- Scheda di Nano Banana 2.1
- Presentazione di Brand Kit (ElevenLabs)
- Brand Kit (@ElevenLabs)
- SemanTok (Stability AI)
- Articolo SemanTok su arXiv
- ElevenReader in Brasile (ElevenLabs)
- LightOnOCR-3 (blog di Hugging Face)
- Falcon-ASR (blog di Hugging Face)
- Carbon-A e la Carbon Annotation Database (blog di Hugging Face)
- TermGrade (ai&)
- Raccolta TermGrade su Hugging Face
- TRL v1.15.0
- llama.cpp in Windows ML (Microsoft Foundry on Windows)
- llama.cpp all’evento Windows (@ggerganov)
- ML Drift (Google Developers Blog)
- Repository google-ai-edge/ml-drift
- Together AI, IBM Cloud e NVIDIA (blog di Together AI)
- Cluster B300 su IBM Cloud (@togethercompute)
- Note di rilascio di ChatGPT
- ChatGPT Go in Warp (@warpdotdev)
- Oracle (caso di studio OpenAI)
- Pollo AI (caso di studio OpenAI)
- Note di rilascio di Devin del 7 ottobre
- Copilot CLI 1.0.94
- Gemini CLI v0.65.0-nightly.20261008
- Changelog di Antigravity, scheda SDK
- Ecosistema della Developer Knowledge API (Google Developers Blog)
- AQuA, agente di qualità per gli agenti ADK (Google Developers Blog)
- Le pull request in bozza rientrano nei limiti delle pull request (GitHub Changelog)
- Gli utenti con ruolo Triage o superiore possono ora archiviare le pull request (GitHub Changelog)
- I lettori di schermo possono navigare nelle timeline come elenchi (GitHub Changelog)
- Riproduzione di articoli scientifici con ML Intern (@abidlabs)
- Chat tramite SSH (@XciD_)
- huggingface_hub 2.2.0
- Repository huggingface/swarmlab
- Darwin-27B-ZTC (blog di Hugging Face)
- Superfluid (blog di Hugging Face)
- funes 1.8.0 (blog di Hugging Face)
- GLiNER e le lingue indiane (blog di Hugging Face)
- Multilingual Terminal-Bench (blog di Hugging Face)
- Tempi di comunicazione delle primitive collettive GPU (blog di Hugging Face)
- Repository facebookresearch/best-n-selection-video-reasoning
- Lezioni dalla KDD Cup 2026 (blog tecnico NVIDIA)
- Autonomia di Microduck (@matth_lapeyre)
- Album su Suno (@suno)
- Serie quotidiana di Ryan Serhant (@HeyGen)
- Runway entra nella Tech Coalition (Runway)
- SpaceXAI, sostenitore fondatore (omarchy.org)
- Guardrails per l’AI (Perplexity)
- pplx-decider-v1.1-27b su OpenRouter
- Nuovo ufficio di Cohere a Ottawa (Cohere)