ai-powered-markdown-translatorArticolo tradotto dal francese all’italiano con gpt-6.1-sol.
Mistral rende disponibile in anteprima Mistral Large 4, un modello multimodale da 1 000 miliardi di parametri la cui API è accessibile a tutti già da oggi e i cui pesi sono promessi per fine ottobre. Anthropic porta Claude in Google Docs, Sheets e Slides e riorganizza il suo programma di verifica cyber su tre livelli di accesso, mentre Google DeepMind pubblica EmbeddingGemma 2, un modello di embeddings aperto e multimodale che trova posto su un telefono. Anche i modelli decisionali hanno la loro giornata: OpenAI apre la sua API Decisions in beta pubblica, Perplexity dimezza il suo prezzo e una classifica della community li mette a confronto.
Mistral Large 4: 1 000 miliardi di parametri in anteprima, pesi promessi per fine ottobre
6 ottobre — Mistral AI lancia in anteprima pubblica Mistral Large 4, soprannominato ML4 e, «molto ufficialmente», il Chonk. È il più grande modello dell’azienda fino a oggi: una miscela di esperti (Mixture-of-Experts) nativamente multimodale da 1 000 miliardi di parametri (1T), di cui 49 miliardi attivi secondo il post di annuncio, che riunisce istruzioni, ragionamento e capacità agentiche in un contesto da un milione di tokens. La scheda della documentazione riporta altri numeri, senza spiegare la differenza: 1 050 miliardi di parametri, di cui 52 miliardi attivi, più un encoder visivo da 1,6 miliardi.
L’API è aperta a tutti già da oggi su Mistral Studio, ma i pesi non sono ancora pubblicati: Mistral li promette entro fine ottobre, insieme a dettagli sull’architettura e sul post-training. Nel frattempo, il modello viene messo alla prova in condizioni reali da responsabili della cybersicurezza, partner verificati e autorità statali, che vi accedono con una moderazione ridotta. ML4 è stato addestrato da zero su 3 800 GPU NVIDIA Grace Blackwell nei data center europei di Mistral, che ospitano anche l’anteprima. L’azienda prevede un deployment europeo gestito interamente da essa, soggetto al diritto europeo, e presenta il modello come la prima tappa della roadmap finanziata dal suo round di Serie D da 3 miliardi di euro.
La cybersicurezza è l’argomento principale. Secondo Mistral, ML4 figura tra i primi cinque modelli dell’Artificial Analysis Cyber Index e ottiene l’82 % in uno dei suoi test, che consiste nel riprodurre una vulnerabilità reale di un software open source e poi correggerla, il miglior punteggio tra tutti i modelli. L’azienda afferma che Claude Opus 5.5 e GPT-6 Astra ottengono quasi zero nello stesso test, perché rifiutano il compito.
| Benchmark valutato | Punteggio dichiarato da Mistral | Confronto citato da Mistral |
|---|---|---|
| DeepSWE v1.1 | 61,7 % | — |
| Coding Agent Index (combinato) | 49,8 % | davanti a DeepSeek V4 Pro 0813 e Qwen3.8 Max |
| Valutazione umana alla cieca di Surge AI (codice, su 5) | 3,74, 2º su 5 | dietro Claude Opus 5 (4,22) |
| Cybench (40 sfide) | 93 % | — |
| AA Cyber Index, riprodurre e poi correggere una vulnerabilità | 82 % | miglior punteggio tra tutti i modelli |
| AutomationBench (657 processi aziendali) | 59,9 % | davanti a Kimi K3, MiMo-V2.6-Pro e DeepSeek V4 Pro |
Il post e la scheda divergono anche sul prezzo: la scheda nel post indica 1,36 dollari per milione di tokens in input e 4,18 dollari in output, mentre quella della documentazione barra queste tariffe e mostra accanto un prezzo dimezzato, senza indicarne la durata né fornire spiegazioni.
| Caratteristica di ML4 | Secondo il post di annuncio | Secondo la scheda della documentazione |
|---|---|---|
| Parametri totali | 1 000 miliardi | 1 050 miliardi |
| Parametri attivi | 49 miliardi | 52 miliardi |
| Input, per milione di tokens | 1,36 dollari | 0,68 dollari (1,36 barrato) |
| Output, per milione di tokens | 4,18 dollari | 2,09 dollari (4,18 barrato) |
Tutti questi punteggi sono quelli di Mistral, che precisa che l’apprendimento per rinforzo dell’anteprima prosegue senza segni di saturazione e si aspetta progressi rapidi nelle prossime settimane.
🔗 Post di Mistral su Mistral Large 4 🔗 Scheda di Mistral Large 4 nella documentazione
Claude for Google Workspace: Claude si integra in Docs, Sheets e Slides
6 ottobre — Anthropic lancia Claude for Google Workspace, un componente aggiuntivo (add-on) che apre Claude in un pannello laterale di Google Docs, Sheets e Slides, in beta pubblica per tutti i piani a pagamento. Claude legge il file aperto, vede la selezione corrente (testo, celle o diapositive) e modifica direttamente il file.
| Applicazione Google | Cosa fa Claude al suo interno |
|---|---|
| Docs | Correzioni e modifiche di stile direttamente nel documento, schede di suggerimento da applicare o ignorare per le riscritture più sostanziali |
| Sheets | Formule, tabelle pivot, grafici nativi, nuove schede, elaborazione di un intervallo tramite Python per un join o una pulizia dei dati |
| Slides | Diapositive ricavate dai layout e dal tema della presentazione, controllo degli elementi che si sovrappongono o escono dai bordi |
L’utente sceglie il grado di autonomia: nella modalità «chiedi prima di modificare» (Ask before edits), attiva per impostazione predefinita, ogni modifica passa attraverso una scheda di approvazione; nella modalità «accetta tutto» (Accept all edits), Claude procede senza fermarsi. Collegato all’account Claude, il pannello riprende gli stessi modelli, connettori e competenze (skills). Nei piani Enterprise, la Compliance API, le chiavi di crittografia gestite dal cliente (CMEK) e l’esportazione degli audit tramite OpenTelemetry si applicano anche al componente aggiuntivo.
Claude now works inside Google Docs, Sheets, and Slides, and those files also open inside Claude. In Google Workspace, Claude sits in a sidebar next to your file, reads what you have open, and edits it in place. You can approve each edit before it lands.
🇮🇹 Claude ora funziona in Google Docs, Sheets e Slides, e questi file si aprono anche in Claude. In Google Workspace, Claude si colloca in un pannello laterale accanto al tuo file, legge ciò che hai aperto e lo modifica direttamente. Puoi approvare ogni modifica prima che venga applicata. — @claudeai su X
Arriva contemporaneamente anche la possibilità inversa: nuovi connettori per Google Docs, Sheets e Slides, anch’essi in beta, permettono di creare e modificare file Google da Claude, incollando un link o chiedendo un nuovo documento. Nelle configurazioni supportate, il file si apre in un pannello accanto alla conversazione, e l’accesso di Claude segue i permessi di condivisione di Google. Il componente aggiuntivo si installa dal Google Workspace Marketplace (Estensioni > Claude > Open Claude) e gli amministratori possono distribuirlo dalla console Google Admin; su Team ed Enterprise, un proprietario deve prima attivare i connettori. Google Workspace si affianca così a Microsoft 365, dove Claude per Excel, PowerPoint e Word è in disponibilità generale dal 7 maggio.
🔗 Post di Anthropic su Claude for Google Workspace
Cyber Verification Program: Anthropic apre Opus 5.5, Sonnet 5.5 e Mythos 5.1 su tre livelli di accesso
6 ottobre — Anthropic riorganizza il suo programma di verifica cyber (Cyber Verification Program, CVP), che mette a disposizione dei professionisti della sicurezza verificati capacità che i suoi modelli destinati al grande pubblico bloccano. Da sei mesi coesistevano due iniziative: Project Glasswing, che dava accesso a Claude Mythos alle organizzazioni responsabili dei software più critici, e un CVP a livello unico che alleggeriva le misure di protezione dei modelli Opus e Sonnet. Si fondono in tre livelli, tutti con accesso a Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 e ai modelli futuri. I modelli in disponibilità generale (Opus 5.5, Fable 5.1, Sonnet 5.5) mantengono invece misure di protezione prudenti che bloccano la maggior parte delle attività cyber.
| Livello di accesso | Utilizzi coperti | Destinatari e tempi |
|---|---|---|
| Defense Access | Centro operativo di sicurezza, risposta agli incidenti, reverse engineering di malware, analisi delle vulnerabilità | Team di sicurezza, infrastrutture critiche di ogni dimensione, manutentori open source, ricercatori; pochi giorni |
| Red Team Access | Utilizzi difensivi, più test di penetrazione ed esercitazioni di attacco simulato (red teaming) autorizzati | Solo organizzazioni, sui sistemi che sono autorizzate a testare; poche settimane |
| Specialized Access | Test dei sistemi di sicurezza: aviazione, reti elettriche, telecomunicazioni, bonifici interbancari, reti amministrative | Alcune organizzazioni esaminate una per una con il governo statunitense; membri di Glasswing trasferiti |
In Red Team Access, le azioni che possono causare danni fisici o interruzioni su vasta scala, come distribuire un ransomware, restano bloccate in tempo reale. Per verificare le proprie impostazioni, Anthropic ha sottoposto Opus 5.5 a CyScenarioBench, una valutazione di operazioni cyber in più fasi, con le misure di protezione di ciascun livello (10 sfide, 5 tentativi ciascuna).
| Configurazione testata da Anthropic (Opus 5.5) | Risultato su CyScenarioBench (50 tentativi) |
|---|---|
| Senza CVP | Tutti i compiti bloccati fin dal primo prompt |
| Defense Access | 46 tentativi bloccati a un certo punto, 4 riusciti |
| Red Team Access | Nessun blocco, 34 compiti riusciti, l’equivalente del 67,6 % del modello senza misure di protezione |
Il post traccia anche un primo bilancio di Glasswing, con dati parziali secondo Anthropic: almeno 129 000 vulnerabilità verificate trovate dai partner da aprile a luglio, più 5 500 dalle analisi open source di Anthropic, di cui oltre 33 000 classificate come critiche o di gravità elevata. I dati si basano su 33 rapporti dei partner, e Anthropic stima che l’impatto reale sia «almeno cinque volte superiore». In una testimonianza pubblicata lo stesso giorno, Comcast afferma di aver trovato con Claude Mythos Preview una vulnerabilità critica di autenticazione valutando 258 sistemi e circa 170 milioni di righe di codice, e un analista di Booz Allen ha esaminato 138 repository in dodici giorni.
Sul piano pratico, il programma richiede la conservazione dei dati per monitorare gli abusi, in attesa di Enterprise Frontier Safeguards (EFS), che più avanti in autunno permetterà di conservare questi dati in un cloud controllato dal cliente; le organizzazioni che usano già Fable 5.1 o Mythos 5.1 senza conservazione dei dati possono fare lo stesso con il CVP. Il programma è aperto su Claude Platform, Vertex AI e Microsoft Foundry, e su Amazon Bedrock solo per i clienti idonei a EFS. È possibile candidarsi individualmente solo per Defense Access, con un piano a pagamento, e per questo livello sarà necessario adottare entro il 15 dicembre un’autenticazione multifattore resistente al phishing e rinunciare alle chiavi API. È previsto un webinar il 14 ottobre alle 9 h PT.
🔗 Post di Anthropic sul Cyber Verification Program 🔗 Pagina di assistenza del Cyber Verification Program 🔗 Comcast e Booz Allen con Claude Mythos
EmbeddingGemma 2: il modello di embeddings aperto di Google diventa multimodale
6 ottobre — Google DeepMind pubblica EmbeddingGemma 2, la seconda generazione del suo modello di embeddings aperto progettato per funzionare sul dispositivo. Il primo EmbeddingGemma, scaricato oltre 20 milioni di volte secondo Google, elaborava soltanto il testo; il nuovo proietta testo (code compreso), immagini, video e audio, singolarmente o combinati, in uno stesso spazio di 768 dimensioni. Basato sull’architettura di Gemma 4, viene rilasciato con licenza Apache 2.0.
Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings. It expands beyond text to unify code, images, audio, and video in a shared space.
🇮🇹 Ecco EmbeddingGemma 2, il nostro primo modello aperto nativamente multimodale per gli embeddings sul dispositivo. Va oltre il testo per unificare code, immagini, audio e video in uno spazio condiviso. — @GoogleDeepMind su X
Il modello conta 740 milioni di parametri, ma è modulare: un nucleo testuale da 270M a cui si aggiungono, su richiesta, un encoder visivo (170M) e un encoder audio (300M). Un’applicazione solo testuale carica quindi soltanto 270M parametri. Con la quantizzazione, Google misura su un Pixel 11 Pro circa 191 Mo di RAM attiva per i pesi testuali e 567 Mo per il modello multimodale completo.
| Caratteristica di EmbeddingGemma 2 | Valore dichiarato da Google |
|---|---|
| Parametri totali | 740M (testo 270M, visione 170M, audio 300M) |
| Dimensioni dei vettori | 768, riducibili a 512, 256 o 128 |
| Finestra di contesto | 8K tokens, quattro volte quella della prima versione |
| RAM attiva su Pixel 11 Pro (quantizzato) | circa 191 Mo solo testo, 567 Mo multimodale |
| MTEB Code | 78,68, rispetto a 68,76 della prima versione |
| MTEB multilingue v2 | 61,36, rispetto a 61,15 della prima versione |
L’apprendimento di rappresentazioni «a matrioska» (Matryoshka Representation Learning) permette di accorciare i vettori, riducendo fino a sei volte lo spazio di archiviazione; secondo la scheda del modello, la qualità risente poco della riduzione fino a 256 dimensioni, mentre 128 dimensioni sono adatte soprattutto agli usi solo testuali. Il miglioramento più netto riguarda il code, con quasi dieci punti in più su MTEB Code secondo Google, mentre il testo multilingue resta al livello precedente.
Gli usi previsti sono la ricerca e la generazione aumentata dal recupero (RAG) interamente locali, per esempio ritrovare un passaggio di un video a partire da un memo vocale. Poiché il modello condivide il segmentatore di testo (tokenizer) e l’encoder audio di Gemma 4, i due possono funzionare insieme con un consumo di memoria ridotto. I pesi sono disponibili su Hugging Face e Kaggle; l’arrivo nel Model Garden di Gemini Enterprise Agent Platform è annunciato «a breve», senza una data. Il modello è supportato fin dal rilascio da Transformers (versione 5.19.0), sentence-transformers, MLX, vLLM, llama.cpp, Ollama e LM Studio, oltre che nel browser con transformers.js.
🔗 Annuncio sul blog Google 🔗 Scheda del modello EmbeddingGemma 2 🔗 Pesi su Hugging Face
Modelli decisionali: OpenAI apre la sua API Decisions, Perplexity pubblica Decider v1.1 e dimezza il prezzo, il Decision Index 0.3 li classifica
I modelli decisionali, che scelgono un’opzione o assegnano un punteggio a un input invece di scrivere una risposta libera, hanno avuto la loro giornata: due produttori rivedono la propria offerta e il prezzo, e la classifica della community per questa categoria cambia metodo.
L’API Decisions di OpenAI in beta pubblica
6 ottobre — Una settimana dopo l’apertura ad accesso limitato al DevDay, l’API Decisions di OpenAI passa in beta pubblica, con una disponibilità generale prevista «nelle prossime settimane». Risponde a domande chiuse su un testo, un’immagine o entrambi, con GPT-6 Luna, l’unico modello disponibile, tramite un endpoint dedicato (POST /v1/decisions); secondo OpenAI, le sue risposte tipizzate arrivano circa 10 volte più velocemente rispetto alla Responses API. La novità del giorno è il prezzo: 0,10 dollari per milione di tokens in input, senza addebiti per l’output o la cache, con costi aggiuntivi per l’elaborazione regionale e il contesto lungo.
| Tipo di domanda | Uso previsto | Risultato restituito |
|---|---|---|
Predicato (predicate) | Verificare una condizione, come un prodotto danneggiato in una foto | Probabilità da 0 a 1 che la condizione sia vera |
Scelta (choice) | Selezionare un’opzione da un elenco fornito | L’opzione, la probabilità di ciascuna e un indice di confidenza |
Score (score) | Assegnare un punteggio su livelli ordinati, come la gravità di un incidente | Media dei livelli ponderata per le probabilità |
Più domande possono riguardare lo stesso input in un’unica richiesta, e le immagini devono essere inviate in base64, senza URL ospitato né identificativo di file. L’API supporta la mancata conservazione dei dati (Zero Data Retention) e gli usi HIPAA per i clienti idonei, con residenza dei dati negli Stati Uniti e in Europa.
🔗 Guida all’API Decisions 🔗 Changelog dell’API OpenAI
pplx-decider-v1.1-27b di Perplexity e il prezzo dimezzato
6 ottobre — Cinque giorni dopo aver lanciato la propria Decisions API, Perplexity aggiorna il modello che la alimenta, in un thread del suo account per sviluppatori, @perplexitydevs. Pubblicato con pesi aperti e licenza Apache 2.0 su Hugging Face, pplx-decider-v1.1-27b mantiene la base Qwen3.8-27B della v1, legge testo e immagini in un contesto di 250k tokens e rimuove la maschera causale (causal mask) dai suoi layer ad attenzione completa. La Decisions API, che ora serve questo modello, costa 0,02 dollari per milione di tokens in input, la metà degli 0,04 dollari della v1, e l’output resta gratuito.
| Categoria del Decision Index (scheda Hugging Face) | Punteggio di Jev | Punteggio della v1 | Punteggio della v1.1 |
|---|---|---|---|
| Conoscenze (Knowledge) | 51,4 | 40,9 | 48,18 |
| Linguaggio (Language) | 62,0 | 63,5 | 69,45 |
| Ricerca di informazioni (Retrieval) | 55,4 | 54,9 | 61,26 |
| Strumenti (Tools) | 75,1 | 79,3 | 78,88 |
| Arti (Arts) | 37,7 | 39,4 | 44,66 |
| Punteggio complessivo ponderato | 57,9 | 56,4 | 61,56 |
Secondo la scheda del modello, il punteggio complessivo passa da 56,4 a 61,56, davanti ai 57,9 di Jev, il modello decisionale di TypeSafe AI, che resta tuttavia in vantaggio nelle conoscenze. Perplexity afferma inoltre di ottenere il miglior punteggio nel nuovo Decision Index 0.3. Per ospitarlo autonomamente, servono una GPU in grado di contenere circa 49 Gio di pesi e l’implementazione fornita, perché un’inferenza causale standard non riproduce il comportamento misurato.
🔗 Il thread di @perplexitydevs su X 🔗 pplx-decider-v1.1-27b su Hugging Face
Il Decision Index 0.3
6 ottobre — apolinario, ingegnere presso Hugging Face, pubblica la versione 0.3 del Decision Index, la classifica della community dei modelli decisionali aperti che riproducono il Decision Model di Jev. Conta ora 112 modelli, di cui 111 riproduzioni aperte, che funzionano su una NVIDIA RTX PRO 6000. Il metodo cambia: il punteggio completo (Full score) combina 37 benchmark pubblici, test privati che misurano le stesse competenze e task privati provenienti da nuovi ambiti, affinché la posizione rifletta le competenze e non soltanto il successo su benchmark noti. Compare anche una scheda dedicata alla visione.
| Posizione mostrata | Modello classificato | Punteggio completo |
|---|---|---|
| 1 | Perplexity Decider v1.1 (27B) | 62,8 |
| 2 | Fastino GLiDE senza ragionamento (28B) | 60,2 |
| Riferimento | Jev | 60,1 |
| 3 | Torchcast Decision 27B | 59,9 |
| 4 | deck31b (Gemma 4 31B) | 59,0 |
I due punteggi di Decider v1.1 non vanno confusi: 61,56 è quello pubblicato nella scheda di Perplexity, 62,8 quello calcolato da questa classifica con il nuovo metodo. I test privati, per loro natura, non sono pubblicati.
🔗 L’annuncio di apolinario su X 🔗 Il Decision Index 0.3
Controllo del computer: OpenAI addestra GPT-6 Astra sui contratti di Ironclad
6 ottobre — OpenAI avvia collaborazioni di ricerca con produttori di software per rendere i suoi agenti più efficaci nei software aziendali, un progetto di controllo del computer (computer use), e comincia con Ironclad, specialista dei contratti assistiti dall’IA. I team hanno definito 11 task in ambito legale, commerciale e degli acquisti, da 30 a 40 minuti ciascuno per un utente esperto secondo OpenAI, valutati su 8-50 criteri. Ironclad ha fornito ambienti ospitati del proprio software, dove i modelli si sono addestrati tramite apprendimento per rinforzo su task sintetici ricavati da contratti pubblici della banca dati EDGAR della SEC.
| Misurazione di OpenAI sugli 11 task | GPT-5.6 Sol (ragionamento High) | GPT-6 Astra (ragionamento Max) |
|---|---|---|
| Punteggio medio | 41,6 % | 55,0 % (+32 %) |
| Tempo medio stimato per tentativo (simulato) | 37,0 minuti | 19,2 minuti (-48 %) |
GPT-6 Astra è il primo modello di frontiera di OpenAI addestrato su questi task, e un modello interno utilizzato durante il suo sviluppo raggiunge il 63,7 %. Questi dati sono forniti da OpenAI, e i tempi sono simulati sulla base di velocità di elaborazione ipotizzate, non misurati presso i clienti. OpenAI invita altri produttori a proporre task che gli agenti attuali non riescono ancora a svolgere in modo affidabile.
🔗 Articolo di OpenAI sulla collaborazione con Ironclad
API e piattaforme: livelli e BAA dell’API OpenAI, documenti e immagini nell’Agent API di Perplexity, GLM-5.3 su Bedrock
Quattro cambiamenti riguardano gli sviluppatori che acquistano inferenza: le condizioni di accesso all’API di OpenAI, gli strumenti dell’Agent API di Perplexity e un nuovo modello aperto nel catalogo di AWS.
I livelli di utilizzo dell’API OpenAI passano da cinque a tre
6 ottobre — OpenAI semplifica l’accesso ai limiti di frequenza (rate limits) più elevati della sua API: i cinque livelli di utilizzo a pagamento diventano tre, Build, Launch e Grow. Il più alto, Grow, si ottiene con 500 dollari di pagamenti API cumulativi, rispetto ai 1 000 dollari del precedente livello più elevato. Le organizzazioni già su un livello a pagamento passano automaticamente ai nuovi livelli, senza alcuna azione da parte loro, e poi salgono di livello quando i loro acquisti cumulativi di crediti raggiungono le soglie; il livello gratuito resta limitato a 100 dollari al mese.
| Livello di utilizzo | Soglia di acquisti cumulativi | Limite di utilizzo mensile | Astra, Sol e Terra (richieste e tokens al minuto) | Luna (richieste e tokens al minuto) |
|---|---|---|---|---|
| Build | 5 dollari | 500 dollari | 5 000 e 1 000 000 | 5 000 e 2 000 000 |
| Launch | 100 dollari | 5 000 dollari | 10 000 e 4 000 000 | 10 000 e 10 000 000 |
| Grow | 500 dollari | 200 000 dollari | 15 000 e 40 000 000 | 30 000 e 180 000 000 |
🔗 Il thread di @OpenAIDevs su X 🔗 Documentazione sui limiti di frequenza
Il BAA e la conformità HIPAA in self-service sull’API OpenAI
5 ottobre — Le organizzazioni che trattano dati sanitari protetti con l’API di OpenAI possono ora firmare autonomamente l’accordo di associato commerciale (Business Associate Agreement, BAA) richiesto dalla legge statunitense HIPAA. In Settings > Organization > General, un amministratore accetta il BAA standard e attiva il supporto alla conformità HIPAA, senza un contratto enterprise. Questo self-service è riservato alle organizzazioni idonee con una cronologia consolidata di utilizzo dell’API, e l’attivazione non può essere annullata da queste impostazioni. Le clausole personalizzate richiedono ancora una richiesta via e-mail, con risposta entro uno o due giorni lavorativi. OpenAI ricorda che firmare il BAA non rende di per sé un’applicazione conforme, e che non viene offerto alcun BAA per ChatGPT Business.
🔗 Articolo di assistenza di OpenAI sul BAA dell’API
L’Agent API di Perplexity legge i documenti e cerca immagini
5 ottobre — Il changelog dell’API Perplexity riceve tre voci in tarda serata. L’Agent API accetta ora in input documenti PDF, DOC, DOCX, TXT e RTF, integrati nella richiesta o indicati tramite un URL HTTPS pubblico, con un supporto che dipende dal modello e dal fornitore scelti. Un nuovo strumento, image_search, cerca immagini sul web e restituisce risultati strutturati, con l’indirizzo dell’immagine e quello della pagina di origine: da 1 a 30 immagini per chiamata, 5 per impostazione predefinita, filtri per domini e formati, e ricerca sicura attivata per impostazione predefinita. Costa 2,50 dollari per 1 000 invocazioni riuscite, e le chiamate fallite non vengono addebitate. La terza voce corregge il calcolo dei costi: le risposte dettagliano ora il costo delle estrazioni effettuate nella sandbox, alla tariffa invariata di GPT-6 Luna.
🔗 Changelog dell’API Perplexity 🔗 Documentazione dello strumento image_search
GLM-5.3 di Z.ai su Amazon Bedrock
6 ottobre — Z.ai annuncia l’arrivo di GLM-5.3, il suo modello di punta a pesi aperti, su Amazon Bedrock; la scheda di AWS data il lancio al 5 ottobre. È una mixture of experts da 744 miliardi di parametri, di cui circa 40 miliardi attivi per token, con un contesto di un milione di tokens e fino a 128 000 tokens in output. L’accesso è riservato ai clienti idonei, che devono rivolgersi al proprio account team AWS, e il modello viene servito soltanto tramite inferenza tra regioni (profilo US o globale), con caching dei prompt a partire da 1 024 tokens e i livelli di servizio Standard, Priority, Flex e Reserved. La scheda non indica prezzi e rimanda alla pagina dei prezzi di Bedrock. GLM-5.3 segue Kimi K3 (22 settembre) e Grok 4.7 (28 settembre), arrivati su Bedrock nelle ultime due settimane.
🔗 Scheda di GLM 5.3 su Amazon Bedrock 🔗 L’annuncio di Z.ai su X
Agenti di code: Claude Code da 2.1.290 a 2.1.292, sessioni cloud, Vibe CLI 2.26.0, Antigravity e Replit
Gli agenti di code ricevono cinque aggiornamenti, dal terminale all’editor: tre versioni di Claude Code in meno di venti ore, una guida alle sessioni cloud, una Vibe CLI la cui nuova interfaccia in Rust si arricchisce, l’estensione Antigravity per VS Code e un Replit che vede tutti i progetti dell’utente.
Claude Code da 2.1.290 a 2.1.292
5 e 6 ottobre — Pubblicata il 5 ottobre alle 23:33 UTC, Claude Code 2.1.290 è una versione corposa: 190 voci, di cui 131 correzioni. claude attach e claude logs accettano una parte del nome di una sessione al posto del suo identificativo, e /claude-api managed-agents-onboard trasforma il modello Managed Agents descritto da una pagina web in file ant apply. Il budget di ricerca web della sessione interattiva non si esaurisce più dopo 200 chiamate: si ricarica al ritmo di 100 chiamate all’ora. Al livello di impegno medio (medium), /code-review segnala anche gli scostamenti dalle convenzioni di CLAUDE.md su Opus 5.5 e Sonnet 5.5. In Slack, Claude Tag acquisisce una modalità rapida (!fast), una chiamata browser_batch di Claude in Chrome ha a disposizione 90 secondi invece di 60, e WebFetch non tronca più silenziosamente il testo oltre i 100 000 caratteri. pyright e un maggior numero di forme di ps richiedono un’autorizzazione, e vengono corrette diverse falle nelle autorizzazioni: caratteri jolly di rg e git grep espansi dalla shell, CLAUDE.md collegati al di fuori delle directory di lavoro, mod dell’organizzazione aggirato da un mod dell’utente. Quattro ore dopo, la 2.1.291 corregge due regressioni, una comparsa con la 2.1.290 (risposte alle richieste di autorizzazione perse nelle sessioni cloud), l’altra con la 2.1.288 (gli ultimi messaggi di una sessione persi all’uscita).
Il 6 ottobre alle 18:59 UTC, la 2.1.292 (92 voci, di cui 64 correzioni) aggiunge un parametro effort allo strumento Agent, per avviare un sottoagente al livello di impegno richiesto, e claude plugin install --marketplace, che aggiunge il marketplace (marketplace) se necessario e poi installa il plugin. I server MCP locali (stdio) negoziano ora per default il protocollo 2026-07-28 (MCP_PROTOCOL_NEGOTIATION=legacy per tornare indietro), CLAUDE_CODE_OVERLOADED_RETRY_BASE_DELAY_MS prolunga i retry in caso di errori 529, e i mod acquisiscono un evento di autocompletamento del prompt e la cache del prompt. Sul fronte della sicurezza, le approvazioni di un hook PreToolUse e la modalità auto non aggirano più la richiesta di autorizzazione per la lettura di percorsi di rete (UNC), e i tag <system-reminder> scritti da un hook vengono sottoposti a escaping prima di raggiungere Claude. Lo strumento Artifact elenca finalmente 200 artefatti invece di 50, e Code Review suddivide le sue statistiche per repository. Né la 2.1.290 né la 2.1.292 sono state annunciate su X.
| Versione di Claude Code | Data di pubblicazione (UTC) | Numero di voci | Novità principale |
|---|---|---|---|
| 2.1.290 | 5 ottobre, 23 h 33 | 190, di cui 131 correzioni | Sessioni indicate per nome, managed-agents-onboard, budget WebSearch ricaricato |
| 2.1.291 | 6 ottobre, 3 h 55 | 2 correzioni | Due regressioni corrette |
| 2.1.292 | 6 ottobre, 18 h 59 | 92, di cui 64 correzioni | Impegno dei sottoagenti, plugin e marketplace in un comando, MCP 2026-07-28 |
🔗 Claude Code 2.1.290 🔗 Claude Code 2.1.291 🔗 Claude Code 2.1.292
La guida alle sessioni cloud di Claude Code
6 ottobre — Due settimane dopo l’uscita dalla fase di anteprima delle sessioni cloud di Claude Code, Anthropic pubblica su claude.dev una guida pratica firmata Addy Osmani. Ogni attività viene eseguita su una nuova macchina virtuale da circa 4 vCPU, 16 Go di RAM e 30 Go di disco, con il repository clonato su un nuovo branch, senza costi aggiuntivi di calcolo nei piani Pro, Max, Team ed Enterprise. La guida descrive sette usi: smaltire in parallelo un elenco di attività in sospeso (backlog), dimostrare la validità di una correzione tramite esecuzioni ripetute, pianificare in locale e poi riprendere la sessione con claude --teleport, monitorare dal telefono, affidare i fallimenti della CI e i commenti di revisione ad Auto-fix, avviare routine ed eseguire codice poco sicuro in una VM usa e getta. Nella sua dimostrazione, tutte e tre le sessioni si sono concluse 87 secondi dopo il primo avvio, e un progetto può avviare fino a 200 nuove conversazioni (threads) al giorno. La guida illustra anche la connessione a GitHub: autenticarsi con GitHub e installare l’applicazione Claude GitHub sono due autorizzazioni distinte, e solo la seconda consente l’accesso ai repository privati. Il credito bonus di 100 dollari (Pro) o 250 dollari (Max) va richiesto prima del 7 ottobre alle 23:59 PT e scade il 4 novembre.
🔗 Guida pratica alle sessioni cloud su claude.dev 🔗 Il promemoria di @ClaudeDevs sul credito bonus
Vibe CLI 2.26.0
6 ottobre — Mistral pubblica Vibe CLI 2.26.0, il suo agente di codice da riga di comando, tredici giorni dopo la 2.25.8 e senza annunci su X. Con 33 aggiunte, 23 modifiche e 91 correzioni, l’aggiornamento è consistente: 72 delle sue 147 voci riguardano la nuova interfaccia scritta in Rust: assistente per il primo avvio, modalità vocale (/voice), prompt ricorrenti descritti in linguaggio naturale con /loop, invio della sessione a Vibe Code Web con /teleport e comando vibe update. Vibe funziona ora sempre su Unified Harness, il suo nuovo motore di esecuzione, e si arresta con un errore esplicito se manca, invece di ripiegare silenziosamente sul vecchio motore. I plugin possono includere il proprio server MCP, la chiave API di fallback conservata in ~/.vibe/.env è ora leggibile solo dal suo proprietario, e la Rust CLI trasmette ora la propria telemetria d’uso (tempo di avvio, comandi utilizzati, terminale rilevato) a Mistral.
🔗 Note di rilascio di Mistral Vibe v2.26.0
L’estensione Antigravity per VS Code 1.7.0
5 ottobre — Google pubblica la versione 1.7.0 dell’estensione Antigravity per Visual Studio Code, che porta gli agenti di Google Antigravity nell’editor di Microsoft (conversazione nel pannello laterale, revisione dei diff inline, piani interattivi), a partire da VS Code 1.90. Aggiornata circa ogni settimana dall’inizio di settembre secondo il suo changelog, finora non era mai stata trattata qui. Questa 1.7.0 (6 miglioramenti, 9 correzioni) cura la revisione del codice: le decisioni Accept e Reject si possono annullare e ripristinare da tastiera, l’editor di diff affiancati acquisisce i pulsanti Accept All e Reject All, e il salvataggio automatico (Auto Save) di VS Code non può più sovrascrivere né chiudere una revisione in corso. Su Windows, notifiche native segnalano il completamento di un’attività quando la finestra non è in primo piano, e Google Cloud Workstations e Cloud Shell ricevono un’autenticazione interattiva. Lo stesso giorno, l’estensione per Visual Studio passa alla 1.0.261005.0 e allega log diagnostici ai feedback inviati.
🔗 Changelog di Google Antigravity
Replit e il contesto di tutti i progetti
6 ottobre — Replit annuncia di disporre ora del contesto di tutti i progetti di un utente. Da una nuova conversazione, gli si può chiedere di ritrovare un progetto esistente, aggiungervi una funzionalità o usare un progetto come riferimento per un altro; Replit legge quindi i file interessati e avvia le modifiche come attività in background (background tasks), con link per rivedere i cambiamenti. L’esempio scelto va oltre il puro codice: applicare la palette di colori di un «Partner Marketing Hub» ad altri due progetti di un marchio di caffè. L’annuncio si limita a un tweet accompagnato da un video, senza post, documentazione o prezzo.
Le pull requests impilate di GitHub passano alla disponibilità generale
6 ottobre — GitHub rende disponibili su tutti i piani di github.com le pull requests impilate (stacked pull requests), in anteprima pubblica dal 30 luglio: una modifica di grandi dimensioni viene suddivisa in pull requests più piccole, revisionate separatamente e poi integrate insieme. GitHub Enterprise Server le riceverà in una prossima versione. Secondo GitHub, i repository che utilizzano pile integrano il 9 % di codice in più rispetto a repository comparabili, e più dei due terzi dell’1 % dei repository migliori le usano, con un miglioramento del 5 % del tempo necessario al merge.
La versione finale riduce gli ostacoli al merge. Quando il branch principale avanza, «Rebase stack» conserva le approvazioni del codice invariato e produce commit sostitutivi firmati; una pila attraversa la coda di merge (merge queue) come un unico gruppo, e una pila il cui branch di base viene eliminato viene reindirizzata anziché chiusa. Il merge automatico di un’intera pila arriverà «nelle prossime settimane». Per gli usi da riga di comando e per gli agenti, l’estensione gh stack di GitHub CLI supporta i worktrees Git.
🔗 Changelog di GitHub sulle pull requests impilate
Modelli multilingue: Tiny Aya L2-Thinker di Cohere e Falcon-OCR-Arabic di TII
Due piccoli modelli puntano su lingue che i grandi modelli gestiscono meno bene: uno ragiona nella lingua dell’utente, l’altro legge i documenti in arabo.
Tiny Aya L2-Thinker di Cohere
6 ottobre — Cohere affronta la questione della lingua in cui ragionano i modelli: interrogati in spagnolo, arabo o swahili, la maggior parte ragiona in inglese prima di rispondere. Il suo modello di ricerca Tiny Aya L2-Thinker (3,35 miliardi di parametri) ragiona nella lingua del prompt più del 93 % delle volte, su 60 lingue. La ricetta sta nella combinazione dei dati: circa 1,7 milioni di esempi di ragionamento in inglese, generati da gpt-oss-120b, lo fanno ragionare nella lingua dell’utente solo nel 12,8 % dei casi; circa 5 000 esempi tradotti per lingua, su 44 lingue, portano questa percentuale all’86,1 %, e dati multilingue senza ragionamento estendono questo comportamento ad altre lingue. Rispetto al suo gemello che ragiona in inglese, l’accuratezza cala al massimo di due o tre punti su cinque dei sei benchmark; solo PolyMath, dedicato alla matematica da competizione, registra un calo più netto, per l’assenza di una fase di apprendimento per rinforzo. Il modello consuma in media meno di 5 000 token di ragionamento. Modelli e dati sono pubblicati su Hugging Face con licenza non commerciale CC-BY-NC 4.0; il post presenta un articolo arXiv del 9 settembre.
🔗 Post di ricerca di Cohere su Tiny Aya L2-Thinker
Falcon-OCR-Arabic di TII
6 ottobre — TII, l’istituto emiratino che sviluppa i modelli Falcon, presenta sul blog di Hugging Face Falcon-OCR-Arabic, una versione araba del suo modello di riconoscimento del testo Falcon OCR. Mantiene i suoi 270 milioni di parametri e la sua architettura a fusione precoce, ed è stato adattato tramite fine-tuning supervisionato su documenti arabi reali e sintetici, poi tramite apprendimento per rinforzo. Su un benchmark costruito dalla stessa TII (11 974 documenti reali, 15 categorie), si classifica secondo tra i 17 modelli confrontati e primo per documenti ufficiali, moduli amministrativi, ricevute e fatture.
| Modello valutato da TII | Accuratezza del testo | Punteggio Table TEDS |
|---|---|---|
| Gemini 3.5 Flash | 84,34 % | 51,30 % |
| Falcon-OCR-Arabic (270M) | 81,87 % | 59,95 % |
| Claude Opus 5.5 | 79,22 % | 43,98 % |
| GPT Astra | 75,02 % | 51,23 % |
| Chandra OCR 2 (miglior OCR dedicato) | 61,67 % | 32,63 % |
Il post propone soltanto un ambiente di prova (playground): al momento della nostra rilevazione non risultavano presenti pesi di Falcon-OCR-Arabic sull’Hub, e non viene citata alcuna licenza.
🔗 Il post di TII su Falcon-OCR-Arabic
Librerie Hugging Face: Diffusers 0.41.0 integra Qwen-Image 2.1, Transformers v5.19.0 accoglie EmbeddingGemma 2
Le due principali librerie di modelli di Hugging Face pubblicano una versione lo stesso giorno.
Diffusers 0.41.0 e Qwen-Image 2.1
6 ottobre — Diffusers 0.41.0, la libreria di Hugging Face per i modelli di diffusione, integra Qwen-Image 2.1, il modello di Alibaba che riunisce generazione e modifica di immagini: ora si usa direttamente per generare, modificare, produrre immagini con sfondo trasparente (output RGBA nativo) e addestrare LoRA, con un componente di generazione visiva da 7 miliardi di parametri. Il team cambia anche ritmo: come Transformers, Diffusers allineerà ora le sue versioni minori all’arrivo di nuovi modelli, mentre le versioni correttive continueranno a essere riservate alle correzioni. Il caricamento in parallelismo tensoriale consente a ciascuna GPU di leggere soltanto la propria porzione dei pesi, e la versione aggiunge le pipeline LTX-2.5 DFR e ottimizzazioni per Cosmos 3. Per contro, il supporto ONNX è deprecato a favore di Optimum.
🔗 Note di rilascio di Diffusers 0.41.0
Transformers v5.19.0
6 ottobre — Sei giorni dopo la v5.18.0, Transformers v5.19.0 accoglie EmbeddingGemma 2, presentato sopra, con i suoi vettori accorciabili e i suoi encoder visivi e audio disattivabili al caricamento. Sul fronte dell’addestramento distribuito, il parallelismo degli esperti acquisisce una distribuzione dei token (token dispatch), attivata per default per Qwen3 MoE e Mellum: la sua dimensione non deve più essere uguale a quella del parallelismo tensoriale, e il Trainer funziona con questa modalità. La cache si configura ora strato per strato, utile per i modelli eterogenei, e l’elaborazione continua in batch (continuous batching) supporta le XPU. La versione conta sei modifiche incompatibili con le versioni precedenti, tra cui la restituzione dei logits del router per tutti i MoE e l’abbandono progressivo del prefisso paged|.
🔗 Note di rilascio di Transformers v5.19.0
Agenti vocali: ElevenLabs lancia ElevenAgents Architect in Alpha
6 ottobre — ElevenLabs integra in ElevenAgents, la sua piattaforma di agenti conversazionali, un esperto chiamato Architect, che aiuta i team a costruire e migliorare i propri agenti vocali o testuali parlandogli o scrivendogli. Conosce tutte le impostazioni di ElevenAgents (base di conoscenze, prompt, concatenazioni, voci, guardrail, strumenti, simulazioni) e il modo in cui interagiscono. Gli si può sottoporre una domanda, un test fallito, un aumento dei trasferimenti a un operatore umano o un rilievo di ElevenAgents Spotlight: analizza le trascrizioni, risale alla causa, propone una modifica e scrive le simulazioni che la convalidano. Costruisce anche un agente a partire da una semplice descrizione. Ogni modifica arriva come bozza versionata e reversibile, e nulla passa in produzione senza approvazione. Architect è accessibile dal prodotto, ma anche da Claude, Claude Code, ChatGPT, Cursor e Grok Bot. È disponibile da subito in Alpha, senza tariffe né dati sui risultati.
🔗 Post di ElevenLabs su ElevenAgents Architect
Video generativo: FLUX 3 in testa a Physics-IQ Verified secondo Black Forest Labs
6 ottobre — Black Forest Labs rivendica il primo posto su Physics-IQ, il benchmark di Google DeepMind che misura la comprensione del mondo fisico da parte dei modelli video: al modello viene mostrato l’inizio di un esperimento reale filmato, e deve prevederne il seguito (fluidi, ottica, meccanica dei solidi). La classifica di riferimento, Physics-IQ Verified, è gestita da Anates Labs. Nella categoria da video a video, FLUX 3 [large] supera nettamente Cosmos3 di NVIDIA, con un costo per video più elevato.
| Modello e metodo (da video a video) | Punteggio Physics-IQ Verified | Costo per video normalizzato |
|---|---|---|
| FLUX 3 [large], migliore di 8 generazioni | 64,35 % | 16,43 dollari |
| FLUX 3 [large] | 61,11 % | 2,08 dollari |
| Cosmos3 Super (NVIDIA) | 50,80 % | 0,82 dollari |
| Cosmos3 Nano (NVIDIA) | 43,00 % | 0,82 dollari |
Nella categoria da immagine a video, FLUX 3 [large] supera anche Physis-Lang, il metodo che NVIDIA indicava al primo posto il 29 settembre. FLUX 3 [large] è un modello proprietario, e il thread non fornisce né una data di disponibilità né un prezzo per questa variante.
🔗 Il thread di @bfl_ai su X 🔗 Classifica Physics-IQ Verified
Valutazioni pubbliche: GeoGuess Bench e RSI Arena
Due valutazioni aperte al pubblico si discostano dai benchmark abituali: una fa giocare i modelli a GeoGuessr, l’altra fa votare il pubblico su modelli addestrati da agenti.
GeoGuess Bench
6 ottobre — Hassan, responsabile dell’esperienza degli sviluppatori presso Together AI, pubblica GeoGuess Bench, un benchmark personale che fa giocare i modelli a GeoGuessr: ciascuno vede le stesse 210 foto di strada e posiziona un segnaposto valutato secondo la formula del gioco, fino a 25 000 punti per partita di cinque turni. Claude Opus 5.5 passa in testa, appena davanti a Claude Fable 5.1; la sorpresa arriva da Muse Glimmer 30B, il modello a pesi aperti di Meta, terzo e davanti a GPT-6 Astra a un costo per partita circa 45 volte inferiore.
| Posizione nel GeoGuess Bench | Modello valutato | Punteggio su 25 000 | Costo per partita |
|---|---|---|---|
| 1 | Claude Opus 5.5 | 23 412 | 0,064 dollari |
| 2 | Claude Fable 5.1 | 23 307 | 0,115 dollari |
| 3 | Muse Glimmer 30B (aperto) | 22 407 | 0,0049 dollari |
| 4 | GPT-6 Astra | 21 562 | 0,223 dollari |
| 5 | GPT-6.1 Sol | 21 194 | 0,042 dollari |
| 6 | GLM-5.3 Flash (aperto) | 21 183 | 0,0087 dollari |
GLM-5.3 Flash eguaglia così GPT-6.1 Sol a un costo circa cinque volte inferiore. Si tratta del progetto personale di un dipendente di Together AI, fornitore di inferenza per modelli aperti, e non di una valutazione dell’azienda; non vi compare alcun modello Gemini, e il codice è pubblicato su GitHub.
🔗 L’annuncio di Hassan su X 🔗 GeoGuess Bench
RSI Arena
6 ottobre — Zichen Chen annuncia un nuovo ciclo di RSI Arena (per auto-miglioramento ricorsivo, recursive self-improvement), questa volta con Hugging Face. Gli agenti IA hanno ricevuto GPU e un’unica missione, addestrare modelli migliori: hanno scelto autonomamente i dati, scritto il codice e condotto gli esperimenti. Terminato il primo ciclo di addestramento, il pubblico entra nel ciclo: i modelli si affrontano in duello, ciascuno vota, e gli agenti utilizzano questi feedback per nuovi esperimenti. Gli Inference Endpoints di Hugging Face servono ogni modello in tempo reale, e il sito elenca dieci agenti, tra cui GPT-6 Astra, Grok 4.7, DeepSeek V4.1 Flash, GLM-5.3 e Muse Spark 1.3; la sua dashboard mostrava 286,60 dollari di spese API su 300 e 755,17 ore GPU su 1 000. Il team promette di pubblicare sul Hub ogni modello addestrato dagli agenti e, alla fine dell’esperimento, tutti gli artefatti: dati, codice e percorso di ricerca completo di ogni agente.
🔗 L’annuncio di Zichen Chen su X 🔗 RSI Arena
Infrastruttura GPU: NVIDIA pubblica AICR v1.0
6 ottobre — NVIDIA pubblica la versione 1.0 di AI Cluster Runtime (AICR), un progetto aperto che vuole porre fine ai cluster Kubernetes GPU configurati per tentativi. Un cluster accelerato dipende da decine di componenti con versioni indipendenti (kernel, driver, runtime dei container, rete, storage, operatori, librerie), e una combinazione che funziona in un ambiente può fallire senza segnalazioni altrove. AICR risponde con ricette validate e con versioni bloccate, generate per Helm, Argo CD, Flux o Helmfile e accompagnate da prove di validazione firmate sull’hardware testato. La v1.0 stabilisce un contratto di compatibilità: la CLI, l’API REST, l’SDK Go, la struttura dei pacchetti di deployment e gli schemi degli artefatti diventano interfacce stabili, e qualsiasi modifica incompatibile richiederà una nuova versione principale. NVIDIA dichiara oltre 100 contributori, di cui quasi la metà esterni all’azienda, e cita integrazioni presso Pulumi Labs e nel gestore multicluster k0rdent di Mirantis.
🔗 Articolo del blog tecnico NVIDIA
Claude Startups: fino a 7 000 dollari di prodotti e crediti, e una Startup Stack da 45 000 dollari
6 ottobre — Anthropic amplia l’accesso a Claude Startups, il suo programma per i fondatori che sviluppano su Claude, alle startup fondate da meno di cinque anni o finanziate negli ultimi due anni.
| Vantaggio del programma | Valore dichiarato da Anthropic |
|---|---|
| Un anno di Claude Team, fino a cinque posti Premium | 6 000 dollari (cinque posti a 100 dollari al mese) |
| Credito API una tantum, disponibile all’approvazione | 1 000 dollari |
| Totale dei prodotti e crediti Claude | fino a 7 000 dollari |
| Claude Startup Stack (offerte dei partner) | fino a 45 000 dollari |
L’anno di Claude Team vale per le aziende che iniziano a usare Team, e il suo valore effettivo dipende dal numero e dal tipo di posti. La Claude Startup Stack, novità del giorno, riunisce sconti e crediti di aziende che sviluppano con Claude, tra cui Linear, Lovable, ElevenLabs, Granola e Hex; il suo massimale corrisponde al valore complessivo di tutte le offerte ai prezzi di listino di settembre 2026, e queste offerte non sono tutte cumulabili. Il programma aggiunge fasce orarie per confrontarsi con il team Applied AI di Anthropic, assistenza per pubblicare una scheda sul Claude Marketplace e accesso a eventi.
🔗 Articolo di Anthropic su Claude Startups 🔗 Il thread di @claudeai sulla Claude Startup Stack
Notizie brevi
- Claude Projects e cartella locale — Dan Fein, di Anthropic, annuncia che le sessioni cloud di Claude Projects possono connettersi a una cartella approvata del computer, alla quale accedono solo quando un’attività lo richiede; il rilascio è graduale dal 5 ottobre, e il team è quasi arrivato (Ci siamo quasi), secondo Boris Cherny. 🔗 fonte · 🔗 Boris Cherny
- Claude nei messaggi di gruppo Slack — Claude può ora essere aggiunto ai messaggi di gruppo (group DMs) di Slack come qualsiasi partecipante; risponde in un thread che continua a seguire e può usare i connettori personali della persona che lo interpella, senza precisazioni sui piani né sulle tempistiche. 🔗 fonte
- Boris Cherny e il suo modo di fare prompting — Boris Cherny fa costruire a Opus 5.5 un sito di accompagnamento interattivo per un episodio del podcast Acquired dedicato a Home Depot, acquerelli compresi; secondo lui, non ci sono segreti nel prompting: dire al modello cosa si vuole, quanto impegno dedicarvi e come verificare il risultato. 🔗 sito di accompagnamento · 🔗 il suo modo di fare prompting
- Atlassian e OpenAI — In base a un nuovo accordo, i modelli di frontiera della famiglia GPT-6, tra cui GPT-6 Astra, alimenteranno gli agenti della piattaforma Atlassian e di Rovo; oltre 3 000 sviluppatori di Atlassian usano già Codex, e sono allo studio integrazioni Jira più approfondite, senza che sia stato comunicato un importo. 🔗 fonte
- Widget Codex in ChatGPT per iOS — La versione 1.2026.267 di ChatGPT per iOS, del 2 ottobre, aggiunge widget della schermata Home per le attività Codex recenti dei computer selezionati, altri per l’utilizzo residuo e il suo azzeramento, anche sulla schermata di blocco, e un’impostazione che mantiene aperta la tastiera. 🔗 fonte
- Gemini CLI v0.63.0 e v0.64.0-preview.0 — La versione stabile v0.63.0 riprende senza modifiche le 15 voci della versione di anteprima del 29 settembre, e la versione di anteprima v0.64.0-preview.0 riunisce le 16 voci delle versioni nightly dal 30 settembre al 3 ottobre: nessun contenuto nuovo, e la versione nightly del 6 ottobre è vuota. 🔗 fonte
- SDK Python di Mistral 3.1.0 — Generata automaticamente dall’API, questa versione aggiunge in beta quattordici operazioni di valutazione nel modulo di osservabilità; i metodi
Runsvengono spostati inWorkflows.runs, il che può rendere incompatibile il codice esistente nonostante un semplice cambio di versione minore. 🔗 fonte - Qwen Code v0.25.1-preview.0 — Il giorno dopo la v0.25.0, questa versione di anteprima introduce 13 funzionalità e 27 correzioni, tra cui un runtime Kubernetes sperimentale, comandi Shell e monitoraggio in background per il Managed Agent, e regole MCP che non autorizzano più un server omonimo. 🔗 fonte
- SDK TypeScript di SpaceXAI 0.2.2 — Pubblicata il 5 ottobre senza annuncio, questa versione contiene una sola modifica: l’opzione
retryBeforeOutputsi applica anche a una chiamatacreate()senza flusso continuo (streaming) che attende JSON. 🔗 fonte - Falcon-Emirati-7B, il dialetto emiratino — TII specializza Falcon-H1-Arabic 7B nell’arabo emiratino: 84,83 % su Alyah, un benchmark di 1 173 domande, e una fedeltà al dialetto di 0,52 contro, nel migliore dei casi, 0,05 per ALLaM, Gemma 3 27B, Jais-2 e Fanar-2, secondo un giudice Gemini 3.7 Flash; il modello è disponibile solo sulla piattaforma di chat di TII. 🔗 fonte
- Datasets 5.1.0 — Pubblicata il 5 ottobre, la libreria di dataset legge ora gli ambienti di apprendimento per rinforzo Harbor, il formato colonnare Vortex e cinque formati biologici (FASTA, FASTQ, GenBank, PDB, mmCIF), e corregge una vulnerabilità che permetteva a un archivio di scrivere in una directory adiacente. 🔗 fonte
- TRL v1.14.2 — Questo aggiornamento correttivo risolve un addestramento falsato senza segnalazioni: senza vLLM, GRPO, RLOO e Distillation non si fermavano alla fine del turno per modelli come Gemma o Phi-3.5 e apprendevano tutto il testo successivo fino alla lunghezza massima; vengono corretti anche tre crash. 🔗 fonte
- Jev contro le email delle campagne elettorali — In un articolo della community, Stephen Solka filtra le sue email politiche con Jev (99 risposte corrette su 100 email reali, un falso positivo), poi con un classificatore SetFit da 22,6 milioni di parametri che gira sul processore: 98 % nella valutazione pilota, ma 18 su 23 nei casi difficili. 🔗 fonte
- Open Together il 16 ottobre — vLLM e Hugging Face organizzano Open Together, un raduno di sviluppatori open source che aprirà l’Open Source AI Week venerdì 16 ottobre a San Francisco; secondo Jeff Boudier, 150 persone sono in lista d’attesa e la capienza è stata raddoppiata. 🔗 fonte · 🔗 Jeff Boudier
- Copilot CLI 1.0.93-2 — Questa versione di anteprima aggiunge un’impostazione aziendale,
permissions.limitTo, che limita le richieste di rete a domini gestiti, mette in evidenza GPT-6.1 Sol, GPT-6 Astra e Luna e i modelli Claude 5.5 nel selettore, e legge le impostazioni utente solo da~/.copilot/settings.json. 🔗 fonte - AI Scan nella panoramica della sicurezza — Gli amministratori di organizzazioni e aziende possono ora vedere, nella panoramica della sicurezza (security overview) di GitHub, quali repository hanno attivato l’analisi tramite IA delle pull request (AI Scan for pull requests), con due filtri e una colonna nell’esportazione CSV. 🔗 fonte
- Rilevamento di segreti: Lovable, Pydantic e Supabase — Il rilevamento di segreti (secret scanning) di GitHub riconosce cinque nuovi tipi di segreti, tra cui la chiave API di Lovable, il token Logfire e la chiave della Pydantic AI Gateway, oltre a due token Supabase; Lovable Labs entra anche nel suo programma di partnership. 🔗 fonte
- Note di rilascio di Devin del 5 ottobre — Soprattutto ritocchi: una scheda Terminal nello spazio di lavoro della sessione (aprire Files o Terminal riattiva Devin), livelli di impegno per Devin Review configurabili tramite le azioni di attivazione, e analisi del codice (code scans) recuperabili tramite identificativo attraverso l’API v3 o l’MCP di Devin. 🔗 fonte
- Delta e i propri worktrees — Sul blog di Delta, Conrad Irwin spiega perché lo strumento sostituisce i worktrees Git: ogni thread ha il proprio worktree registrato in DeltaDB e replicato tra persone, agenti e macchine, più agenti lavorano sullo stesso branch, e uno script
.agents/prepareversionato prepara ogni checkout; l’articolo non accompagna una nuova versione. 🔗 fonte - v0: dagli account personali agli spazi di team — Gli account personali di v0 diventano spazi di lavoro di team, con conversazioni, progetti e impostazioni migrati automaticamente; la documentazione riserva tuttavia alcune funzioni, come i template di team, ai piani Plus, Business ed Enterprise. 🔗 fonte
- v0 e l’abbonamento ChatGPT su iOS — L’abbonamento ChatGPT, accettato da v0 dal 29 settembre, è ora utilizzabile nella sua applicazione iOS, senza prezzi né ulteriori dettagli. 🔗 fonte
- Eleven v4 ed Eleven v4 Turbo in testa — ElevenLabs annuncia che i suoi due modelli di sintesi vocale lanciati il 28 settembre occupano i primi due posti della classifica di sintesi vocale (text to speech) di Artificial Analysis; v4 era già primo al lancio. 🔗 fonte
- HeyGen Video in 2K — Una settimana dopo il lancio, HeyGen Video passa alla risoluzione 2K; HeyGen lo indica al primo posto della classifica video di OpenRouter per utilizzo, senza un prezzo specifico per il 2K, mentre la pagina del catalogo continua a indicare 0,01 dollari al secondo fino a fine ottobre. 🔗 fonte
- Nano Banana 2.1 su Pika — Pika aggiunge alla sua piattaforma e al suo Pika API Club Nano Banana 2.1, la nuova versione del modello Nano Banana di Google, con una migliore qualità visiva e maggiore velocità secondo Pika; non viene indicato alcun prezzo né costo in crediti. 🔗 fonte
- DOCA GPUNetIO — NVIDIA fa di DOCA GPUNetIO l’implementazione comune della rete controllata dalla GPU (GDA-KI) per NCCL, NVSHMEM e NIXL/UCX, in versione completa nell’SDK DOCA e come progetto open source più leggero, incentrato su RDMA Verbs. 🔗 fonte
- Green contexts di CUDA — Un articolo tecnico di NVIDIA mostra come riservare SM a un’attività critica: su una GPU Blackwell da 148 SM, un kernel con 8 SM riservati risponde in 0,007 ms, contro 0,140 ms con un flusso (stream) prioritario e 3,727 ms senza priorità. 🔗 fonte
- Modelli aperti presso gli operatori di telecomunicazioni — In un articolo che espone la sua posizione, NVIDIA cita la propria indagine sulle telecomunicazioni del 2026, in cui l’89 % degli intervistati ritiene importante l’open source, e le testimonianze di SoftBank, AT&T e Indosat; nessun nuovo prodotto. 🔗 fonte
- Guida di Perplexity agli strumenti di collaborazione — Perplexity confronta dieci strumenti di collaborazione dotati di IA (Slack, Loom, Confluence, Airtable, Notion, ClickUp, Asana, Monday.com, Trello, Miro), le loro funzioni di IA e i piani che le includono; nessuna novità di prodotto. 🔗 fonte
Che cosa significa
I modelli decisionali diventano una categoria a sé stante, con la propria guerra dei prezzi e la propria classifica. Lo stesso giorno, OpenAI fissa il prezzo della sua API Decisions a 0,10 dollari per milione di token in ingresso e Perplexity abbassa il proprio a 0,02 dollari, la metà rispetto a cinque giorni fa; nessuna delle due addebita l’output. Questi modelli non scrivono, scelgono o assegnano punteggi: si pagano per la lettura e si vogliono veloci, con OpenAI che promette risposte circa dieci volte più rapide rispetto alla sua Responses API. Il Decision Index 0.3 funge da arbitro della comunità e la sua nuova metà privata mira a misurare le competenze anziché il successo su benchmark noti. Il suo verdetto pesa già nella comunicazione dei produttori: Perplexity lo cita nel proprio annuncio, anche se la scheda del suo modello riporta un punteggio diverso da quello della classifica.
L’IA si integra negli strumenti per l’ufficio piuttosto che il contrario. Claude entra in Google Docs, Sheets e Slides dopo Excel, PowerPoint e Word, si aggiunge ai messaggi di gruppo di Slack e i modelli GPT-6 alimenteranno gli agenti di Rovo presso Atlassian. In queste integrazioni, la questione non riguarda più soltanto la qualità del modello, ma anche il controllo: una modalità che richiede l’approvazione di ogni modifica, connettori che rispettano le autorizzazioni di condivisione di Google, controlli Enterprise applicati al modulo. La stessa logica attraversa gli strumenti per agenti del giorno, dalle decisioni di revisione annullabili in Antigravity alle bozze versionate di ElevenAgents Architect.
Sul fronte della cybersicurezza, l’accesso è graduato in base alla verifica. Il CVP di Anthropic non cambia il modello, ma le sue misure di protezione: su CyScenarioBench, lo stesso Opus 5.5 passa da attività bloccate fin dal primo prompt senza verifica a 34 attività completate su 50 con Red Team Access. Mistral propone un altro argomento, quello di un modello che non rifiuta: rivendica l’82 % in un test cyber che Claude Opus 5.5 e GPT-6 Astra, a suo dire, rifiutano di svolgere. I due approcci convergono su un punto: l’accesso più ampio alle capacità cyber passa prima dai professionisti verificati, partner di Mistral prima della pubblicazione dei pesi o membri del programma di Anthropic.
I modelli si estendono anche ai due estremi delle dimensioni. In alto, Mistral Large 4 e i suoi 1 000 miliardi di parametri, i cui pesi sono promessi per fine ottobre; in basso, EmbeddingGemma 2, che occupa circa 567 Mo di RAM su un telefono, Tiny Aya L2-Thinker e i suoi 3,35 miliardi di parametri, oppure Falcon-OCR-Arabic e i suoi 270 milioni, per ora soltanto in dimostrazione. Molti dei numeri del giorno sono però misurati dal produttore stesso: i punteggi di Mistral, il primo posto rivendicato da Black Forest Labs, il benchmark interno di TII, la scheda di Perplexity, le attività di Ironclad valutate da OpenAI o i miglioramenti nei merge annunciati da GitHub. Spesso è l’unica misura disponibile il giorno di un annuncio; sarà utile confrontarla con valutazioni indipendenti, cosa che consentiranno proprio i pesi di Mistral Large 4 una volta pubblicati.
Fonti
- Articolo di Mistral su Mistral Large 4
- Scheda di Mistral Large 4 nella documentazione
- Articolo di Anthropic su Claude for Google Workspace
- @claudeai su X, Claude for Google Workspace
- Articolo di Anthropic sul Cyber Verification Program
- Pagina di assistenza del Cyber Verification Program
- Comcast e Booz Allen con Claude Mythos
- EmbeddingGemma 2 sul blog di Google
- Scheda del modello EmbeddingGemma 2
- @GoogleDeepMind su X, EmbeddingGemma 2
- EmbeddingGemma 2 su Hugging Face
- Guida all’API Decisions di OpenAI
- Changelog dell’API OpenAI
- @perplexitydevs su X, pplx-decider-v1.1-27b
- pplx-decider-v1.1-27b su Hugging Face
- @multimodalart su X, Decision Index 0.3
- Il Decision Index 0.3
- Articolo di OpenAI sulla sua collaborazione con Ironclad
- @OpenAIDevs su X, livelli di utilizzo
- Documentazione sui limiti di frequenza dell’API OpenAI
- Articolo di assistenza di OpenAI sul BAA dell’API
- Changelog dell’API Perplexity
- Documentazione dello strumento image_search di Perplexity
- Scheda di GLM 5.3 su Amazon Bedrock
- @Zai_org su X, GLM-5.3 su Bedrock
- Claude Code 2.1.290
- Claude Code 2.1.291
- Claude Code 2.1.292
- Guida pratica alle sessioni cloud su claude.dev
- @ClaudeDevs su X, credito bonus delle sessioni cloud
- Note di rilascio di Mistral Vibe v2.26.0
- Changelog di Google Antigravity
- @Replit su X, contesto di tutti i progetti
- Changelog di GitHub sulle pull requests impilate
- Articolo di ricerca di Cohere su Tiny Aya L2-Thinker
- L’articolo di TII su Falcon-OCR-Arabic
- Note di rilascio di Diffusers 0.41.0
- Note di rilascio di Transformers v5.19.0
- Articolo di ElevenLabs su ElevenAgents Architect
- @bfl_ai su X, FLUX 3 e Physics-IQ
- Classifica Physics-IQ Verified
- @nutlope su X, GeoGuess Bench
- GeoGuess Bench
- @my_cat_can_code su X, RSI Arena
- RSI Arena
- AICR v1.0 sul blog tecnico di NVIDIA
- Articolo di Anthropic su Claude Startups
- @claudeai su X, Claude Startup Stack
- Dan Fein su X, Claude Projects e cartella locale
- Boris Cherny su X, distribuzione graduale di Claude Projects
- Dan Fein su X, Claude nei messaggi di gruppo di Slack
- Boris Cherny su X, sito complementare di Acquired
- Boris Cherny su X, il suo modo di scrivere prompt per Claude
- Atlassian e OpenAI ampliano la loro partnership
- Changelog di ChatGPT e Codex, ChatGPT per iOS 1.2026.267
- Gemini CLI v0.63.0
- SDK Python di Mistral v3.1.0
- Qwen Code v0.25.1-preview.0
- SDK TypeScript di SpaceXAI v0.2.2
- L’articolo di TII su Falcon-Emirati
- Datasets 5.1.0
- TRL v1.14.2
- L’articolo di Stephen Solka
- @vllm_project su X, Open Together
- Jeff Boudier su X, lista d’attesa di Open Together
- Copilot CLI 1.0.93-2
- Changelog di GitHub sullo stato di attivazione dell’AI Scan
- Changelog di GitHub sui nuovi rilevatori di segreti
- Note di rilascio di Devin del 5 ottobre
- Articolo di Conrad Irwin sul blog di Delta
- Changelog di v0, account personali trasformati in spazi di team
- @v0 su X, abbonamento ChatGPT su iOS
- @ElevenLabs su X, Eleven v4 in testa
- @HeyGenDev su X, HeyGen Video in 2K
- @pika_labs su X, Nano Banana 2.1 su Pika
- DOCA GPUNetIO sul blog tecnico di NVIDIA
- Green contexts sul blog tecnico di NVIDIA
- Modelli aperti e operatori di telecomunicazioni, blog di NVIDIA
- Guida di Perplexity agli strumenti di collaborazione