Cerca

Boris Cherny non scrive più codice a mano da novembre 2025, Gemini 3.7 Flash arriva in Google Search, Gemma supera il miliardo di download

Articolo generato da intelligenza artificiale
Boris Cherny non scrive più codice a mano da novembre 2025, Gemini 3.7 Flash arriva in Google Search, Gemma supera il miliardo di download

ai-powered-markdown-translator

Articolo tradotto dal fr all’it con gpt-5.4-mini.

Vedi progetto su GitHub ↗

Il 23 agosto, la giornata parla meno di nuove capacità che di utilizzo reale. Boris Cherny, creatore di Claude Code, spiega che non scrive più codice a mano da novembre 2025 e colloca Claude su tre livelli di capacità; riconosce subito dopo che la verbosità di Opus è una priorità di correzione per Anthropic. In Google, Gemini 3.7 Flash, uscito il 13 agosto, diventa il modello Gemini adottato più rapidamente ed entra in Google Search, mentre la famiglia aperta Gemma supera il miliardo di download. Amp dà nomi di dominio leggibili alle applicazioni ospitate sui suoi orb, e un benchmark aperto di previsione delle proprietà dei farmaci pubblica il proprio piano di rumore accanto a ogni punteggio.


Boris Cherny colloca Claude su tre livelli e non scrive più codice a mano da novembre 2025

23 agosto — Il creatore di Claude Code scompone l’evoluzione dei modelli in tre livelli: scrivere codice meglio di lui; fare meglio di lui il lavoro di ingegneria attorno al codice, dal debug alla progettazione dei sistemi; poi superare la maggior parte delle persone nella maggior parte dei compiti eseguibili su un computer. Colloca Claude al primo livello e in parte del secondo, e indica Opus 4.8 come il primo modello che gli sia sembrato migliore di lui. Una precisazione che aggiunge: per Anders Hejlsberg, ideatore di TypeScript, il primo livello potrebbe non essere ancora stato raggiunto.

Back in Nov 2025 I fully stopped writing code by hand, though I continue to code (using agents) every day. […] But engineering is more than coding.

🇮🇹 Nel novembre 2025, ho smesso completamente di scrivere codice a mano, continuando però a programmare (con agenti) ogni giorno. […] Ma l’ingegneria è più che semplice programmazione.@bcherny su X


Anthropic riconosce la verbosità di Opus come una priorità e fornisce un rimedio temporaneo

23 agosto — Interpellato sui difetti di Opus, Boris Cherny risponde con un riconoscimento pubblico diretto: la verbosità è un problema identificato, prioritario per il team. Nel frattempo, il comando claude /config outputStyle=concise attiva lo stile Concise annunciato il 20 agosto. Questa è la vera informazione: Concise non è un’opzione di comfort, ma la risposta provvisoria a un comportamento che il team cerca di correggere a monte.

Lo stesso scambio contiene un consiglio d’uso formulato il giorno prima, il 22 agosto: Opus sarebbe sottoutilizzato per l’ottimizzazione iterativa — consumo di CPU e memoria, tempo di CI, latenza, frame rate — secondo un motivo riproducibile, iterare su X con un profiler e un dataset fino a raggiungere Y.

We know Opus is not perfect, and it is a big priority for the team to fix it.

🇮🇹 Sappiamo che Opus non è perfetto, e correggerlo è una grande priorità per il team.@bcherny su X

🔗 Opus e l’ottimizzazione iterativa


Gemini 3.7 Flash entra in Google Search dopo un’adozione record

22 agosto — Sundar Pichai non annuncia un modello: Gemini 3.7 Flash è uscito il 13 agosto. Annuncia un’adozione, la più rapida della famiglia Gemini, e un rollout: il modello gira ora in Google Search, oltre che nell’app Gemini. Al lancio, era accessibile solo agli abbonati Pro e Ultra tramite Spark, alla Gemini Enterprise Agent Platform e all’API — il suo arrivo in Search cambia la scala di esposizione.

Benchmark valutatoPunteggio ottenutoCosto per task (USD)
ARC-AGI-195,5 %0,12
ARC-AGI-284,6 %0,25

Gemini 3.7 Flash smashed previous Gemini growth records in its first week, making it our fastest growing model yet.

🇮🇹 Gemini 3.7 Flash ha frantumato i precedenti record di crescita di Gemini già nella sua prima settimana, rendendolo il nostro modello a crescita più rapida fino a oggi.@sundarpichai su X

🔗 Punteggi ARC-AGI pubblicati il 20 agosto da ARC Prize


Gemma supera il miliardo di download e Google pubblica il repository Awesome Gemma

20 agosto — Clement Farabet e Olivier Lacombe, di Google DeepMind, annunciano che la famiglia di modelli aperti Gemma ha superato il miliardo di download cumulati, con oltre 100 000 varianti pubblicate dalla community in due anni. I deployment citati danno la misura dell’ampiezza: la NASA, Satlyt e Starcloud eseguono Gemma a bordo di satelliti per l’analisi delle immagini on-board; in India, la National Health Authority ha integrato Gemma 4 in Aarogya Setu 2.0 per standardizzare referti medici. Sul fronte della ricerca, C2S-Scale, costruito su Gemma da Yale e Google, ha identificato una via terapeutica anticancro poi verificata su cellule vive. Google accompagna il traguardo con un deliverable per gli sviluppatori: il repository GitHub Awesome Gemma, elenco ufficiale dei progetti e tutorial di questo ecosistema.

Indicatore misuratoValore dichiarato
Download cumulati di Gemmaoltre 1 miliardo
Varianti pubblicate dalla communityoltre 100 000
Progetti presentati al Gemma Challengeoltre 1 600

🔗 Post Google DeepMind


Amp assegna nomi di dominio leggibili ai portal dei suoi orb

23 agosto — Un orb è la macchina remota e usa e getta su cui Amp esegue un agente; un portal è la porta d’ingresso HTTP che permette di aprire nel browser l’applicazione in costruzione in quell’orb. Ogni portal riceveva un indirizzo auto-generato illeggibile, del tipo t-01a0095e-9568-whatever-p1234.onamp.dev — utile per un colpo d’occhio, molto meno per un link inoltrato a un team. Lo sostituiscono tre opzioni: un prefisso personalizzato, un dominio personale o un dominio di workspace (workspace). Amp fa l’esempio di park.mixfox.org, un indirizzo normale che ospita un’applicazione su un orb. La configurazione si effettua dalla scheda Portal oppure chiedendolo all’agente. La motivazione esposta conta quanto la funzionalità: i portal servono sempre meno come anteprima effimera e sempre più come applicazioni durature. Rimane un limite, confermato da Quinn Slack: la condivisione non oltrepassa i confini del workspace.

🔗 Annuncio Amp


LEADBOARD pubblica il piano di rumore dei suoi benchmark di previsione dei farmaci

22 agosto — Il collettivo FINAL-Bench ha pubblicato su Hugging Face un benchmark aperto di previsione delle proprietà dei farmaci: 21 tabelle, 7 discipline, 212 670 composti di training e 18 382 di test. L’articolo è meno un lancio che una dimostrazione metodologica. Sulla tabella hERG, sostituire una suddivisione temporale con una casuale fa passare l’AUROC da 0,606 a 0,818, con molecole, fingerprint, algoritmo e iperparametri identici: il campionamento casuale distribuisce una stessa serie chimica su entrambi i lati del set di test. Seconda constatazione, sulla qualità delle etichette: il piano di rumore di hERG si attesta a 0,421, e sulle 19 tabelle di regressione, prevedere semplicemente la media ottiene il miglior errore assoluto in sette di esse.

Suddivisione dei dati hERGAUROC ottenutaMAE del modelloMAE della costante
Temporale, taglio nel 20220,6060,5990,589
Casuale, media di 5 semi0,8180,4570,671

🔗 Articolo FINAL-Bench su Hugging Face


Brevi

  • Perché l’avvio di sessione dal telefono ha richiesto così tanto tempo — Il giorno dopo l’annuncio ripreso ieri, Boris Cherny spiega il 22 agosto che la sicurezza di default ha fissato il calendario: fiducia e verifica del dispositivo, protezione contro l’iniezione di prompt. Altri aggiornamenti seguiranno. 🔗 Thread @bcherny
  • GitHub rilancia il cooldown di Dependabot — Gli aggiornamenti di versione senza implicazioni di sicurezza attendono tre giorni, il tempo necessario affinché gli scanner rilevino una versione avvelenata; le correzioni di sicurezza restano immediate. Ritardo regolabile tramite cooldown. Post del 23 luglio rilanciato il 23 agosto. 🔗 Tweet @github
  • Stable Audio 3.0 all’Music Technology Hackathon di Montréal — Hackathon di 48 ore il 22 e 23 agosto con Music Hackspace e MUTEK, attorno a strumenti per produttori musicali. Stability AI vi difende i pesi aperti: trasparenza, controllo artistico, voce in capitolo sull’uso della tecnologia. 🔗 Video di chiusura
  • DOOM gira su un processore progettato da GPT-5.6 Sol — Il modello ha assemblato nel gioco Turing Complete un processore RV32IM battezzato Codex-R32, sul quale gira il porting PureDOOM compilato in codice macchina nativo. Dimostrazione rilanciata il 23 agosto da @OpenAIDevs. 🔗 Thread @Angaisb_

Cosa significa

Nessun modello è uscito questo fine settimana, ed è questo che rende la giornata leggibile. Ciò che si muove è il deployment dei modelli esistenti, il numero di persone che li usa e la correzione di ciò che intralcia l’utilizzo. Gli attori lavorano sull’adozione, non sull’annuncio.

Sul tooling di sviluppo, la testimonianza di Boris Cherny vale soprattutto per il limite che pone nella stessa frase: la programmazione gli sembra risolta per una parte dei praticanti, l’ingegneria no, e si premura di citare un esperto per il quale il primo livello non è nemmeno raggiunto. L’ammissione sulla verbosità di Opus va nella stessa direzione: il comportamento predefinito di un modello diventa un vero e proprio tema di prodotto. Un rimedio di configurazione come outputStyle=concise sposta il carico sull’utente, cosa che Anthropic assume esplicitamente qualificandolo come correzione provvisoria.

Il deployment su scala prende tre forme distinte questo fine settimana. Gemini 3.7 Flash esce dal perimetro degli abbonati e degli sviluppatori per entrare in Search, cosa che è economicamente sostenibile grazie a un costo di 0,25 USD per task su ARC-AGI-2 per un punteggio di 84,6 %. Gemma, da parte sua, misura la propria adozione in download e varianti della community, con deployment in orbita e nella sanità pubblica che non somigliano a nessun caso d’uso dimostrativo. Amp, infine, trae la conseguenza di un uso che non aveva previsto: quando le anteprime usa e getta diventano applicazioni durature, bisogna dare loro un indirizzo stabile.

Resta la questione della misurazione, e LEADBOARD arriva al momento giusto. Un divario di 0,21 punti di AUROC ottenuto senza cambiare una riga di modello, una previsione costante che batte i modelli su sette tabelle di regressione su diciannove: un punteggio pubblicato senza la sua suddivisione, il suo piano di rumore e i suoi riferimenti triviali non è interpretabile. È esattamente ciò che dà peso ai numeri ARC-AGI messi in evidenza da Google nello stesso fine settimana — misure di terze parti, in modalità verificata, e non risultati interni.


Fonti