Le 23 août, la journée parle moins de nouvelles capacités que d’usage réel. Boris Cherny, créateur de Claude Code, explique qu’il n’écrit plus de code à la main depuis novembre 2025 et situe Claude sur trois paliers de capacité ; il reconnaît dans la foulée la verbosité d’Opus comme une priorité de correction pour Anthropic. Chez Google, Gemini 3.7 Flash, sorti le 13 août, devient le modèle Gemini adopté le plus vite et entre dans Google Search, pendant que la famille ouverte Gemma franchit le milliard de téléchargements. Amp donne des noms de domaine lisibles aux applications hébergées sur ses orbs, et un benchmark ouvert de prédiction de propriétés de médicaments publie son plancher de bruit à côté de chaque score.
Boris Cherny situe Claude sur trois paliers et ne code plus à la main depuis novembre 2025
23 août — Le créateur de Claude Code décompose la progression des modèles en trois paliers : coder mieux que lui ; faire mieux que lui le travail d’ingénierie autour du code, du débogage à la conception système ; puis surpasser la plupart des gens sur la plupart des tâches faisables sur un ordinateur. Il situe Claude au premier palier et à une partie du deuxième, et désigne Opus 4.8 comme le premier modèle à lui avoir semblé meilleur que lui. Nuance qu’il apporte : pour Anders Hejlsberg, concepteur de TypeScript, le premier palier n’est peut-être pas franchi.
Back in Nov 2025 I fully stopped writing code by hand, though I continue to code (using agents) every day. […] But engineering is more than coding.
🇫🇷 En novembre 2025, j’ai complètement arrêté d’écrire du code à la main, tout en continuant à coder (avec des agents) tous les jours. […] Mais l’ingénierie, c’est plus que du codage. — @bcherny sur X
Anthropic reconnaît la verbosité d’Opus comme une priorité et livre un palliatif
23 août — Interpellé sur les défauts d’Opus, Boris Cherny répond par une reconnaissance publique directe : la verbosité est un problème identifié, prioritaire pour l’équipe. En attendant, la commande claude /config outputStyle=concise active le style Concise annoncé le 20 août. C’est la vraie information : Concise n’est pas une option de confort, mais la réponse provisoire à un comportement que l’équipe cherche à corriger en amont.
Le même échange contient un conseil d’usage formulé la veille, le 22 août : Opus serait sous-utilisé pour l’optimisation itérative — consommation CPU et mémoire, temps de CI, latence, fréquence d’images — selon un motif reproductible, itérer sur X avec un profileur et un jeu de données jusqu’à atteindre Y.
We know Opus is not perfect, and it is a big priority for the team to fix it.
🇫🇷 Nous savons qu’Opus n’est pas parfait, et le corriger est une grande priorité pour l’équipe. — @bcherny sur X
🔗 Opus et l’optimisation itérative
Gemini 3.7 Flash entre dans Google Search après une adoption record
22 août — Sundar Pichai n’annonce pas un modèle : Gemini 3.7 Flash est sorti le 13 août. Il annonce une adoption, la plus rapide de la famille Gemini, et un déploiement : le modèle tourne désormais dans Google Search, en plus de l’app Gemini. Au lancement, il n’était accessible qu’aux abonnés Pro et Ultra via Spark, au Gemini Enterprise Agent Platform et à l’API — son passage dans Search change l’échelle d’exposition.
| Benchmark évalué | Score obtenu | Coût par tâche (USD) |
|---|---|---|
| ARC-AGI-1 | 95,5 % | 0,12 |
| ARC-AGI-2 | 84,6 % | 0,25 |
Gemini 3.7 Flash smashed previous Gemini growth records in its first week, making it our fastest growing model yet.
🇫🇷 Gemini 3.7 Flash a pulvérisé les précédents records de croissance de Gemini dès sa première semaine, ce qui en fait notre modèle à la croissance la plus rapide à ce jour. — @sundarpichai sur X
🔗 Scores ARC-AGI publiés le 20 août par ARC Prize
Gemma franchit le milliard de téléchargements et Google publie le dépôt Awesome Gemma
20 août — Clement Farabet et Olivier Lacombe, de Google DeepMind, annoncent que la famille de modèles ouverts Gemma a dépassé le milliard de téléchargements cumulés, avec plus de 100 000 variantes publiées par la communauté en deux ans. Les déploiements cités donnent la mesure de l’amplitude : la NASA, Satlyt et Starcloud exécutent Gemma à bord de satellites pour l’analyse d’images embarquée ; en Inde, la National Health Authority a intégré Gemma 4 dans Aarogya Setu 2.0 pour normaliser des comptes rendus médicaux. Côté recherche, C2S-Scale, construit sur Gemma par Yale et Google, a identifié une voie thérapeutique anticancéreuse ensuite vérifiée sur cellules vivantes. Google accompagne le jalon d’un livrable pour les développeurs : le dépôt GitHub Awesome Gemma, annuaire officiel des projets et tutoriels de cet écosystème.
| Indicateur mesuré | Valeur annoncée |
|---|---|
| Téléchargements cumulés de Gemma | plus de 1 milliard |
| Variantes publiées par la communauté | plus de 100 000 |
| Projets soumis au Gemma Challenge | plus de 1 600 |
Amp donne des noms de domaine lisibles aux portals de ses orbs
23 août — Un orb est la machine distante et jetable sur laquelle Amp exécute un agent ; un portal est la porte d’entrée HTTP qui permet d’ouvrir dans un navigateur l’application en cours de construction dans cet orb. Chaque portal recevait une adresse auto-générée illisible, du type t-01a0095e-9568-whatever-p1234.onamp.dev — utilisable pour un coup d’œil, beaucoup moins pour un lien transmis à une équipe. Trois options les remplacent : un préfixe personnalisé, un domaine personnel, ou un domaine d’espace de travail (workspace). Amp donne l’exemple de park.mixfox.org, adresse ordinaire qui sert une application hébergée sur un orb. La configuration se fait depuis l’onglet Portal ou en le demandant à l’agent. La motivation affichée compte autant que la fonctionnalité : les portals servent de moins en moins de prévisualisation éphémère et de plus en plus d’applications durables. Une limite demeure, confirmée par Quinn Slack : le partage ne franchit pas les frontières de l’espace de travail.
LEADBOARD publie le plancher de bruit de ses benchmarks de prédiction de médicaments
22 août — Le collectif FINAL-Bench a mis en ligne sur Hugging Face un benchmark ouvert de prédiction de propriétés de médicaments : 21 tableaux, 7 disciplines, 212 670 composés d’entraînement et 18 382 de test. L’article est moins un lancement qu’une démonstration méthodologique. Sur le tableau hERG, remplacer un découpage temporel par un découpage aléatoire fait passer l’AUROC de 0,606 à 0,818, à molécules, empreintes, algorithme et hyperparamètres identiques : le tirage aléatoire répartit une même série chimique de part et d’autre du jeu de test. Second constat, sur la qualité des étiquettes : le plancher de bruit de hERG s’établit à 0,421, et sur les 19 tableaux de régression, prédire simplement la moyenne obtient la meilleure erreur absolue sur sept d’entre eux.
| Découpage des données hERG | AUROC obtenue | MAE du modèle | MAE de la constante |
|---|---|---|---|
| Temporel, coupure en 2022 | 0,606 | 0,599 | 0,589 |
| Aléatoire, moyenne de 5 graines | 0,818 | 0,457 | 0,671 |
🔗 Article FINAL-Bench sur Hugging Face
Brèves
- Pourquoi le démarrage de session depuis le téléphone a pris si longtemps — Au lendemain de l’annonce couverte hier, Boris Cherny explique le 22 août que la sécurité par défaut a fixé le calendrier : confiance et vérification d’appareil, protection contre l’injection de prompt. D’autres mises à jour suivront. 🔗 Fil @bcherny
- GitHub remet en avant le cooldown de Dependabot — Les montées de version sans enjeu de sécurité attendent trois jours, le temps que les scanners repèrent une version empoisonnée ; les correctifs de sécurité restent immédiats. Délai réglable via
cooldown. Billet du 23 juillet remis en avant le 23 août. 🔗 Tweet @github - Stable Audio 3.0 au Music Technology Hackathon de Montréal — Hackathon de 48 heures les 22 et 23 août avec Music Hackspace et MUTEK, autour d’outils pour producteurs de musique. Stability AI y défend les poids ouverts : transparence, contrôle artistique, voix au chapitre sur l’usage de la technologie. 🔗 Vidéo de clôture
- DOOM tourne sur un processeur conçu par GPT-5.6 Sol — Le modèle a assemblé dans le jeu Turing Complete un processeur RV32IM baptisé Codex-R32, sur lequel s’exécute le portage PureDOOM compilé en code machine natif. Démonstration relayée le 23 août par @OpenAIDevs. 🔗 Fil @Angaisb_
Ce que ça signifie
Aucun modèle n’est sorti ce week-end, et c’est ce qui rend la journée lisible. Ce qui bouge, c’est le déploiement des modèles existants, le nombre de mains qui s’en servent, et la correction de ce qui gêne à l’usage. Les acteurs travaillent l’adoption, pas l’annonce.
Sur l’outillage de développement, le témoignage de Boris Cherny vaut surtout par la limite qu’il pose dans la même phrase : le codage lui semble résolu pour une partie des praticiens, l’ingénierie non, et il prend soin de citer un expert pour lequel le premier palier n’est même pas atteint. L’aveu sur la verbosité d’Opus va dans le même sens : le comportement par défaut d’un modèle devient un sujet produit à part entière. Un palliatif de configuration comme outputStyle=concise déplace la charge sur l’utilisateur, ce qu’Anthropic assume explicitement en le qualifiant de correctif provisoire.
Le déploiement à l’échelle prend trois formes distinctes ce week-end. Gemini 3.7 Flash quitte le périmètre des abonnés et des développeurs pour entrer dans Search, ce que rend économiquement tenable un coût de 0,25 USD par tâche sur ARC-AGI-2 pour un score de 84,6 %. Gemma, de son côté, mesure son adoption en téléchargements et en variantes communautaires, avec des déploiements en orbite et en santé publique qui ne ressemblent à aucun cas d’usage de démonstration. Amp, enfin, tire la conséquence d’un usage qu’il n’avait pas prévu : quand les prévisualisations jetables deviennent des applications durables, il faut leur donner une adresse stable.
Reste la question de la mesure, et LEADBOARD tombe au bon moment. Un écart de 0,21 point d’AUROC obtenu sans changer une ligne de modèle, une prédiction constante qui bat les modèles sur sept tableaux de régression sur dix-neuf : un score publié sans son découpage, son plancher de bruit et ses références triviales n’est pas interprétable. C’est exactement ce qui donne du poids aux chiffres ARC-AGI mis en avant par Google le même week-end — des mesures tierces, en mode vérifié, et non des résultats maison.
Sources
- Boris Cherny — trois paliers de capacité
- Boris Cherny — verbosité d’Opus et style Concise
- Boris Cherny — Opus et l’optimisation itérative
- Boris Cherny — sécurité du démarrage de session à distance
- Sundar Pichai — Gemini 3.7 Flash dans Search
- Logan Kilpatrick — croissance de Gemini 3.7 Flash
- ARC Prize — résultats ARC-AGI de Gemini 3.7 Flash
- Google DeepMind — Gemma dépasse le milliard de téléchargements
- Amp — noms de domaine pour les portals d’orbs
- Quinn Slack — le partage reste limité au workspace
- FINAL-Bench — LEADBOARD sur Hugging Face
- LEADBOARD — Space Hugging Face
- GitHub — le cooldown de Dependabot
- GitHub Blog — the case for a cooldown
- Stability AI — hackathon de Montréal
- DOOM sur le processeur Codex-R32