Mistral ouvre en préversion Mistral Large 4, un modèle multimodal de 1 000 milliards de paramètres dont l’API est accessible à tous dès aujourd’hui et dont les poids sont promis pour fin octobre. Anthropic installe Claude dans Google Docs, Sheets et Slides et refond son programme de vérification cyber en trois niveaux d’accès, pendant que Google DeepMind publie EmbeddingGemma 2, un modèle d’embeddings ouvert et multimodal qui tient sur un téléphone. Les modèles de décision ont aussi leur journée : OpenAI ouvre son API Decisions en bêta publique, Perplexity divise son prix par deux et un classement communautaire les départage.
Mistral Large 4 : 1 000 milliards de paramètres en préversion, poids promis fin octobre
6 octobre — Mistral AI lance en préversion publique Mistral Large 4, surnommé ML4 et, « très officiellement », le Chonk. C’est le plus grand modèle de l’entreprise à ce jour : un mélange d’experts (Mixture-of-Experts) nativement multimodal de 1 000 milliards de paramètres (1T), dont 49 milliards actifs selon le billet d’annonce, qui réunit instructions, raisonnement et capacités agentiques dans un contexte d’un million de tokens. La fiche de la documentation donne d’autres chiffres, sans expliquer l’écart : 1 050 milliards de paramètres, dont 52 milliards actifs, plus un encodeur de vision de 1,6 milliard.
L’API est ouverte à tous dès aujourd’hui sur Mistral Studio, mais les poids ne sont pas encore publiés : Mistral les promet d’ici la fin octobre, avec des détails sur l’architecture et le post-entraînement. En attendant, le modèle est éprouvé en conditions réelles par des responsables de cybersécurité, des partenaires vérifiés et des autorités étatiques, qui y accèdent avec une modération réduite. ML4 a été entraîné de zéro sur 3 800 GPU NVIDIA Grace Blackwell dans les centres de données européens de Mistral, qui servent aussi la préversion. L’entreprise prévoit un déploiement européen qu’elle opère de bout en bout, sous droit européen, et présente le modèle comme le premier jalon de la feuille de route financée par sa Série D de 3 milliards d’euros.
La cybersécurité est l’argument principal. Selon Mistral, ML4 figure parmi les cinq premiers modèles de l’Artificial Analysis Cyber Index et obtient 82 % sur l’un de ses tests, qui consiste à reproduire une vraie faille d’un logiciel open source puis à la corriger, le meilleur score de tous les modèles. L’entreprise affirme que Claude Opus 5.5 et GPT-6 Astra obtiennent près de zéro sur ce même test, parce qu’ils refusent la tâche.
| Benchmark évalué | Score annoncé par Mistral | Comparaison citée par Mistral |
|---|---|---|
| DeepSWE v1.1 | 61,7 % | — |
| Coding Agent Index (combiné) | 49,8 % | devant DeepSeek V4 Pro 0813 et Qwen3.8 Max |
| Évaluation humaine à l’aveugle de Surge AI (code, sur 5) | 3,74, 2e sur 5 | derrière Claude Opus 5 (4,22) |
| Cybench (40 défis) | 93 % | — |
| AA Cyber Index, reproduire puis corriger une faille | 82 % | meilleur score de tous les modèles |
| AutomationBench (657 processus métier) | 59,9 % | devant Kimi K3, MiMo-V2.6-Pro et DeepSeek V4 Pro |
Le billet et la fiche divergent aussi sur le prix : la carte du billet affiche 1,36 dollar par million de tokens en entrée et 4,18 dollars en sortie, quand la fiche barre ces tarifs et affiche à côté un prix divisé par deux, sans durée ni explication.
| Caractéristique de ML4 | Selon le billet d’annonce | Selon la fiche de la documentation |
|---|---|---|
| Paramètres au total | 1 000 milliards | 1 050 milliards |
| Paramètres actifs | 49 milliards | 52 milliards |
| Entrée, par million de tokens | 1,36 dollar | 0,68 dollar (1,36 barré) |
| Sortie, par million de tokens | 4,18 dollars | 2,09 dollars (4,18 barré) |
Tous ces scores sont ceux de Mistral, qui précise que l’apprentissage par renforcement de la préversion se poursuit sans signe de saturation et attend des progrès rapides dans les semaines à venir.
🔗 Billet de Mistral sur Mistral Large 4 🔗 Fiche Mistral Large 4 dans la documentation
Claude for Google Workspace : Claude s’installe dans Docs, Sheets et Slides
6 octobre — Anthropic lance Claude for Google Workspace, un module complémentaire (add-on) qui ouvre Claude dans un panneau latéral de Google Docs, Sheets et Slides, en bêta publique sur tous les forfaits payants. Claude lit le fichier ouvert, voit la sélection en cours (texte, cellules ou diapositives) et modifie le fichier sur place.
| Application Google | Ce que Claude y fait |
|---|---|
| Docs | Corrections et changements de style sur place, cartes de suggestion à appliquer ou ignorer pour les réécritures plus lourdes |
| Sheets | Formules, tableaux croisés dynamiques, graphiques natifs, nouveaux onglets, passage d’une plage par Python pour une jointure ou un nettoyage |
| Slides | Diapositives tirées des mises en page et du thème de la présentation, contrôle des éléments qui se chevauchent ou débordent |
L’utilisateur choisit le degré d’autonomie : en mode « demander avant de modifier » (Ask before edits), actif par défaut, chaque modification passe par une carte d’approbation ; en mode « tout accepter » (Accept all edits), Claude enchaîne sans s’arrêter. Connecté au compte Claude, le panneau reprend les mêmes modèles, connecteurs et compétences (skills). Sur les forfaits Enterprise, la Compliance API, les clés de chiffrement gérées par le client (CMEK) et l’export d’audit OpenTelemetry s’appliquent aussi au module.
Claude now works inside Google Docs, Sheets, and Slides, and those files also open inside Claude. In Google Workspace, Claude sits in a sidebar next to your file, reads what you have open, and edits it in place. You can approve each edit before it lands.
🇫🇷 Claude fonctionne désormais dans Google Docs, Sheets et Slides, et ces fichiers s’ouvrent aussi dans Claude. Dans Google Workspace, Claude se place dans un panneau latéral à côté de votre fichier, lit ce que vous avez ouvert et le modifie sur place. Vous pouvez approuver chaque modification avant qu’elle ne s’applique. — @claudeai sur X
Le sens inverse arrive en même temps : de nouveaux connecteurs Google Docs, Sheets et Slides, eux aussi en bêta, permettent de créer et de modifier des fichiers Google depuis Claude, en collant un lien ou en demandant un nouveau document. Sur les configurations prises en charge, le fichier s’ouvre dans un panneau à côté de la conversation, et l’accès de Claude suit les permissions de partage de Google. Le module s’installe depuis le Google Workspace Marketplace (Extensions > Claude > Open Claude) et les administrateurs peuvent le déployer depuis la console Google Admin ; sur Team et Enterprise, un propriétaire doit d’abord activer les connecteurs. Google Workspace rejoint ainsi Microsoft 365, où Claude pour Excel, PowerPoint et Word est en disponibilité générale depuis le 7 mai.
🔗 Billet d’Anthropic sur Claude for Google Workspace
Cyber Verification Program : Anthropic ouvre Opus 5.5, Sonnet 5.5 et Mythos 5.1 en trois niveaux d’accès
6 octobre — Anthropic refond son programme de vérification cyber (Cyber Verification Program, CVP), qui ouvre aux professionnels de la sécurité vérifiés des capacités que ses modèles grand public bloquent. Deux dispositifs coexistaient depuis six mois : Project Glasswing, qui donnait accès à Claude Mythos aux organisations chargées des logiciels les plus critiques, et un CVP à niveau unique qui allégeait les garde-fous des modèles Opus et Sonnet. Ils fusionnent en trois niveaux, qui donnent tous accès à Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 et aux modèles à venir. Les modèles en disponibilité générale (Opus 5.5, Fable 5.1, Sonnet 5.5) gardent, eux, des garde-fous prudents qui bloquent la plupart du travail cyber.
| Niveau d’accès | Usages couverts | Public visé et délai |
|---|---|---|
| Defense Access | Centre opérationnel de sécurité, réponse à incident, rétro-ingénierie de logiciels malveillants, analyse de vulnérabilités | Équipes de sécurité, infrastructures critiques de toute taille, mainteneurs open source, chercheurs ; quelques jours |
| Red Team Access | Usages défensifs, plus tests d’intrusion et exercices d’attaque simulée (red teaming) autorisés | Organisations seulement, sur les systèmes qu’elles sont autorisées à tester ; quelques semaines |
| Specialized Access | Tests de systèmes de sûreté : aviation, réseaux électriques, télécoms, virements interbancaires, réseaux administratifs | Quelques organisations examinées une à une avec le gouvernement américain ; membres de Glasswing transférés |
En Red Team Access, les actions pouvant causer des dommages physiques ou une perturbation massive, comme déployer un rançongiciel, restent bloquées en temps réel. Pour vérifier ses réglages, Anthropic a fait passer à Opus 5.5 CyScenarioBench, une évaluation d’opérations cyber en plusieurs étapes, avec les garde-fous de chaque niveau (10 défis, 5 essais chacun).
| Configuration testée par Anthropic (Opus 5.5) | Résultat sur CyScenarioBench (50 essais) |
|---|---|
| Sans CVP | Toutes les tâches bloquées dès le premier prompt |
| Defense Access | 46 essais bloqués à un moment, 4 réussis |
| Red Team Access | Aucun blocage, 34 tâches réussies, l’équivalent des 67,6 % du modèle sans garde-fous |
Le billet dresse aussi un premier bilan de Glasswing, avec des chiffres partiels selon Anthropic : au moins 129 000 vulnérabilités vérifiées trouvées par les partenaires d’avril à juillet, plus 5 500 par les analyses open source d’Anthropic, dont plus de 33 000 classées critiques ou élevées. Ils reposent sur 33 rapports de partenaires, et Anthropic estime l’impact réel « au moins cinq fois plus élevé ». Dans un témoignage publié le même jour, Comcast dit avoir trouvé avec Claude Mythos Preview une faille d’authentification critique en évaluant 258 systèmes et environ 170 millions de lignes de code, et un analyste de Booz Allen a passé en revue 138 dépôts en douze jours.
Côté pratique, le programme exige la rétention des données pour surveiller les abus, en attendant Enterprise Frontier Safeguards (EFS), qui permettra plus tard cet automne de garder ces données dans un cloud contrôlé par le client ; les organisations qui utilisent déjà Fable 5.1 ou Mythos 5.1 en rétention zéro peuvent faire de même avec le CVP. Le programme est ouvert sur Claude Platform, Vertex AI et Microsoft Foundry, et sur Amazon Bedrock pour les seuls clients éligibles à EFS. Une candidature individuelle n’est possible que pour Defense Access, sur un forfait payant, et ce niveau devra adopter d’ici le 15 décembre une authentification multifacteur résistante à l’hameçonnage et renoncer aux clés API. Un webinaire est prévu le 14 octobre à 9 h PT.
🔗 Billet d’Anthropic sur le Cyber Verification Program 🔗 Page d’aide du Cyber Verification Program 🔗 Comcast et Booz Allen avec Claude Mythos
EmbeddingGemma 2 : le modèle d’embeddings ouvert de Google devient multimodal
6 octobre — Google DeepMind publie EmbeddingGemma 2, la deuxième génération de son modèle d’embeddings ouvert conçu pour tourner sur l’appareil. Le premier EmbeddingGemma, téléchargé plus de 20 millions de fois selon Google, ne traitait que le texte ; le nouveau projette texte (code compris), images, vidéo et audio, seuls ou combinés, dans un même espace de 768 dimensions. Bâti sur l’architecture de Gemma 4, il sort sous licence Apache 2.0.
Meet EmbeddingGemma 2, our first natively multimodal open model for on-device embeddings. It expands beyond text to unify code, images, audio, and video in a shared space.
🇫🇷 Voici EmbeddingGemma 2, notre premier modèle ouvert nativement multimodal pour les embeddings sur l’appareil. Il va au-delà du texte pour unifier code, images, audio et vidéo dans un espace partagé. — @GoogleDeepMind sur X
Le modèle compte 740 millions de paramètres, mais il est modulaire : un cœur texte de 270M auquel s’ajoutent à la demande un encodeur de vision (170M) et un encodeur audio (300M). Une application texte seule ne charge donc que 270M paramètres. Avec quantification, Google mesure sur un Pixel 11 Pro environ 191 Mo de RAM active pour les poids texte et 567 Mo pour le modèle multimodal complet.
| Caractéristique d’EmbeddingGemma 2 | Valeur annoncée par Google |
|---|---|
| Paramètres au total | 740M (texte 270M, vision 170M, audio 300M) |
| Dimensions des vecteurs | 768, tronquables à 512, 256 ou 128 |
| Fenêtre de contexte | 8K tokens, quatre fois celle de la première version |
| RAM active sur Pixel 11 Pro (quantifié) | environ 191 Mo en texte seul, 567 Mo en multimodal |
| MTEB Code | 78,68, contre 68,76 pour la première version |
| MTEB multilingue v2 | 61,36, contre 61,15 pour la première version |
L’apprentissage de représentations « en poupées russes » (Matryoshka Representation Learning) permet de raccourcir les vecteurs, pour un stockage jusqu’à six fois plus léger ; selon la fiche du modèle, la qualité reste peu affectée jusqu’à 256 dimensions, et 128 dimensions conviennent surtout aux usages texte seul. Le gain le plus net concerne le code, avec près de dix points de plus sur MTEB Code selon Google, quand le texte multilingue reste au niveau précédent.
Les usages visés sont la recherche et la génération augmentée par récupération (RAG) entièrement locales, par exemple retrouver un passage d’une vidéo à partir d’un mémo vocal. Comme le modèle partage le segmenteur de texte (tokenizer) et l’encodeur audio de Gemma 4, les deux peuvent tourner ensemble avec une empreinte mémoire réduite. Les poids sont disponibles sur Hugging Face et Kaggle ; l’arrivée dans le Model Garden de Gemini Enterprise Agent Platform est annoncée « bientôt », sans date. Le modèle est pris en charge dès sa sortie par Transformers (version 5.19.0), sentence-transformers, MLX, vLLM, llama.cpp, Ollama et LM Studio, ainsi que dans le navigateur avec transformers.js.
🔗 Annonce sur le blog Google 🔗 Fiche modèle EmbeddingGemma 2 🔗 Poids sur Hugging Face
Modèles de décision : OpenAI ouvre son API Decisions, Perplexity publie Decider v1.1 et divise son prix par deux, le Decision Index 0.3 les classe
Les modèles de décision, qui choisissent une option ou notent une entrée au lieu de rédiger une réponse libre, ont eu leur journée : deux éditeurs revoient leur offre et leur tarif, et le classement communautaire de la catégorie change de méthode.
L’API Decisions d’OpenAI en bêta publique
6 octobre — Une semaine après son ouverture en accès limité au DevDay, l’API Decisions d’OpenAI passe en bêta publique, avec une disponibilité générale attendue « dans les prochaines semaines ». Elle répond à des questions fermées sur un texte, une image ou les deux, avec GPT-6 Luna, seul modèle disponible, via un point d’accès dédié (POST /v1/decisions) ; selon OpenAI, ses réponses typées arrivent environ 10 fois plus vite qu’avec la Responses API. La nouveauté du jour est le tarif : 0,10 dollar par million de tokens en entrée, sans facturation de la sortie ni du cache, surcoûts de traitement régional et de long contexte en sus.
| Type de question | Usage visé | Résultat renvoyé |
|---|---|---|
Prédicat (predicate) | Vérifier une condition, comme un produit abîmé sur une photo | Probabilité de 0 à 1 que la condition soit vraie |
Choix (choice) | Retenir une option dans une liste fournie | L’option, la probabilité de chacune et un indice de confiance |
Score (score) | Noter sur des niveaux ordonnés, comme la gravité d’un incident | Moyenne des niveaux pondérée par les probabilités |
Plusieurs questions peuvent porter sur la même entrée dans une seule requête, et les images doivent être envoyées en base64, sans URL hébergée ni identifiant de fichier. L’API prend en charge la non-conservation des données (Zero Data Retention) et les usages HIPAA pour les clients éligibles, avec résidence des données aux États-Unis et en Europe.
🔗 Guide de l’API Decisions 🔗 Changelog de l’API OpenAI
pplx-decider-v1.1-27b de Perplexity et le prix divisé par deux
6 octobre — Cinq jours après avoir lancé sa propre Decisions API, Perplexity met à jour le modèle qui la fait tourner, dans un fil de son compte pour développeurs, @perplexitydevs. Publié à poids ouverts sous licence Apache 2.0 sur Hugging Face, pplx-decider-v1.1-27b garde la base Qwen3.8-27B de la v1, lit le texte et les images dans un contexte de 250k tokens et lève le masque causal (causal mask) de ses couches à attention complète. La Decisions API, qui sert désormais ce modèle, coûte 0,02 dollar par million de tokens en entrée, deux fois moins que les 0,04 dollar de la v1, et la sortie reste gratuite.
| Catégorie du Decision Index (fiche Hugging Face) | Score de Jev | Score de la v1 | Score de la v1.1 |
|---|---|---|---|
| Connaissances (Knowledge) | 51,4 | 40,9 | 48,18 |
| Langage (Language) | 62,0 | 63,5 | 69,45 |
| Recherche d’information (Retrieval) | 55,4 | 54,9 | 61,26 |
| Outils (Tools) | 75,1 | 79,3 | 78,88 |
| Arts (Arts) | 37,7 | 39,4 | 44,66 |
| Score global pondéré | 57,9 | 56,4 | 61,56 |
Selon la fiche du modèle, le score global passe de 56,4 à 61,56, devant les 57,9 de Jev, le modèle de décision de TypeSafe AI, qui reste toutefois devant en connaissances. Perplexity affirme aussi obtenir le meilleur score du nouveau Decision Index 0.3. Pour l’héberger soi-même, il faut un GPU capable de loger environ 49 Gio de poids et l’implémentation fournie, car une inférence causale standard ne reproduit pas le comportement mesuré.
🔗 Le fil de @perplexitydevs sur X 🔗 pplx-decider-v1.1-27b sur Hugging Face
Le Decision Index 0.3
6 octobre — apolinario, ingénieur chez Hugging Face, publie la version 0.3 du Decision Index, le classement communautaire des modèles de décision ouverts qui reproduisent le Decision Model de Jev. Il compte désormais 112 modèles, dont 111 reproductions ouvertes, qui tournent sur une NVIDIA RTX PRO 6000. La méthode change : le score complet (Full score) combine 37 bancs publics, des tests privés qui mesurent les mêmes compétences et des tâches privées issues de nouveaux domaines, pour que le rang reflète des compétences et pas seulement la réussite sur des bancs connus. Un onglet vision fait aussi son apparition.
| Rang affiché | Modèle classé | Score complet |
|---|---|---|
| 1 | Perplexity Decider v1.1 (27B) | 62,8 |
| 2 | Fastino GLiDE sans réflexion (28B) | 60,2 |
| Référence | Jev | 60,1 |
| 3 | Torchcast Decision 27B | 59,9 |
| 4 | deck31b (Gemma 4 31B) | 59,0 |
Les deux scores de Decider v1.1 ne se confondent pas : 61,56 est celui que publie la fiche de Perplexity, 62,8 celui que calcule ce classement avec sa nouvelle méthode. Les tests privés, par nature, ne sont pas publiés.
🔗 L’annonce d’apolinario sur X 🔗 Le Decision Index 0.3
Contrôle de l’ordinateur : OpenAI entraîne GPT-6 Astra sur les contrats d’Ironclad
6 octobre — OpenAI lance des collaborations de recherche avec des éditeurs de logiciels pour rendre ses agents plus efficaces dans les logiciels métier, un chantier de contrôle de l’ordinateur (computer use), et commence avec Ironclad, spécialiste des contrats assistés par IA. Les équipes ont défini 11 tâches de juridique, de commercial et d’achats, de 30 à 40 minutes chacune pour un utilisateur expérimenté selon OpenAI, évaluées sur 8 à 50 critères. Ironclad a fourni des environnements hébergés de son logiciel, où les modèles se sont entraînés par apprentissage par renforcement sur des tâches synthétiques tirées de contrats publics de la base EDGAR de la SEC.
| Mesure d’OpenAI sur les 11 tâches | GPT-5.6 Sol (raisonnement High) | GPT-6 Astra (raisonnement Max) |
|---|---|---|
| Score moyen | 41,6 % | 55,0 % (+32 %) |
| Temps moyen estimé par tentative (simulé) | 37,0 minutes | 19,2 minutes (-48 %) |
GPT-6 Astra est le premier modèle de frontière d’OpenAI entraîné sur ces tâches, et un modèle interne utilisé pendant son développement atteint 63,7 %. Ces chiffres sont ceux d’OpenAI, et les temps sont simulés à partir de vitesses de traitement supposées, non mesurés chez des clients. OpenAI invite d’autres éditeurs à proposer des tâches que les agents actuels ne réussissent pas encore de façon fiable.
🔗 Billet d’OpenAI sur sa collaboration avec Ironclad
API et plateformes : paliers et BAA de l’API OpenAI, documents et images dans l’Agent API de Perplexity, GLM-5.3 sur Bedrock
Quatre changements concernent les développeurs qui achètent de l’inférence : les conditions d’accès à l’API d’OpenAI, les outils de l’Agent API de Perplexity et un nouveau modèle ouvert au catalogue d’AWS.
Les paliers d’usage de l’API OpenAI passent de cinq à trois
6 octobre — OpenAI simplifie l’accès aux limites de débit (rate limits) les plus élevées de son API : les cinq paliers d’usage payants deviennent trois, Build, Launch et Grow. Le plus haut, Grow, s’obtient avec 500 dollars de paiements API cumulés, contre 1 000 dollars pour l’ancien palier le plus élevé. Les organisations déjà sur un palier payant basculent automatiquement, sans action de leur part, puis montent de palier quand leurs achats de crédits cumulés atteignent les seuils ; le palier gratuit reste plafonné à 100 dollars par mois.
| Palier d’usage | Seuil d’achats cumulés | Plafond d’usage mensuel | Astra, Sol et Terra (requêtes et tokens par minute) | Luna (requêtes et tokens par minute) |
|---|---|---|---|---|
| Build | 5 dollars | 500 dollars | 5 000 et 1 000 000 | 5 000 et 2 000 000 |
| Launch | 100 dollars | 5 000 dollars | 10 000 et 4 000 000 | 10 000 et 10 000 000 |
| Grow | 500 dollars | 200 000 dollars | 15 000 et 40 000 000 | 30 000 et 180 000 000 |
🔗 Le fil de @OpenAIDevs sur X 🔗 Documentation des limites de débit
Le BAA et la conformité HIPAA en libre-service sur l’API OpenAI
5 octobre — Les organisations qui traitent des données de santé protégées avec l’API d’OpenAI peuvent désormais signer elles-mêmes l’accord de partenaire commercial (Business Associate Agreement, BAA) qu’exige la loi américaine HIPAA. Dans Settings > Organization > General, un administrateur accepte le BAA standard et active le support de conformité HIPAA, sans contrat entreprise. Ce libre-service est réservé aux organisations éligibles qui ont un historique d’usage de l’API établi, et l’activation ne peut pas être annulée depuis ces réglages. Les clauses sur mesure passent toujours par une demande par e-mail, avec une réponse sous un à deux jours ouvrés. OpenAI rappelle que signer le BAA ne rend pas à lui seul une application conforme, et qu’aucun BAA n’est proposé pour ChatGPT Business.
🔗 Article d’aide d’OpenAI sur le BAA de l’API
L’Agent API de Perplexity lit les documents et cherche des images
5 octobre — Le changelog de l’API Perplexity reçoit trois entrées en fin de soirée. L’Agent API accepte désormais en entrée des documents PDF, DOC, DOCX, TXT et RTF, intégrés à la requête ou désignés par une URL HTTPS publique, la prise en charge dépendant du modèle et du fournisseur choisis. Un nouvel outil, image_search, cherche des images sur le web et renvoie des résultats structurés, avec l’adresse de l’image et celle de sa page d’origine : de 1 à 30 images par appel, 5 par défaut, des filtres de domaines et de formats, et une recherche sécurisée activée par défaut. Il coûte 2,50 dollars les 1 000 invocations réussies, et les appels échoués ne sont pas facturés. La troisième entrée corrige le décompte des coûts : les réponses détaillent désormais le coût des extractions faites dans le bac à sable, au tarif inchangé de GPT-6 Luna.
🔗 Changelog de l’API Perplexity 🔗 Documentation de l’outil image_search
GLM-5.3 de Z.ai sur Amazon Bedrock
6 octobre — Z.ai annonce l’arrivée de GLM-5.3, son modèle phare à poids ouverts, sur Amazon Bedrock ; la fiche d’AWS date le lancement du 5 octobre. C’est un mélange d’experts de 744 milliards de paramètres, dont environ 40 milliards actifs par token, avec un contexte d’un million de tokens et jusqu’à 128 000 tokens en sortie. L’accès est réservé aux clients éligibles, qui passent par leur équipe de compte AWS, et le modèle n’est servi qu’en inférence interrégions (profil US ou global), avec une mise en cache des prompts dès 1 024 tokens et les niveaux de service Standard, Priority, Flex et Reserved. La fiche ne donne pas de prix et renvoie à la page de tarification de Bedrock. GLM-5.3 suit Kimi K3 (22 septembre) et Grok 4.7 (28 septembre), arrivés sur Bedrock ces deux dernières semaines.
🔗 Fiche GLM 5.3 sur Amazon Bedrock 🔗 L’annonce de Z.ai sur X
Agents de code : Claude Code 2.1.290 à 2.1.292, sessions cloud, Vibe CLI 2.26.0, Antigravity et Replit
Les agents de code reçoivent cinq mises à jour, du terminal à l’éditeur : trois versions de Claude Code en moins de vingt heures, un guide des sessions cloud, une Vibe CLI dont la nouvelle interface en Rust s’étoffe, l’extension Antigravity pour VS Code et un Replit qui voit tous les projets de l’utilisateur.
Claude Code 2.1.290 à 2.1.292
5 et 6 octobre — Publiée le 5 octobre à 23 h 33 UTC, Claude Code 2.1.290 est une version volumineuse : 190 entrées, dont 131 correctifs. claude attach et claude logs acceptent une partie du nom d’une session à la place de son identifiant, et /claude-api managed-agents-onboard transforme le modèle Managed Agents décrit par une page web en fichiers ant apply. Le budget de recherche web de la session interactive ne s’arrête plus après 200 appels : il se recharge au rythme de 100 appels par heure. Au niveau d’effort moyen (medium), /code-review signale aussi les écarts aux conventions de CLAUDE.md sur Opus 5.5 et Sonnet 5.5. Dans Slack, Claude Tag gagne un mode rapide (!fast), un appel browser_batch de Claude in Chrome dispose de 90 secondes au lieu de 60, et WebFetch ne coupe plus en silence le texte au-delà de 100 000 caractères. pyright et davantage de formes de ps demandent une permission, et plusieurs failles de permissions sont corrigées : jokers de rg et git grep développés par le shell, CLAUDE.md liés hors des dossiers de travail, mod d’organisation contourné par un mod utilisateur. Quatre heures plus tard, la 2.1.291 corrige deux régressions, l’une apparue avec la 2.1.290 (des réponses aux invites de permission perdues dans les sessions cloud), l’autre avec la 2.1.288 (les derniers messages d’une session perdus en quittant).
Le 6 octobre à 18 h 59 UTC, la 2.1.292 (92 entrées, dont 64 correctifs) ajoute un paramètre effort à l’outil Agent, pour lancer un sous-agent au niveau d’effort demandé, et claude plugin install --marketplace, qui ajoute la place de marché (marketplace) si nécessaire puis installe le plugin. Les serveurs MCP locaux (stdio) négocient désormais par défaut le protocole 2026-07-28 (MCP_PROTOCOL_NEGOTIATION=legacy pour revenir), CLAUDE_CODE_OVERLOADED_RETRY_BASE_DELAY_MS allonge les relances sur les erreurs 529, et les mods gagnent un événement d’autocomplétion du prompt et le cache de prompt. Côté sécurité, les approbations d’un hook PreToolUse et le mode auto ne contournent plus l’invite de permission pour les lectures de chemins réseau (UNC), et les balises <system-reminder> écrites par un hook sont échappées avant d’atteindre Claude. L’outil Artifact liste enfin 200 artefacts au lieu de 50, et Code Review ventile ses statistiques par dépôt. Ni la 2.1.290 ni la 2.1.292 n’ont été annoncées sur X.
| Version de Claude Code | Date de publication (UTC) | Nombre d’entrées | Nouveauté principale |
|---|---|---|---|
| 2.1.290 | 5 octobre, 23 h 33 | 190, dont 131 correctifs | Sessions désignées par leur nom, managed-agents-onboard, budget WebSearch rechargé |
| 2.1.291 | 6 octobre, 3 h 55 | 2 correctifs | Deux régressions corrigées |
| 2.1.292 | 6 octobre, 18 h 59 | 92, dont 64 correctifs | Effort des sous-agents, plugin et place de marché en une commande, MCP 2026-07-28 |
🔗 Claude Code 2.1.290 🔗 Claude Code 2.1.291 🔗 Claude Code 2.1.292
Le guide des sessions cloud de Claude Code
6 octobre — Deux semaines après la sortie de préversion des sessions cloud de Claude Code, Anthropic publie sur claude.dev un guide de terrain signé Addy Osmani. Chaque tâche y tourne sur une machine virtuelle neuve d’environ 4 vCPU, 16 Go de RAM et 30 Go de disque, avec le dépôt cloné sur une nouvelle branche, sans surcoût de calcul sur les forfaits Pro, Max, Team et Enterprise. Le guide décrit sept usages : vider en parallèle une liste de tâches en attente (backlog), faire prouver un correctif par des exécutions répétées, planifier en local puis reprendre la session avec claude --teleport, suivre depuis le téléphone, confier les échecs de CI et les commentaires de revue à Auto-fix, déclencher des routines et exécuter du code peu sûr dans une VM jetable. Dans sa démonstration, trois sessions ont toutes fini 87 secondes après le premier lancement, et un projet peut lancer jusqu’à 200 nouveaux fils (threads) par jour. Le guide détaille aussi la connexion à GitHub : s’identifier avec GitHub et installer l’application Claude GitHub sont deux permissions distinctes, et seule la seconde ouvre les dépôts privés. Le crédit bonus de 100 dollars (Pro) ou 250 dollars (Max) se réclame avant le 7 octobre à 23 h 59 PT et expire le 4 novembre.
🔗 Guide de terrain des sessions cloud sur claude.dev 🔗 Le rappel de @ClaudeDevs sur le crédit bonus
Vibe CLI 2.26.0
6 octobre — Mistral publie Vibe CLI 2.26.0, son agent de code en ligne de commande, treize jours après la 2.25.8 et sans annonce sur X. Avec 33 ajouts, 23 changements et 91 correctifs, la mise à jour est conséquente : 72 de ses 147 entrées concernent la nouvelle interface écrite en Rust : assistant de premier lancement, mode vocal (/voice), prompts récurrents décrits en langage naturel avec /loop, envoi de la session vers Vibe Code Web avec /teleport et commande vibe update. Vibe tourne désormais toujours sur le Unified Harness, son nouveau moteur d’exécution, et s’arrête avec une erreur explicite s’il manque, au lieu de retomber en silence sur l’ancien moteur. Les plugins peuvent embarquer leur propre serveur MCP, la clé API de repli rangée dans ~/.vibe/.env n’est plus lisible que par son propriétaire, et la Rust CLI transmet désormais sa télémétrie d’usage (temps de démarrage, commandes utilisées, terminal détecté) à Mistral.
🔗 Notes de version de Mistral Vibe v2.26.0
L’extension Antigravity pour VS Code 1.7.0
5 octobre — Google publie la version 1.7.0 de l’extension Antigravity pour Visual Studio Code, qui fait entrer les agents de Google Antigravity dans l’éditeur de Microsoft (conversation en panneau latéral, revue des diffs en ligne, plans interactifs), à partir de VS Code 1.90. Mise à jour environ chaque semaine depuis début septembre selon son changelog, elle n’avait jamais été couverte ici. Cette 1.7.0 (6 améliorations, 9 correctifs) soigne la revue de code : les décisions Accept et Reject s’annulent et se rétablissent au clavier, l’éditeur de diff côte à côte gagne des boutons Accept All et Reject All, et l’enregistrement automatique (Auto Save) de VS Code ne peut plus écraser ni clore une revue en cours. Sous Windows, des notifications natives signalent la fin d’une tâche quand la fenêtre n’est pas au premier plan, et Google Cloud Workstations comme Cloud Shell reçoivent une authentification interactive. Le même jour, l’extension pour Visual Studio passe en 1.0.261005.0 et joint des journaux de diagnostic aux retours envoyés.
🔗 Changelog de Google Antigravity
Replit et le contexte de tous les projets
6 octobre — Replit annonce disposer désormais du contexte de l’ensemble des projets d’un utilisateur. Depuis une nouvelle conversation, on peut lui demander de retrouver un projet existant, d’y ajouter une fonctionnalité ou de s’appuyer sur un projet comme référence pour un autre ; Replit lit alors les fichiers concernés et lance les modifications en tâches d’arrière-plan (background tasks), avec des liens pour relire les changements. L’exemple choisi sort du code pur : appliquer la palette de couleurs d’un « Partner Marketing Hub » à deux autres projets d’une marque de café. L’annonce tient en un tweet accompagné d’une vidéo, sans billet, sans documentation ni tarif.
Les pull requests empilées de GitHub passent en disponibilité générale
6 octobre — GitHub ouvre à toutes les formules de github.com les pull requests empilées (stacked pull requests), en préversion publique depuis le 30 juillet : un gros changement est découpé en pull requests plus petites, relues séparément puis fusionnées ensemble. GitHub Enterprise Server les recevra dans une prochaine version. Selon GitHub, les dépôts qui utilisent des piles fusionnent 9 % de code en plus que des dépôts comparables, et plus des deux tiers du top 1 % des dépôts s’en servent, avec un temps jusqu’à la fusion amélioré de 5 %.
La version finale réduit les frictions de la fusion. Quand la branche principale avance, « Rebase stack » conserve les approbations du code inchangé et produit des commits de remplacement signés ; une pile traverse la file de fusion (merge queue) comme un seul groupe, et une pile dont la branche de base est supprimée est reciblée au lieu d’être fermée. La fusion automatique d’une pile entière arrive « au cours des prochaines semaines ». Pour les usages en ligne de commande et les agents, l’extension gh stack de GitHub CLI prend en charge les worktrees Git.
🔗 Changelog de GitHub sur les pull requests empilées
Modèles multilingues : Tiny Aya L2-Thinker de Cohere et Falcon-OCR-Arabic de TII
Deux petits modèles visent des langues que les grands modèles servent moins bien : l’un raisonne dans la langue de l’utilisateur, l’autre lit les documents en arabe.
Tiny Aya L2-Thinker de Cohere
6 octobre — Cohere s’attaque à la langue dans laquelle raisonnent les modèles : interrogés en espagnol, en arabe ou en swahili, la plupart réfléchissent en anglais avant de répondre. Son modèle de recherche Tiny Aya L2-Thinker (3,35 milliards de paramètres) raisonne dans la langue du prompt plus de 93 % du temps, sur 60 langues. La recette tient au mélange des données : environ 1,7 million d’exemples de raisonnement en anglais, générés par gpt-oss-120b, ne le font raisonner dans la langue de l’utilisateur que 12,8 % du temps ; environ 5 000 exemples traduits par langue, sur 44 langues, portent ce taux à 86,1 %, et des données multilingues sans raisonnement étendent ce comportement à d’autres langues. Face à son jumeau qui raisonne en anglais, la précision recule au plus de deux à trois points sur cinq des six benchmarks ; seul PolyMath, des mathématiques de compétition, recule plus nettement, faute d’étape d’apprentissage par renforcement. Le modèle consomme moins de 5 000 tokens de réflexion en moyenne. Modèles et données sont publiés sur Hugging Face sous licence non commerciale CC-BY-NC 4.0 ; le billet présente un article arXiv du 9 septembre.
🔗 Billet de recherche de Cohere sur Tiny Aya L2-Thinker
Falcon-OCR-Arabic de TII
6 octobre — TII, l’institut émirien qui développe les modèles Falcon, présente sur le blog de Hugging Face Falcon-OCR-Arabic, une version arabe de son modèle de reconnaissance de texte Falcon OCR. Il garde ses 270 millions de paramètres et son architecture à fusion précoce, et a été adapté par un affinage supervisé sur des documents arabes réels et synthétiques, puis par apprentissage par renforcement. Sur un banc construit par TII lui-même (11 974 documents réels, 15 catégories), il se classe deuxième des 17 modèles comparés, et premier sur les documents officiels, les formulaires administratifs, les reçus et les factures.
| Modèle évalué par TII | Exactitude du texte | Score Table TEDS |
|---|---|---|
| Gemini 3.5 Flash | 84,34 % | 51,30 % |
| Falcon-OCR-Arabic (270M) | 81,87 % | 59,95 % |
| Claude Opus 5.5 | 79,22 % | 43,98 % |
| GPT Astra | 75,02 % | 51,23 % |
| Chandra OCR 2 (meilleur OCR dédié) | 61,67 % | 32,63 % |
Le billet ne propose qu’un espace d’essai (playground) : aucun poids de Falcon-OCR-Arabic n’apparaissait sur le Hub lors de notre relevé, et aucune licence n’est mentionnée.
🔗 Le billet de TII sur Falcon-OCR-Arabic
Bibliothèques Hugging Face : Diffusers 0.41.0 intègre Qwen-Image 2.1, Transformers v5.19.0 accueille EmbeddingGemma 2
Les deux grandes bibliothèques de modèles de Hugging Face publient une version le même jour.
Diffusers 0.41.0 et Qwen-Image 2.1
6 octobre — Diffusers 0.41.0, la bibliothèque de Hugging Face pour les modèles de diffusion, intègre Qwen-Image 2.1, le modèle d’Alibaba qui réunit génération et édition d’images : il s’utilise désormais directement pour générer, éditer, produire des images à fond transparent (sortie RGBA native) et entraîner des LoRA, avec un composant de génération visuelle de 7 milliards de paramètres. L’équipe change aussi de rythme : comme Transformers, Diffusers calera désormais ses versions mineures sur l’arrivée de nouveaux modèles, les versions correctives restant réservées aux correctifs. Le chargement en parallélisme tensoriel permet à chaque GPU de ne lire que sa part des poids, et la version ajoute les pipelines LTX-2.5 DFR et des optimisations pour Cosmos 3. En contrepartie, le support ONNX est déprécié au profit d’Optimum.
🔗 Notes de version de Diffusers 0.41.0
Transformers v5.19.0
6 octobre — Six jours après la v5.18.0, Transformers v5.19.0 accueille EmbeddingGemma 2, présenté plus haut, avec ses vecteurs raccourcissables et ses encodeurs vision et audio désactivables au chargement. Côté entraînement distribué, le parallélisme d’experts gagne une répartition des tokens (token dispatch), activée par défaut pour Qwen3 MoE et Mellum : sa taille n’a plus à être égale à celle du parallélisme tensoriel, et le Trainer fonctionne avec ce mode. Le cache se configure désormais couche par couche, utile pour les modèles hétérogènes, et le traitement par lots continu (continuous batching) prend en charge les XPU. La version compte six changements cassants, dont le retour des logits de routeur pour tous les MoE et l’abandon progressif du préfixe paged|.
🔗 Notes de version de Transformers v5.19.0
Agents vocaux : ElevenLabs lance ElevenAgents Architect en Alpha
6 octobre — ElevenLabs intègre à ElevenAgents, sa plateforme d’agents conversationnels, un expert baptisé Architect, qui aide les équipes à construire et améliorer leurs agents vocaux ou textuels en lui parlant ou en lui écrivant. Il connaît tous les réglages d’ElevenAgents (base de connaissances, prompts, enchaînements, voix, garde-fous, outils, simulations) et la façon dont ils interagissent. On peut lui soumettre une question, un test en échec, une hausse des transferts vers un humain ou un constat d’ElevenAgents Spotlight : il analyse les transcriptions, remonte à la cause, propose une modification et écrit les simulations qui la valident. Il construit aussi un agent à partir d’une simple description. Chaque changement arrive en brouillon versionné et réversible, et rien ne passe en production sans approbation. Architect est accessible depuis le produit, mais aussi depuis Claude, Claude Code, ChatGPT, Cursor et Grok Bot. Il est disponible dès maintenant en Alpha, sans tarif ni chiffre de résultat.
🔗 Billet d’ElevenLabs sur ElevenAgents Architect
Vidéo générative : FLUX 3 en tête de Physics-IQ Verified selon Black Forest Labs
6 octobre — Black Forest Labs revendique la première place de Physics-IQ, le benchmark de Google DeepMind qui mesure la compréhension du monde physique par les modèles vidéo : on montre au modèle le début d’une expérience réelle filmée, et il doit en prédire la suite (fluides, optique, mécanique des solides). Le classement de référence, Physics-IQ Verified, est tenu par Anates Labs. Sur la piste vidéo vers vidéo, FLUX 3 [large] devance nettement Cosmos3 de NVIDIA, pour un coût par vidéo plus élevé.
| Modèle et méthode (vidéo vers vidéo) | Score Physics-IQ Verified | Coût par vidéo normalisée |
|---|---|---|
| FLUX 3 [large], meilleure de 8 générations | 64,35 % | 16,43 dollars |
| FLUX 3 [large] | 61,11 % | 2,08 dollars |
| Cosmos3 Super (NVIDIA) | 50,80 % | 0,82 dollar |
| Cosmos3 Nano (NVIDIA) | 43,00 % | 0,82 dollar |
Sur la piste image vers vidéo, FLUX 3 [large] passe aussi devant Physis-Lang, la méthode que NVIDIA plaçait en tête le 29 septembre. FLUX 3 [large] est un modèle propriétaire, et le fil ne donne ni date de disponibilité ni tarif pour cette variante.
🔗 Le fil de @bfl_ai sur X 🔗 Classement Physics-IQ Verified
Évaluations publiques : GeoGuess Bench et RSI Arena
Deux évaluations ouvertes au public sortent des benchmarks habituels : l’une fait jouer les modèles à GeoGuessr, l’autre fait voter le public sur des modèles entraînés par des agents.
GeoGuess Bench
6 octobre — Hassan, responsable de l’expérience développeur chez Together AI, publie GeoGuess Bench, un banc personnel qui fait jouer les modèles à GeoGuessr : chacun voit les mêmes 210 photos de rue et place une épingle notée selon la formule du jeu, jusqu’à 25 000 points par partie de cinq manches. Claude Opus 5.5 prend la tête, juste devant Claude Fable 5.1 ; la surprise vient de Muse Glimmer 30B, le modèle à poids ouverts de Meta, troisième et devant GPT-6 Astra pour environ 45 fois moins cher par partie.
| Rang au GeoGuess Bench | Modèle évalué | Score sur 25 000 | Coût par partie |
|---|---|---|---|
| 1 | Claude Opus 5.5 | 23 412 | 0,064 dollar |
| 2 | Claude Fable 5.1 | 23 307 | 0,115 dollar |
| 3 | Muse Glimmer 30B (ouvert) | 22 407 | 0,0049 dollar |
| 4 | GPT-6 Astra | 21 562 | 0,223 dollar |
| 5 | GPT-6.1 Sol | 21 194 | 0,042 dollar |
| 6 | GLM-5.3 Flash (ouvert) | 21 183 | 0,0087 dollar |
GLM-5.3 Flash fait ainsi jeu égal avec GPT-6.1 Sol pour environ cinq fois moins cher. Il s’agit du projet personnel d’un salarié de Together AI, fournisseur d’inférence de modèles ouverts, et non d’une évaluation de l’entreprise ; aucun modèle Gemini n’y figure, et le code est publié sur GitHub.
🔗 L’annonce de Hassan sur X 🔗 GeoGuess Bench
RSI Arena
6 octobre — Zichen Chen annonce un nouveau tour de RSI Arena (pour auto-amélioration récursive, recursive self-improvement), cette fois avec Hugging Face. Des agents IA ont reçu des GPU et une seule mission, entraîner de meilleurs modèles : ils ont choisi eux-mêmes les données, écrit le code et mené les expériences. Le premier tour d’entraînement terminé, le public entre dans la boucle : les modèles s’affrontent en duel, chacun vote, et les agents reprennent ces retours pour de nouvelles expériences. Les Inference Endpoints de Hugging Face servent chaque modèle en direct, et le site liste dix agents, dont GPT-6 Astra, Grok 4.7, DeepSeek V4.1 Flash, GLM-5.3 et Muse Spark 1.3 ; son tableau de bord affichait 286,60 dollars de dépenses d’API sur 300 et 755,17 heures GPU sur 1 000. L’équipe promet de publier sur le Hub chaque modèle entraîné par les agents et, à la fin de l’expérience, tous les artefacts : données, code et trajectoire de recherche complète de chaque agent.
🔗 L’annonce de Zichen Chen sur X 🔗 RSI Arena
Infrastructure GPU : NVIDIA publie AICR v1.0
6 octobre — NVIDIA publie la version 1.0 d’AI Cluster Runtime (AICR), un projet ouvert qui veut mettre fin aux grappes Kubernetes GPU configurées à tâtons. Une grappe accélérée dépend de dizaines de composants aux versions indépendantes (noyau, pilotes, environnements de conteneurs, réseau, stockage, opérateurs, bibliothèques), et une combinaison qui fonctionne à un endroit peut échouer en silence ailleurs. AICR répond par des recettes verrouillées en version et validées, rendues pour Helm, Argo CD, Flux ou Helmfile et accompagnées de preuves de validation signées sur le matériel testé. La v1.0 fixe un contrat de compatibilité : la CLI, l’API REST, le SDK Go, la structure des paquets de déploiement et les schémas d’artefacts deviennent des interfaces stables, et toute rupture exigera une nouvelle version majeure. NVIDIA revendique plus de 100 contributeurs, dont près de la moitié extérieurs à l’entreprise, et cite des intégrations chez Pulumi Labs et dans le gestionnaire multigrappe k0rdent de Mirantis.
🔗 Billet du blog technique NVIDIA
Claude Startups : jusqu’à 7 000 dollars de produits et crédits, et une Startup Stack de 45 000 dollars
6 octobre — Anthropic ouvre plus largement Claude Startups, son programme pour les fondateurs qui bâtissent sur Claude, aux jeunes pousses fondées depuis moins de cinq ans ou financées au cours des deux dernières années.
| Avantage du programme | Valeur annoncée par Anthropic |
|---|---|
| Un an de Claude Team, jusqu’à cinq sièges Premium | 6 000 dollars (cinq sièges à 100 dollars par mois) |
| Crédit API unique, disponible dès l’approbation | 1 000 dollars |
| Total des produits et crédits Claude | jusqu’à 7 000 dollars |
| Claude Startup Stack (offres de partenaires) | jusqu’à 45 000 dollars |
L’année de Claude Team vaut pour les entreprises nouvelles sur Team, et sa valeur réelle dépend du nombre et du type de sièges. La Claude Startup Stack, nouveauté du jour, réunit des remises et des crédits d’entreprises qui bâtissent avec Claude, dont Linear, Lovable, ElevenLabs, Granola et Hex ; son plafond correspond à la valeur cumulée de toutes les offres aux prix catalogue de septembre 2026, et ces offres ne sont pas toutes cumulables. Le programme ajoute des créneaux d’échange avec l’équipe Applied AI d’Anthropic, une aide pour publier une fiche sur le Claude Marketplace et l’accès à des événements.
🔗 Billet d’Anthropic sur Claude Startups 🔗 Le fil de @claudeai sur la Claude Startup Stack
Brèves
- Claude Projects et dossier local — Dan Fein, d’Anthropic, annonce que les sessions cloud de Claude Projects peuvent se connecter à un dossier approuvé de l’ordinateur, qu’elles n’atteignent que lorsqu’une tâche en a besoin ; le déploiement est progressif depuis le 5 octobre, et l’équipe y est presque (Almost there), selon Boris Cherny. 🔗 source · 🔗 Boris Cherny
- Claude dans les messages de groupe Slack — Claude peut désormais être ajouté aux messages de groupe (group DMs) de Slack comme n’importe quel participant ; il répond dans un fil qu’il continue de suivre et peut utiliser les connecteurs personnels de la personne qui le sollicite, sans précision sur les forfaits ni le calendrier. 🔗 source
- Boris Cherny et sa façon de prompter — Boris Cherny fait construire par Opus 5.5 un site compagnon interactif d’un épisode du podcast Acquired consacré à Home Depot, aquarelles comprises ; selon lui, il n’y a pas de secret pour prompter : dire au modèle ce qu’on veut, combien d’effort y consacrer et comment vérifier le résultat. 🔗 site compagnon · 🔗 sa façon de prompter
- Atlassian et OpenAI — En vertu d’un nouvel accord, les modèles de frontière de la famille GPT-6, dont GPT-6 Astra, alimenteront les agents de la plateforme Atlassian et de Rovo ; plus de 3 000 développeurs d’Atlassian utilisent déjà Codex, et des intégrations Jira plus poussées sont à l’étude, sans montant communiqué. 🔗 source
- Widgets Codex dans ChatGPT pour iOS — La version 1.2026.267 de ChatGPT pour iOS, du 2 octobre, ajoute des widgets d’écran d’accueil pour les tâches Codex récentes des ordinateurs sélectionnés, d’autres pour l’usage restant et sa réinitialisation, aussi sur l’écran verrouillé, et un réglage qui garde le clavier ouvert. 🔗 source
- Gemini CLI v0.63.0 et v0.64.0-preview.0 — La stable v0.63.0 reprend à l’identique les 15 entrées de la préversion du 29 septembre, et la préversion v0.64.0-preview.0 regroupe les 16 entrées des versions nocturnes du 30 septembre au 3 octobre : aucun contenu inédit, et la version nocturne du 6 octobre est vide. 🔗 source
- SDK Python de Mistral 3.1.0 — Générée automatiquement à partir de l’API, cette version ajoute en bêta quatorze opérations d’évaluation sous le module d’observabilité ; les méthodes
Runspassent sousWorkflows.runs, ce qui peut casser du code existant malgré un simple changement de version mineure. 🔗 source - Qwen Code v0.25.1-preview.0 — Au lendemain de la v0.25.0, cette préversion apporte 13 fonctionnalités et 27 correctifs, dont un environnement d’exécution Kubernetes expérimental, des commandes Shell et une surveillance en arrière-plan pour le Managed Agent, et des règles MCP qui n’autorisent plus un serveur homonyme. 🔗 source
- SDK TypeScript de SpaceXAI 0.2.2 — Publiée le 5 octobre sans annonce, cette version ne contient qu’un changement : l’option
retryBeforeOutputs’applique aussi à un appelcreate()sans flux continu (streaming) qui attend du JSON. 🔗 source - Falcon-Emirati-7B, le dialecte émirien — TII spécialise Falcon-H1-Arabic 7B dans l’arabe émirien : 84,83 % sur Alyah, un banc de 1 173 questions, et une fidélité au dialecte de 0,52 contre 0,05 au mieux pour ALLaM, Gemma 3 27B, Jais-2 et Fanar-2, selon un juge Gemini 3.7 Flash ; le modèle n’est proposé que sur la plateforme de chat de TII. 🔗 source
- Datasets 5.1.0 — Publiée le 5 octobre, la bibliothèque de jeux de données lit désormais les environnements d’apprentissage par renforcement Harbor, le format colonnaire Vortex et cinq formats biologiques (FASTA, FASTQ, GenBank, PDB, mmCIF), et corrige une faille qui permettait à une archive d’écrire dans un répertoire voisin. 🔗 source
- TRL v1.14.2 — Ce correctif répare un entraînement silencieusement faussé : sans vLLM, GRPO, RLOO et Distillation ne s’arrêtaient pas à la fin du tour pour des modèles comme Gemma ou Phi-3.5 et apprenaient tout le texte suivant jusqu’à la longueur maximale ; trois plantages sont aussi corrigés. 🔗 source
- Jev contre les courriels de campagne — Dans un billet communautaire, Stephen Solka trie ses courriels politiques avec Jev (99 bonnes réponses sur 100 vrais courriels, un faux positif), puis avec un classifieur SetFit de 22,6 millions de paramètres qui tourne sur processeur : 98 % sur l’évaluation pilote, mais 18 sur 23 sur des cas difficiles. 🔗 source
- Open Together le 16 octobre — vLLM et Hugging Face organisent Open Together, un rassemblement de développeurs open source qui ouvrira l’Open Source AI Week le vendredi 16 octobre à San Francisco ; selon Jeff Boudier, 150 personnes attendent sur la liste d’attente et la capacité a été doublée. 🔗 source · 🔗 Jeff Boudier
- Copilot CLI 1.0.93-2 — Cette préversion ajoute un réglage d’entreprise,
permissions.limitTo, qui cantonne les requêtes réseau à des domaines gérés, met en avant GPT-6.1 Sol, GPT-6 Astra et Luna et les modèles Claude 5.5 dans le sélecteur, et ne lit plus les réglages utilisateur que dans~/.copilot/settings.json. 🔗 source - AI Scan dans la vue d’ensemble de la sécurité — Les administrateurs d’organisation et d’entreprise voient désormais, dans la vue d’ensemble de la sécurité (security overview) de GitHub, quels dépôts ont activé l’analyse par IA des pull requests (AI Scan for pull requests), avec deux filtres et une colonne dans l’export CSV. 🔗 source
- Détection de secrets : Lovable, Pydantic et Supabase — La détection de secrets (secret scanning) de GitHub reconnaît cinq nouveaux types de secrets, dont la clé d’API de Lovable, le jeton Logfire et la clé de la Pydantic AI Gateway, ainsi que deux jetons Supabase ; Lovable Labs rejoint aussi son programme de partenariat. 🔗 source
- Notes de version de Devin du 5 octobre — Surtout des finitions : un onglet Terminal dans l’espace de travail de la session (ouvrir Files ou Terminal réveille Devin), des niveaux d’effort pour Devin Review réglables par les actions de déclenchement, et des analyses de code (code scans) récupérables par identifiant via l’API v3 ou le MCP de Devin. 🔗 source
- Delta et ses propres worktrees — Sur le blog de Delta, Conrad Irwin explique pourquoi l’outil remplace les worktrees Git : chaque fil a son worktree enregistré dans DeltaDB et répliqué entre personnes, agents et machines, plusieurs agents travaillent sur la même branche, et un script
.agents/prepareversionné prépare chaque extraction ; billet sans nouvelle version. 🔗 source - v0 : comptes personnels en espaces d’équipe — Les comptes personnels de v0 deviennent des espaces de travail d’équipe, avec conversations, projets et réglages migrés automatiquement ; la documentation réserve toutefois certaines fonctions, comme les modèles d’équipe, aux formules Plus, Business et Enterprise. 🔗 source
- v0 et l’abonnement ChatGPT sur iOS — L’abonnement ChatGPT, accepté par v0 depuis le 29 septembre, est désormais utilisable dans son application iOS, sans tarif ni détail supplémentaire. 🔗 source
- Eleven v4 et Eleven v4 Turbo en tête — ElevenLabs annonce que ses deux modèles de synthèse vocale lancés le 28 septembre occupent les deux premières places du classement de synthèse vocale (text to speech) d’Artificial Analysis ; v4 y était déjà premier au lancement. 🔗 source
- HeyGen Video en 2K — Une semaine après son lancement, HeyGen Video passe en résolution 2K ; HeyGen le dit premier du classement vidéo d’OpenRouter en usage, sans tarif propre à la 2K, la page catalogue affichant toujours 0,01 dollar par seconde jusqu’à fin octobre. 🔗 source
- Nano Banana 2.1 sur Pika — Pika ajoute à sa plateforme et à son Pika API Club Nano Banana 2.1, la nouvelle version du modèle Nano Banana de Google, avec selon Pika une meilleure qualité visuelle et plus de vitesse ; aucun tarif ni coût en crédits n’est donné. 🔗 source
- DOCA GPUNetIO — NVIDIA fait de DOCA GPUNetIO l’implémentation commune du réseau piloté par le GPU (GDA-KI) pour NCCL, NVSHMEM et NIXL/UCX, en version complète dans le SDK DOCA et en projet open source plus léger, centré sur RDMA Verbs. 🔗 source
- Green contexts de CUDA — Un billet technique de NVIDIA montre comment réserver des SM à une tâche critique : sur un GPU Blackwell de 148 SM, un noyau réservé à 8 SM répond en 0,007 ms, contre 0,140 ms avec un flux (stream) prioritaire et 3,727 ms sans priorité. 🔗 source
- Modèles ouverts chez les opérateurs télécoms — Dans un billet de position, NVIDIA cite son enquête télécom 2026, où 89 % des répondants jugent l’open source important, et les témoignages de SoftBank, AT&T et Indosat ; aucun produit nouveau. 🔗 source
- Guide Perplexity des outils de collaboration — Perplexity compare dix outils de collaboration dotés d’IA (Slack, Loom, Confluence, Airtable, Notion, ClickUp, Asana, Monday.com, Trello, Miro), leurs fonctions d’IA et les forfaits qui les incluent ; aucune nouveauté produit. 🔗 source
Ce que ça signifie
Les modèles de décision deviennent une catégorie à part entière, avec sa guerre des prix et son classement. Le même jour, OpenAI fixe le tarif de son API Decisions à 0,10 dollar par million de tokens en entrée, et Perplexity abaisse le sien à 0,02 dollar, deux fois moins qu’il y a cinq jours ; aucun des deux ne facture la sortie. Ces modèles ne rédigent pas, ils choisissent ou notent : on les paie à la lecture et on les veut rapides, OpenAI promettant des réponses environ dix fois plus rapides qu’avec sa Responses API. Le Decision Index 0.3 sert d’arbitre communautaire, et sa nouvelle moitié privée vise à mesurer des compétences plutôt que la réussite sur des bancs connus. Son verdict pèse déjà dans la communication des éditeurs : Perplexity s’en réclame dans son annonce, même si la fiche de son modèle donne un autre score que le classement.
L’IA s’installe dans les outils de bureau plutôt que l’inverse. Claude entre dans Google Docs, Sheets et Slides après Excel, PowerPoint et Word, il rejoint les messages de groupe de Slack, et les modèles GPT-6 vont alimenter les agents de Rovo chez Atlassian. Dans ces intégrations, la question n’est plus seulement la qualité du modèle mais le contrôle : un mode qui fait approuver chaque modification, des connecteurs qui suivent les permissions de partage de Google, des contrôles Enterprise appliqués au module. La même logique traverse les outils d’agents du jour, des décisions de revue annulables dans Antigravity aux brouillons versionnés d’ElevenAgents Architect.
Sur la cybersécurité, l’accès se gradue selon la vérification. Le CVP d’Anthropic ne change pas le modèle mais ses garde-fous : sur CyScenarioBench, le même Opus 5.5 passe de tâches bloquées dès le premier prompt sans vérification à 34 tâches réussies sur 50 en Red Team Access. Mistral avance un autre argument, celui d’un modèle qui ne refuse pas : il revendique 82 % sur un test cyber que Claude Opus 5.5 et GPT-6 Astra, selon lui, refusent de passer. Les deux démarches se rejoignent sur un point : l’accès le plus large aux capacités cyber passe d’abord par des professionnels vérifiés, partenaires de Mistral avant la publication des poids ou membres du programme d’Anthropic.
Les modèles s’étirent aussi aux deux extrémités de la taille. En haut, Mistral Large 4 et ses 1 000 milliards de paramètres, dont les poids sont promis pour fin octobre ; en bas, EmbeddingGemma 2, qui tient dans environ 567 Mo de RAM sur un téléphone, Tiny Aya L2-Thinker et ses 3,35 milliards de paramètres, ou Falcon-OCR-Arabic et ses 270 millions, pour l’instant seulement en démonstration. Beaucoup de chiffres du jour sont toutefois mesurés par l’éditeur lui-même : les scores de Mistral, la première place revendiquée par Black Forest Labs, le banc maison de TII, la fiche de Perplexity, les tâches d’Ironclad notées par OpenAI ou les gains de fusion annoncés par GitHub. C’est souvent la seule mesure disponible le jour d’une annonce ; elle gagnera à être recoupée par des évaluations indépendantes, ce que permettront justement les poids de Mistral Large 4 une fois publiés.
Sources
- Billet de Mistral sur Mistral Large 4
- Fiche Mistral Large 4 dans la documentation
- Billet d’Anthropic sur Claude for Google Workspace
- @claudeai sur X, Claude for Google Workspace
- Billet d’Anthropic sur le Cyber Verification Program
- Page d’aide du Cyber Verification Program
- Comcast et Booz Allen avec Claude Mythos
- EmbeddingGemma 2 sur le blog Google
- Fiche modèle EmbeddingGemma 2
- @GoogleDeepMind sur X, EmbeddingGemma 2
- EmbeddingGemma 2 sur Hugging Face
- Guide de l’API Decisions d’OpenAI
- Changelog de l’API OpenAI
- @perplexitydevs sur X, pplx-decider-v1.1-27b
- pplx-decider-v1.1-27b sur Hugging Face
- @multimodalart sur X, Decision Index 0.3
- Le Decision Index 0.3
- Billet d’OpenAI sur sa collaboration avec Ironclad
- @OpenAIDevs sur X, paliers d’usage
- Documentation des limites de débit de l’API OpenAI
- Article d’aide d’OpenAI sur le BAA de l’API
- Changelog de l’API Perplexity
- Documentation de l’outil image_search de Perplexity
- Fiche GLM 5.3 sur Amazon Bedrock
- @Zai_org sur X, GLM-5.3 sur Bedrock
- Claude Code 2.1.290
- Claude Code 2.1.291
- Claude Code 2.1.292
- Guide de terrain des sessions cloud sur claude.dev
- @ClaudeDevs sur X, crédit bonus des sessions cloud
- Notes de version de Mistral Vibe v2.26.0
- Changelog de Google Antigravity
- @Replit sur X, contexte de tous les projets
- Changelog de GitHub sur les pull requests empilées
- Billet de recherche de Cohere sur Tiny Aya L2-Thinker
- Le billet de TII sur Falcon-OCR-Arabic
- Notes de version de Diffusers 0.41.0
- Notes de version de Transformers v5.19.0
- Billet d’ElevenLabs sur ElevenAgents Architect
- @bfl_ai sur X, FLUX 3 et Physics-IQ
- Classement Physics-IQ Verified
- @nutlope sur X, GeoGuess Bench
- GeoGuess Bench
- @my_cat_can_code sur X, RSI Arena
- RSI Arena
- AICR v1.0 sur le blog technique NVIDIA
- Billet d’Anthropic sur Claude Startups
- @claudeai sur X, Claude Startup Stack
- Dan Fein sur X, Claude Projects et dossier local
- Boris Cherny sur X, déploiement progressif de Claude Projects
- Dan Fein sur X, Claude dans les messages de groupe Slack
- Boris Cherny sur X, site compagnon d’Acquired
- Boris Cherny sur X, sa façon de prompter Claude
- Atlassian et OpenAI élargissent leur partenariat
- Changelog ChatGPT et Codex, ChatGPT pour iOS 1.2026.267
- Gemini CLI v0.63.0
- SDK Python de Mistral v3.1.0
- Qwen Code v0.25.1-preview.0
- SDK TypeScript de SpaceXAI v0.2.2
- Le billet de TII sur Falcon-Emirati
- Datasets 5.1.0
- TRL v1.14.2
- Le billet de Stephen Solka
- @vllm_project sur X, Open Together
- Jeff Boudier sur X, liste d’attente d’Open Together
- Copilot CLI 1.0.93-2
- Changelog de GitHub sur l’état d’activation de l’AI Scan
- Changelog de GitHub sur les nouveaux détecteurs de secrets
- Notes de version de Devin du 5 octobre
- Billet de Conrad Irwin sur le blog de Delta
- Changelog de v0, comptes personnels en espaces d’équipe
- @v0 sur X, abonnement ChatGPT sur iOS
- @ElevenLabs sur X, Eleven v4 en tête
- @HeyGenDev sur X, HeyGen Video en 2K
- @pika_labs sur X, Nano Banana 2.1 sur Pika
- DOCA GPUNetIO sur le blog technique NVIDIA
- Green contexts sur le blog technique NVIDIA
- Modèles ouverts et opérateurs télécoms, blog NVIDIA
- Guide Perplexity des outils de collaboration