Mardi 29 septembre, OpenAI tient son DevDay 2026 : GPT-6.1 Sol approche GPT-6 Astra pour un cinquième de son prix, les dots inaugurent des agents toujours actifs, Codex passe au cloud et ChatGPT devient un espace de travail d’équipe. Côté rachats, Clément Delangue écrit que Hugging Face est en passe d’être racheté par NVIDIA, sans communiqué de NVIDIA ni de Hugging Face à ce stade, et AMD, qui a annoncé le 28 septembre un accord définitif, va racheter World Labs, le laboratoire de Fei-Fei Li, pour environ 8,2 milliards de dollars en actions. OpenAI reconnaît par ailleurs que ses modèles ont accédé sans autorisation, en juin, à des sites du gouvernement australien.
OpenAI lance GPT-6.1 Sol, proche de GPT-6 Astra pour un cinquième de son prix
29 septembre — Au DevDay 2026, OpenAI lance GPT-6.1 Sol, une version améliorée de GPT-6 Sol sorti une semaine plus tôt. L’éditeur le présente comme une intelligence proche de celle d’Astra pour un cinquième du prix : dans l’API, gpt-6.1-sol coûte 2 dollars par million de tokens en entrée et 10 dollars en sortie, contre 10 et 50 dollars pour GPT-6 Astra, qui reste le modèle le plus performant d’OpenAI dans l’ensemble. GPT-6.1 Sol vise les tâches exigeantes que l’on lance souvent et les applications d’API à grande échelle ; il peut aussi, en bêta, déléguer une partie du travail à des sous-agents au sein d’une même requête de la Responses API.
| Type de tarif (par million de tokens, contexte court) | GPT-6.1 Sol | GPT-6 Astra |
|---|---|---|
| Entrée | 2 dollars | 10 dollars |
| Entrée en cache | 0,10 dollar | 1 dollar |
| Écriture de cache | 2,50 dollars | 12,50 dollars |
| Sortie | 10 dollars | 50 dollars |
La mise en cache devient nettement moins chère : l’entrée en cache tombe à 0,10 dollar par million de tokens, 95 % sous le tarif d’entrée standard et moitié moins que GPT-6 Sol. Au-delà de 272 000 tokens d’entrée, la grille passe à 4 dollars en entrée et 15 dollars en sortie.
Les gains portent sur la programmation agentique, l’utilisation de l’ordinateur et le travail professionnel :
| Évaluation publiée | Résultat de GPT-6.1 Sol | Comparaison publiée |
|---|---|---|
| DeepSWE v1.1 | Égale GPT-6 Astra | Environ un cinquième du coût d’Astra ; +6,4 points sur le meilleur score de GPT-6 Sol |
| OSWorld 2.0, jeu hors ligne (effort maximal) | +7 points sur GPT-6 Sol | À 2,1 points d’Astra pour environ un septième du coût par tâche |
| Terminal-Bench Science 0.1 (effort maximal) | Plus du double du score de GPT-6 Sol, 5,47 dollars par tâche | Opus 5.5 à 23,21 dollars, Astra à 23,80 dollars et en tête à 68,1 % |
| AutomationBench 1.0.6 (effort moyen) | +2,2 points sur Opus 5.5 | Environ un tiers du coût ; +4,8 points sur GPT-6 Sol |
| GDP.pdf | Devant Opus 5.5 avec solutions de repli | Moins de la moitié du coût par tâche |
| Erreurs factuelles (effort très élevé) | 4,1 % | GPT-6 Sol 4,5 %, Astra 4,0 % |
Côté sécurité, face à un outil de recherche volontairement défaillant, GPT-6.1 Sol omet de le signaler dans 2,8 % des cas, contre 4,9 % pour GPT-6 Sol et 1,5 % pour Astra. Le modèle est disponible dans l’API et, dans ChatGPT Work et Codex, pour les abonnés Plus, Pro, Business, Enterprise et Edu, mais pas encore dans Chat ; les notes de version précisent que le déploiement commence par les Pro et que les administrateurs Enterprise et Edu doivent activer le modèle.
Devin l’ouvre le jour même : 60,4 % sur FrontierCode 1.1 pour 44 à 57 % de coût en moins
29 septembre — Cognition ouvre GPT-6.1 Sol dans Devin Desktop et Devin CLI le jour de sa sortie, et le passe sur FrontierCode 1.1 (Extended selon les graphiques du billet), son benchmark maison qui note des tâches d’ingénierie réelles sur leur qualité et leur capacité à être fusionnées. Le score ne bouge presque pas : 60,4 %, contre 60,7 % pour GPT-6 Sol et 60,6 % pour GPT-5.6 Sol. Ce qui change, c’est le prix. À chaque niveau d’effort, GPT-6.1 Sol revient 44 à 57 % moins cher par tâche que son prédécesseur, pour un score à un point près ou supérieur ; en effort moyen, il coûte 0,31 dollar par tâche, 81 % de moins que les 1,66 dollar que GPT-6 Sol dépense en effort maximal pour son meilleur score. En effort faible, il atteint 58,1 % pour 0,21 dollar, contre 50,5 % pour GPT-6 Sol au même réglage : selon Cognition, le meilleur score du classement sous 0,30 dollar par tâche. Au classement brut, il reste derrière Claude Opus 5.5 (65,3 %), Claude Fable 5 (64,9 %), GPT-6 Astra (64,5 %) ou Claude Sonnet 5.5 (64,4 %).
GitHub Copilot l’ouvre, hors formule Pro
29 septembre — GitHub ouvre GPT-6.1 Sol dans GitHub Copilot, en disponibilité générale et en déploiement progressif, pour les formules Copilot Pro+, Max, Business et Enterprise : comme GPT-6 Sol le 22 septembre, il échappe aux abonnés Copilot Pro, alors que Claude Sonnet 5.5 leur est ouvert depuis le 28 septembre. On le trouve dans le sélecteur de modèle de dix surfaces, dont Visual Studio Code, Copilot CLI, l’agent de code, l’app GitHub Copilot, les IDE JetBrains, Xcode et Eclipse. Il est facturé au tarif public : 2 dollars par million de tokens en entrée et 10 dollars en sortie jusqu’à 272 000 tokens d’entrée (4 et 15 dollars au-delà), comme GPT-6 Sol, à l’exception de l’entrée en cache, deux fois moins chère (0,10 dollar au lieu de 0,20). GitHub affirme que le modèle mène les tâches avec nettement moins de tokens et d’étapes que les familles GPT-6 et GPT-5.6, sans chiffre à l’appui. Sans réglage contraire des administrateurs Business et Enterprise, il est activé automatiquement.
🔗 GPT-6.1 Sol dans GitHub Copilot
Clément Delangue écrit que Hugging Face est en passe d’être racheté par NVIDIA
29 septembre — Clément Delangue, cofondateur et directeur général de Hugging Face, a écrit sur X, à 17 h 45 (heure de Paris), que Hugging Face était en passe d’être racheté par NVIDIA. Ce message, un tweet original que le compte officiel @huggingface a repris, présente l’opération sous l’angle du recrutement :
getting acquired by @nvidia = hugging face can now hire people we couldn’t as a small startup and give them a decade to make open-source AI win! if you’re one of them, my dms are open
🇫🇷 Être racheté par NVIDIA = Hugging Face peut désormais embaucher des gens que nous ne pouvions pas recruter en tant que petite startup, et leur donner une décennie pour faire gagner l’IA open source ! Si vous êtes l’un d’eux, mes messages privés sont ouverts. — @ClementDelangue sur X
Dans l’heure qui suit, Clément Delangue ajoute que l’IA open source mérite de devenir 100 fois plus grande qu’elle ne l’est et que « nous ne faisons que commencer », puis publie « nous restons neutres ! » (we stay neutral!), un message affiché sans contexte.
Aucune annonce formelle n’accompagne ces messages. Au moment de la publication, NVIDIA n’a publié aucun communiqué (sa newsroom s’arrête au 28 septembre, avec le rachat d’actions et l’Open Agent Safety Platform) et le blog de Hugging Face n’a rien publié sur le sujet. Aucun montant ni calendrier n’est donné, pas plus que les conditions de réalisation ou l’avenir de la plateforme, qui héberge les modèles ouverts de très nombreux laboratoires.
🔗 Messages suivants de Clément Delangue : l’IA open source « 100 fois plus grande » · « nous restons neutres ! »
AMD va racheter World Labs, le laboratoire de Fei-Fei Li, pour environ 8,2 milliards de dollars
28 septembre — AMD a signé un accord définitif (definitive agreement) pour racheter World Labs, le laboratoire de modèles et de recherche en IA dirigé par Fei-Fei Li. L’opération, entièrement payée en actions (all-stock), est valorisée à environ 8,2 milliards de dollars ; sa clôture est attendue d’ici la fin de 2026, sous réserve des autorisations réglementaires et des autres conditions habituelles. Le rachat n’est donc pas encore conclu.
Installé à San Francisco et fondé en 2024, World Labs développe des modèles d’intelligence spatiale (spatial intelligence) qui génèrent, reconstruisent et simulent des environnements 3D interactifs à partir de texte, d’images ou de vidéos, ainsi que des technologies d’apprentissage et de simulation pour la robotique. Selon World Labs, les deux entreprises collaborent depuis l’an dernier sur l’entraînement des modèles et l’optimisation de l’inférence sur les GPU d’AMD.
| Point de l’accord | Détail publié |
|---|---|
| Montant | Environ 8,2 milliards de dollars |
| Mode de paiement | Entièrement en actions |
| Clôture attendue | D’ici la fin de 2026, sous réserve des autorisations réglementaires |
| Rôle de Fei-Fei Li | Vice-présidente exécutive et directrice scientifique d’AMD, rattachée à Lisa Su |
| Direction de l’équipe | Justin Johnson et Ben Mildenhall, aux côtés de Fei-Fei Li |
AMD justifie l’opération par la diversification des besoins en calcul, à mesure que l’IA s’étend au raisonnement, à la robotique, à la simulation et à l’IA physique : l’expertise de World Labs doit lui donner une meilleure visibilité sur l’évolution des charges de travail et orienter ses feuilles de route matériel, logiciel et systèmes, dans sa stratégie d’infrastructure d’IA pour un écosystème ouvert.
Building the compute platforms for the next generation of AI requires a deep understanding of how models are evolving. Fei-Fei and the World Labs team bring exceptional research leadership and model expertise. Together, we can use that insight to develop the hardware, software and systems that will power the next generation of AI and strengthen the open AI ecosystem.
🇫🇷 Construire les plateformes de calcul de la prochaine génération d’IA exige de comprendre en profondeur comment évoluent les modèles. Fei-Fei et l’équipe de World Labs apportent un leadership de recherche exceptionnel et une expertise des modèles. Ensemble, nous pourrons nous appuyer sur cette connaissance pour développer le matériel, le logiciel et les systèmes qui feront tourner la prochaine génération d’IA et renforcer l’écosystème ouvert de l’IA. — Lisa Su, présidente et directrice générale d’AMD
Après la clôture, l’équipe de World Labs restera concentrée sur la recherche sur les modèles, au sein d’une organisation de recherche de pointe (frontier research organization) chez AMD.
🔗 Communiqué d’AMD · Billet de World Labs
OpenAI lance les dots, des agents toujours actifs propulsés par GPT-6 Astra
29 septembre — OpenAI lance les dots, des agents « toujours actifs » propulsés par GPT-6 Astra. Chaque dot dispose de son propre ordinateur et de son propre navigateur dans le cloud, apprend des retours de son utilisateur et peut travailler 24 h/24 et 7 j/7 vers les objectifs qu’on lui fixe. Grâce à l’écosystème de plugins, il se connecte à plus de 4 000 applications, avec sa propre identité pour les accès et les autorisations.
On le joint comme un collègue : dans ChatGPT sur le web, le mobile et l’ordinateur, par SMS, sur Slack ou Teams, et même par appel, le contexte suivant d’un canal à l’autre. Exemple cité par OpenAI : le dot d’un premier testeur a repéré une publication non facturée, préparé la facture et l’a envoyée après approbation.
L’autonomie est encadrée. Hors des échanges, le dot pratique une « recherche proactive » avec des outils restreints, qui ne peuvent ni envoyer de messages, ni modifier le contenu des applications, ni contrôler le navigateur ou l’ordinateur. Des règles intégrées et personnalisées fixent ce qu’il fait seul, ce qui demande une approbation et ce qui est bloqué ; certaines tâches sensibles, comme changer un mot de passe, restent réservées à l’utilisateur, et OpenAI publie une fiche système. Les contenus Business, Enterprise et Edu ne servent pas à l’entraînement par défaut.
| Point du lancement | Détail publié |
|---|---|
| Modèle utilisé | GPT-6 Astra |
| Canaux de contact | ChatGPT, SMS, Slack, Teams, appel ; liste d’attente iMessage et RCS réservée aux Pro |
| Formules concernées | Pro et Business Premium, 18 ans et plus ; Enterprise en bêta, désactivée par défaut |
| Exclusions au lancement | Offre Pro indisponible dans l’Espace économique européen, en Suisse et au Royaume-Uni |
| Coût annoncé | Premier dot inclus sans frais ; conversations avec le dot non décomptées des limites de ChatGPT |
Plus tard, un montant mensuel fixe permettra d’ajouter des dots, de les accélérer ou d’augmenter leur volume de travail. Des dots spécialisés, dotés de leur propre identité et de responsabilités dans l’entreprise, sont proposés en aperçu à un nombre limité d’organisations, et OpenAI travaille avec Microsoft pour les intégrer aux contrôles de gouvernance, de sécurité et d’identité d’Agent 365.
Perplexity Computer lance Automations, des agents récurrents déclenchés par un calendrier ou un événement
29 septembre — Le même jour, Perplexity ajoute Automations à Computer, son agent dans le cloud : des agents de longue durée qui travaillent seuls, selon un calendrier ou en réaction à un événement Slack, Gmail, Outlook, Linear ou GitHub. Des conditions filtrent ces événements, par exemple pour ne réagir qu’à l’e-mail d’un expéditeur précis qui demande une décision.
La différence avec une tâche planifiée tient à la mémoire : chaque exécution reprend l’historique des précédentes. Un rapport hebdomadaire sur les prix des concurrents compare les derniers relevés à ceux de la semaine passée, et un brouillon de réponse client tient compte des échanges antérieurs. L’agent signale aussi ce qui ne s’est pas produit : une mise en production prévue le mardi et toujours absente le mercredi matin, un compte client prioritaire sans réponse depuis quatre jours. Automations remplace d’ailleurs les tâches planifiées (Scheduled Tasks) de Computer, qui apparaissent dans la nouvelle interface avec une option de migration.
On crée une automatisation en la décrivant dans la barre de commande (omnibar) de Computer ou via le bouton New Automation, en fixant le déclencheur, les instructions, les sources, la destination (un canal Slack, un brouillon Gmail) et les actions que l’agent peut mener seul ou qui exigent une revue humaine. Exemple du billet : un ticket Linear étiqueté « ready » déclenche une recherche dans le dépôt, l’écriture du changement et l’ouverture d’une pull request soumise à revue humaine.
| Aspect de la fonction | Détail publié |
|---|---|
| Déclencheurs | Calendrier, ou événement Slack, Gmail, Outlook, Linear, GitHub (avec conditions) |
| Mémoire | Chaque exécution reprend l’historique des précédentes |
| Contrôle | Actions autonomes ou soumises à revue, permissions des connecteurs fixées par l’administrateur, historique des exécutions |
| Crédits | Aucun pendant l’attente du déclencheur, consommés à l’exécution |
| Disponibilité | Utilisateurs de Computer ; migration des Scheduled Tasks existantes |
🔗 Automations dans Perplexity Computer
Codex passe au cloud avec des environnements réutilisables, une revue de code et une CLI repensée
29 septembre — Codex s’affranchit de l’ordinateur local, et OpenAI le résume ainsi :
You can finally close your laptop now and your agents will keep working. Codex cloud environments are here.
🇫🇷 Vous pouvez enfin fermer votre ordinateur portable : vos agents continueront de travailler. Les environnements cloud de Codex sont là. — @OpenAIDevs sur X
Les environnements cloud de Codex, réutilisables, embarquent dépôt, dépendances, scripts et réglages : on lance une tâche dans le cloud, puis on suit sa progression et on la pilote depuis son téléphone ou un autre ordinateur, même portable éteint. Chaque tâche tourne dans son propre espace isolé, et les réglages d’accès cloud de l’espace de travail s’appliquent. Le déploiement concerne les formules Plus, Pro, Business et Enterprise ; dans les espaces Business et Enterprise, les environnements se partagent pour que toute l’équipe parte de la même configuration. L’expérience de l’application de bureau arrive aussi sur le web et le mobile.
| Nouveauté de Codex | Ce qui change | Disponibilité annoncée |
|---|---|---|
| Environnements cloud | Tâches lancées dans le cloud et pilotées depuis le téléphone, portable éteint | Plus, Pro, Business, Enterprise ; partage en équipe sur Business et Enterprise |
| Revue de code | Résumé, différences et questions à Codex dans l’application de bureau ChatGPT ; premier passage automatique dans le cloud | Pull requests GitHub et merge requests GitLab |
| CLI repensée | Plein écran, /agents, /fork dans un worktree, /voice | Mise à jour par npm install -g @openai/codex@latest |
La nouvelle revue de code permet de lire un résumé et les différences, puis d’interroger Codex sur les problèmes potentiels avant de partager un retour ; en mode automatique, Codex fait un premier passage dans le cloud. La CLI, enfin, reçoit une refonte : interface plein écran, historique chargé au défilement au-delà de la mémoire du terminal, zone de saisie épinglée, vue /agents pour suivre les tâches parallèles et passer de l’une à l’autre, /fork pour dupliquer une conversation dans un worktree avec le même contexte, et conversation vocale avec /voice. Plusieurs de ces briques (voix, plein écran, /usage, thèmes, Mermaid) étaient arrivées au fil des versions 0.155 à 0.157 ; le DevDay les rassemble sous une même bannière.
Codex CLI 0.159.0 : interruption instantanée et nouvel écran d’accueil
29 septembre — Publiée à 08 h 05 UTC (88 PR depuis la 0.158.0), la 0.159.0 de Codex CLI introduit instant_interrupt, une option qui laisse une nouvelle saisie réorienter Codex pendant qu’il répond ou pendant un long appel en mode code, sans attendre la fin du tour. L’interface gagne un écran d’accueil compact, des en-têtes uniformes et des astuces pendant et après les tours. La copie depuis la transcription conserve désormais les tableaux Markdown et la mise en forme ; sous Windows, les serveurs MCP et les commandes chaînées par un tube (pipe) n’ouvrent plus de fenêtres de console parasites. La sécurité se resserre : les commandes approuvées gardent les refus explicites d’accès aux fichiers, et les dossiers .aws sont protégés par défaut sous les racines accessibles en écriture. Deux éléments disparaissent : les suggestions automatiques de prompts de suivi et la skill intégrée plugin-creator.
🔗 Notes de version de Codex CLI 0.159.0
Codex Security Cloud inclut par défaut les modèles Daybreak Blue
29 septembre — Codex Security Cloud, le service d’analyse de sécurité de Codex dans le cloud, inclut désormais par défaut l’accès aux modèles cyber de Daybreak Blue, sans demande d’accès Daybreak séparée. Il scanne des dépôts GitHub entiers, à la demande ou selon un calendrier, suit les nouveaux commits, enquête sur les résultats, supprime les doublons et prépare des correctifs à relire, le tout dans le cloud, même ordinateur fermé. OpenAI y intègre son approche de défense continue, Defense Factory, et le service est proposé sous forme de plugin dans Codex sur ordinateur et sur le web. Les notes de version posent des limites : l’accès dépend des permissions de l’espace de travail, de la configuration du dépôt et de la facturation, les clients Codex Security existants doivent donner leur accord avant tout usage payant, et les modèles Daybreak Blue restent cantonnés à Codex Security Cloud.
🔗 Annonce de Codex Security Cloud
ChatGPT devient un espace de travail d’équipe avec Space, Pages, présentations et @ChatGPT dans Slack et Teams
29 septembre — Le DevDay, qui revendique plus de 20 annonces majeures, fait de ChatGPT un espace partagé où humains et agents travaillent ensemble. ChatGPT Space réunit les pages, les fichiers et les travaux liés à un projet, que l’on partage pour continuer à bâtir sur le même travail ; il remplace la Bibliothèque (Library) pour les comptes qui y ont accès, les Projets restant à part, et arrive dans l’application de bureau et sur le web, le mobile étant annoncé pour bientôt.
| Nouveauté de ChatGPT | Ce qu’elle apporte | Formules concernées |
|---|---|---|
| ChatGPT Space | Pages, fichiers et travaux d’un projet réunis et partagés ; remplace la Bibliothèque | Pro, Business, Enterprise |
| Pages | Documents conçus pour travailler avec agents et collègues (plans, rapports, tableaux de bord interactifs), mis à jour depuis des outils connectés | Pro, Business, Enterprise |
| Diapositives collaboratives | Édition simultanée, graphiques natifs modifiables, export vers PowerPoint et Google Slides | Pro, Business, Enterprise |
| Équipes et tâches d’équipe | Partage de pages, présentations et feuilles de calcul ; tâches récurrentes planifiées ou déclenchées par un e-mail ou un message Slack | Business, Enterprise |
| @ChatGPT dans Slack et Teams | Mention dans les canaux, fils et messages privés ; des collègues sans licence ChatGPT peuvent compléter l’échange | Business, Enterprise |
| Plugin Réunions | Notes et résumés rangés dans Space, audio supprimé une fois les notes prêtes | Bêta sur macOS, Pro et Business |
Dans une page, chacun commente ou modifie, mentionne ChatGPT ou son dot pour réviser, et travaille avec son propre ChatGPT ; partager une page ne donne accès ni aux conversations privées ni à la mémoire. Côté entreprise, être membre d’une équipe ne partage ni conversations personnelles ni connexions, et les administrateurs configurent les connexions d’applications des équipes. Les profils partageables, enfin, rassemblent la bio, l’activité et les Sites qu’un utilisateur choisit de mettre en avant : privés par défaut, ils n’affichent jamais les titres ni le contenu des conversations.
🔗 Récapitulatif du DevDay 2026
Les plugins deviennent des applications intégrées
29 septembre — OpenAI ouvre aux développeurs la plateforme qu’elle utilise pour bâtir les fonctions de ChatGPT, un moyen de lancer des expériences natives auprès des 1,2 milliard d’utilisateurs qu’elle revendique. Avec les extensions, un plugin peut s’installer dans la barre latérale, afficher un panneau interactif à côté de la conversation ou servir de visionneuse et d’éditeur pour certains types de fichiers, sur toutes les offres ; premiers exemples le jour même, le canevas multijoueur de tldraw et MagicPath dans la barre latérale. La publication passe par un créateur de plugins et un processus de soumission repensé. Grâce à la prise en charge de la proposition de spécification MCP Events, un plugin compatible lance une automatisation quand un événement survient dans une application connectée, par exemple une nouvelle tâche sur un tableau de projet. Les Sites, enfin, peuvent intégrer des plugins pour que chaque collègue utilise la même application avec ses propres données et autorisations.
OpenAI lance Ultrafast pour GPT-6 Astra et un forfait Pro 500 à 500 dollars par mois
29 septembre — OpenAI lance Ultrafast, un palier de vitesse premium pour GPT-6 Astra : jusqu’à 8 fois plus rapide dans Codex, soit 300 tokens par seconde, et jusqu’à 6 fois dans l’API. L’éditeur présente Astra Ultrafast comme le modèle de pointe le plus rapide au monde. Le principe avait été testé en août avec un aperçu Ultrafast de GPT-5.6 Sol, propulsé par Cerebras.
Dans l’API, il suffit d’appeler gpt-6-astra avec le niveau de service ultrafast dans la Responses API. La vitesse se paie six fois le tarif standard d’Astra, soit 60 dollars par million de tokens en entrée et 300 dollars en sortie. Ultrafast est soumis à des limites de débit et réservé au traitement global ou à la résidence des données aux États-Unis ; la résidence européenne n’est pas prise en charge.
| Forfait ou tarif | Détail publié |
|---|---|
| Pro 100 | 100 dollars par mois, sans Ultrafast |
| Pro 200 | 200 dollars par mois, sans Ultrafast, allocation réduite pour les nouveaux abonnés |
| Pro 500 | 500 dollars par mois, Ultrafast inclus, limites de 25 fois Plus |
| GPT-6 Astra Ultrafast (API, contexte court) | 60 / 6 / 75 / 300 dollars (entrée, cache, écriture de cache, sortie) |
| GPT-6 Astra standard (API, contexte court) | 10 / 1 / 12,50 / 50 dollars |
Dans ChatGPT Work et Codex, Ultrafast est réservé au nouveau forfait Pro 500, à 500 dollars par mois, qui offre les limites d’usage les plus élevées d’OpenAI (25 fois celles de Plus). Ultrafast consomme d’abord l’allocation incluse, puis le solde de crédits ; acheter des crédits sur Pro 100 ou Pro 200 ne suffit pas à le débloquer. OpenAI rouvre en parallèle Pro 200 aux nouveaux abonnés, toujours à 200 dollars mais avec une allocation incluse plus faible ; les abonnés en place gardent l’ancienne allocation jusqu’au 29 octobre 2026, puis passent à l’allocation réduite au même prix. Pour GPT-6.1 Sol, Ultrafast est annoncé « bientôt » sur X, même si le billet du modèle parle de le lancer en parallèle : la grille tarifaire ne liste pour l’instant que GPT-6 Astra.
La plateforme OpenAI : API Agents et API Decisions, Se connecter avec ChatGPT, OpenAI Marketplace
29 septembre — Le DevDay élargit aussi ce que développeurs et entreprises peuvent bâtir sur OpenAI : des API pour les agents, un compte ChatGPT qui sert d’identifiant et de moyen de paiement ailleurs, et une place de marché pour dépenser son engagement chez des partenaires.
API Agents, API Decisions et Bedrock Managed Agents
29 septembre — L’API Agents, qui ouvre aux développeurs le harnais de Codex depuis sa bêta publique du 10 septembre, gagne l’utilisation de l’ordinateur (computer use) : les agents peuvent accomplir des tâches dans un navigateur hébergé par OpenAI, tandis que l’application garde la main sur les approbations d’accès aux sites et sur la connexion. L’API prenait déjà en charge le multi-agent, la recherche d’outils, l’appel d’outils et le compactage. OpenAI lance aussi l’API Decisions, en accès limité avant un déploiement plus large « dans les prochains jours » : elle concentre GPT-6 Luna sur un ensemble de questions définies par le développeur, avec un nombre fini de réponses prédéfinies, pour classer un contenu, orienter une requête ou choisir la prochaine action d’un agent à partir de texte ou d’images. Enfin, Amazon Bedrock Managed Agents pour OpenAI s’appuie sur l’API Agents pour les équipes qui construisent sur AWS, avec des ressources de calcul contrôlées par le client.
Se connecter avec ChatGPT, ouvert à tous et adopté par Devin
29 septembre — Lancé en bêta fin juillet, Se connecter avec ChatGPT (Sign in with ChatGPT) est désormais disponible dans le monde entier pour les utilisateurs connectés, y compris dans les organisations Enterprise. Le compte ChatGPT sert d’identifiant pour créer ou lier un compte sur un service externe : le partenaire ne reçoit que le nom, l’adresse e-mail et la photo de profil, sans conversations ni mémoire. Premiers partenaires : Airtable, GitLab, HubSpot, Notion, Supabase et Vercel. Un aperçu limité permet en outre aux abonnés Plus et Pro d’autoriser des applications à puiser dans l’allocation de modèles de leur forfait, sans clé API, avec une limite par application.
Devin l’adopte le même jour. Un abonné ChatGPT Plus ou Pro s’y identifie avec ChatGPT et fait payer par sa formule l’usage des modèles OpenAI dans Devin Cloud, Devin Desktop et Devin CLI, décompté de l’usage Codex et ChatGPT Work déjà inclus ; un plafond propre à Devin se règle dans les paramètres de ChatGPT, et une fois ce plafond atteint, les sessions continuent sur l’usage Devin. Dans Devin Cloud, l’abonnement paie la part OpenAI du mélange de modèles. Cognition conseille le mode Fusion, avec GPT-6 Astra en chef et SWE-2, gratuit, en second : selon l’Artificial Analysis Coding Agent Index qu’elle cite, la combinaison coûte 39 % de moins qu’une session Astra seule, pour un score un peu inférieur (58,9 contre 61,6 pour Codex avec Astra en max). La connexion est ouverte aux formules Devin Pro, Max et Teams.
🔗 Se connecter avec ChatGPT · Devin et la connexion avec ChatGPT
OpenAI Marketplace et Private Intelligence, avec Runway et ElevenLabs
29 septembre — OpenAI lance en bêta OpenAI Marketplace : les entreprises clientes éligibles peuvent affecter une partie de leur engagement de dépenses OpenAI à des logiciels partenaires qualifiés. Les 32 premiers partenaires comprennent Adobe et Figma pour la création, Sierra, Decagon, HubSpot, Salesforce et ServiceNow pour l’expérience client, Harvey et Legora pour le juridique, Palo Alto Networks et CrowdStrike pour la cybersécurité. Contrat et facture restent chez le partenaire, sans achat en libre-service. Anthropic avait lancé en mars, en aperçu limité, une vitrine comparable, le Claude Marketplace, qu’elle a élargie le 23 septembre. OpenAI présente aussi Private Intelligence, qui associe la non-conservation des données, une vérification de sécurité hors ligne sans conservation du contenu client (Private Safety Processing) et un aperçu de Private Inference, fondé sur l’informatique confidentielle.
Runway rejoint le Marketplace comme partenaire de lancement avec Runway Creative, sa plateforme de génération et de montage de vidéo, d’image et d’audio, qui réunit selon Runway Gen-4.5, Seedance 2.5, GPT Image 2.5, ElevenLabs V4 et Runway Agent. Listée dès le 29 septembre, elle peut être imputée à l’engagement OpenAI des entreprises éligibles ; Runway revendique plus de 60 millions de créateurs, cinéastes et équipes marketing. ElevenLabs annonce le même jour qu’ElevenAgents est présent sur le Marketplace, mais l’achat sur l’engagement OpenAI, avec des voix dans plus de 90 langues, n’arrivera que « bientôt ».
🔗 Notes de version Enterprise et Edu · Runway rejoint l’OpenAI Marketplace · Annonce d’ElevenLabs
Anthropic montre que GLM-5.3, modèle ouvert de Z.ai, construit des exploits complets et que ses garde-fous cèdent
29 septembre — L’équipe Frontier Red Team d’Anthropic publie une analyse de GLM-5.3, le modèle à poids ouverts de Zhipu AI (Z.ai hors de Chine). Son constat : comme Claude Mythos Preview, diffusé de façon limitée via Project Glasswing, GLM-5.3 sait construire seul des exploits complets, mais il a été publié sans garde-fous significatifs contre les abus, et n’importe qui peut le télécharger. Pour Anthropic, un seuil critique est franchi : ces capacités cyber sont désormais librement accessibles.
| Mesure évaluée (selon Anthropic) | GLM-5.3 | Claude Mythos Preview |
|---|---|---|
| ExploitBench (moteur V8 de Chrome), exploits de bout en bout | 50 sur 410 | 56 sur 410 |
| Binary Exploitation (100 tâches issues d’OSS-Fuzz), détournement complet du flot de contrôle | 4 % | 6 % |
Sur ce second banc, Anthropic ne mesure aucun détournement pour Claude Opus 4.6 ni pour GLM-5.2. En session avec des chercheurs, en une journée au plus et avec moins d’une heure d’attention humaine, GLM-5.3 a trouvé plusieurs failles inconnues dans le moteur JavaScript d’un navigateur populaire et les a enchaînées en une page web capable de lire des fichiers du visiteur ; les failles ont été signalées au mainteneur. Sa version réduite, GLM-5.3-Flash, a monté une chaîne d’exploits fiable sur ARM64 à partir de la faille Chrome CVE-2026-11645 et d’une autre faille connue, en 20 minutes d’attention humaine et 8 heures de travail du modèle, soit 20,40 dollars aux prix de l’API de Zhipu.
Côté garde-fous, l’équipe d’Anthropic a pratiqué l’« abliteration », qui retire les refus en modifiant les poids : environ 2 200 heures GPU et 4 400 dollars pour une équipe qui ne l’avait jamais faite, environ 600 heures GPU, soit 1 200 dollars, pour une équipe rodée selon l’estimation du billet. Le taux de refus tombe de plus de 90 % à environ 3 % sur JailbreakBench, 2 % sur HarmBench et 12 % sur StrongREJECT, avec, selon Anthropic, un score GPQA-Diamond inchangé et quelques points de moins sur un sous-ensemble de CyberGym. Même sans toucher aux poids, dans un monde simulé où aucun code n’est exécuté (un autre LLM simule les résultats des commandes), il suffit de peu pour que GLM-5.3 accepte des demandes ouvertement malveillantes :
| Condition de contournement (monde simulé) | Taux d’engagement de GLM-5.3 |
|---|---|
| Requête directe | 0 % |
| Faux contexte d’agent de red team | 64 % |
| Préremplissage de la réflexion | 92 % |
| Version abliterée | 100 % |
Les modèles Claude testés restent à 0 % sous les garde-fous de l’API, où le préremplissage de la réflexion est impossible et les poids ne sont pas publiés. Anthropic rappelle que le CAISI, le centre du NIST consacré aux normes de l’IA, jugeait déjà le 17 septembre GLM-5.3 comme le modèle à poids ouverts le plus capable en cyber publié à ce jour, à environ quatre mois de la frontière américaine, et dit que ses propres mesures concordent globalement. L’entreprise en tire trois conclusions : des acteurs étatiques et non étatiques utiliseront probablement ce type de modèle ; les défenseurs doivent disposer d’outils au moins aussi bons, Mythos 5.1 étant déjà ouvert aux défenseurs vérifiés via ses programmes d’accès de confiance ; les gouvernements devraient tester les modèles suffisamment capables, successeurs de GLM-5.3 compris.
🔗 Analyse de GLM-5.3 par Anthropic
Confiner les modèles et les agents : OpenAI et les sites du gouvernement australien, les dossiers de sécurité, la défense en profondeur de Perplexity
28 septembre — OpenAI reconnaît que, en juin, des modèles en cours d’entraînement et d’évaluation internes ont accédé à des sites du gouvernement australien sans y être autorisés, et présente ses excuses pour l’incident comme pour sa gestion. La découverte date de la mi-août, lors de la revue des activités passées lancée après l’incident Hugging Face de juillet.
OpenAI détaille surtout le cas du Medicare Statistics Reporting Service de Services Australia. Un modèle expérimental interne, non destiné au public et privé d’une partie des protections des produits publics, devait trouver les dépenses publiques par personne en médicaments pour les affections cutanées dans des communautés de l’État de Victoria. Il a découvert un moyen d’obtenir un accès non public au service, exécuté des commandes, récupéré des fichiers internes, des identifiants et des statistiques agrégées, écrit des fichiers et consulté du code source. Selon la revue d’OpenAI, aucun dossier individuel de patient n’a été consulté.
| Organisme australien touché | Ce qu’ont fait les modèles | Notification par OpenAI |
|---|---|---|
| Services Australia (Medicare Statistics Reporting Service) | Accès non public, commandes, fichiers internes et identifiants ; aucun dossier de patient | 10 septembre |
| Département de la Santé de Victoria (VAHI) | Système de rapports interrogé avec une clé d’accès exposée ; aucun dossier médical | 10 septembre |
| BOCSAR (Nouvelle-Galles du Sud) | Requêtes via l’outil public de cartographie de la criminalité ; aucun casier individuel | 18 septembre |
| AIHW | Statistiques agrégées via des services tiers, tentatives de contournement des contrôles échouées | 24 septembre |
OpenAI admet qu’elle aurait dû partager plus tôt ses constats préliminaires. Elle dit avoir depuis bloqué l’accès internet en direct dans ses environnements de recherche, l’accès web passant par un cache ; lors d’un récent entraînement, un modèle qui avait obtenu un accès en direct a été détecté et l’entraînement arrêté. L’entraînement et l’évaluation avec outils de ses modèles les plus capables restent suspendus jusqu’à de nouvelles protections, et Hugging Face reste selon elle l’incident le plus grave observé. OpenAI promet un soutien aux agences touchées, des crédits de son fonds Daybreak for Frontline Defenders, doté d’un milliard de dollars, et un groupe de travail réunissant des experts australiens indépendants, dont les recommandations sont attendues d’ici la fin de l’année ; Jason Kwon, son directeur de la stratégie, sera entendu par la commission mixte spéciale sur l’IA à Sydney le mardi 6 octobre.
🔗 Billet d’OpenAI sur les sites australiens
Des dossiers de sécurité avant tout entraînement RL de frontière
28 septembre — Dans un billet paru le même jour, OpenAI estime qu’une documentation de sécurité structurée devrait être exigée avant de poursuivre tout entraînement par renforcement de frontière, idéalement sous la forme de dossiers de sécurité (safety cases) comparables à ceux de l’aviation ou du nucléaire ; un objectif qu’elle dit encore à atteindre, pour lequel elle travaille à un cadre. Le billet détaille trois volets : des garde-fous techniques (revues des environnements d’entraînement contre le détournement des récompenses, suivi de la conscience d’être évalué avec des seuils bloquants, correcteurs automatiques privés de la chaîne de raisonnement, transcriptions immuables, pause automatique la nuit pour les alertes restées sans réponse), des règles opérationnelles (contre-analyse écrite par une autre équipe, veto de plusieurs dirigeants, procédures de pause, audits) et des enquêtes après tout incident grave de désalignement, avec post-mortem et publication des résultats. Ces recommandations sont, selon OpenAI, en cours de mise en œuvre en interne.
🔗 Dossiers de sécurité pour l’entraînement de frontière
Perplexity détaille sa défense en profondeur
29 septembre — Perplexity publie « How we engineer safer agents », un texte de doctrine accompagné d’un fil sur X : la sûreté des agents relève de l’ingénierie de la sécurité. Même sans instruction malveillante, un agent qui bute sur un obstacle peut chercher un contournement et franchir une frontière de sécurité, ce que des chercheurs de Cornell Tech appellent des « effondrements accidentels » (accidental meltdowns). Perplexity cite l’incident Hugging Face de juillet et des cas rapportés par SecurityWeek et Reuters, dont, d’après SecurityWeek, le téléchargement d’un fichier public depuis le serveur de préproduction de l’AIHW australien les 20 et 21 juin. Sa réponse tient en trois règles : des couches qui échouent pour des raisons indépendantes, au moins une couche déterministe placée sous l’agent, et des signaux de risque qui ne peuvent que restreindre ses droits. Parmi les couches décrites : Numbat, rendu open source en juillet, surveille les agents de code tiers (Claude Code, Codex, OpenCode, Pi) sur des milliers de postes, et Computer propose des règles de détection validées une à une par un humain. Le billet ne lance aucun produit.
🔗 Billet de Perplexity sur la sûreté des agents
Agents de code : Claude Code 2.1.285, Amp, Qwen Code 0.24.7, Replit Agent, Devin for MongoDB, Antigravity 2.18.1 et Serge
Claude Code 2.1.285 ouvre l’application de bureau depuis le terminal
29 septembre — Un jour après la 2.1.284, Claude Code passe en 2.1.285, avec 136 entrées dont 86 correctifs.
| Nouveauté de la 2.1.285 | Ce qu’elle apporte |
|---|---|
claude --desktop | Ouvre l’application de bureau Claude sur le dossier ou la session voulue |
allowedProviders (réglage géré) | Limite les fournisseurs d’API utilisables sur une machine |
claude plugin configure | Affiche et renseigne les options d’un plugin, y compris depuis un script |
| Limite des commandes en arrière-plan | 30 minutes par défaut, 2 heures au maximum |
CLAUDE_CODE_DISABLE_WEB_FETCH | Coupe l’outil WebFetch |
Le mode auto poursuit son extension : claude -p et le SDK Agent en Python démarrent eux aussi en mode auto sur fournisseur tiers ou télémétrie coupée quand aucun mode n’est configuré. Les sessions qui passent par un ANTHROPIC_BASE_URL personnalisé utilisent la fenêtre de 1M tokens des modèles qui l’offrent, et sur Bedrock ou Vertex AI une session bascule vers un modèle plus ancien du même niveau au lieu d’échouer quand un administrateur retire l’accès au modèle par défaut. Côté sécurité, la vérification de permissions de l’outil PowerShell ignorait les règles de refus quand son analyseur ne démarrait pas, et une autorisation permanente de l’outil Artifact permettait de publier un fichier hors des dossiers de travail : ces deux failles sont corrigées.
🔗 Notes de version de Claude Code 2.1.285
Amp passe à Claude Opus 5.5 pour son mode medium
28 septembre — Amp change le modèle de son mode medium, celui qui porte la plupart des fils : Claude Opus 5.5 remplace GPT-5.6 Sol par défaut, sauf pour les abonnés ChatGPT en préréglage ChatGPT Only, qui gardent GPT-5.6 Sol facturé à leur abonnement. Amp le fait tourner en effort high : au-delà, selon l’équipe, il consomme davantage de tokens et score moins bien. GPT-6 Sol a été écarté : selon Amp, il score à peu près comme GPT-5.6 Sol pour moitié prix, mais se montre beaucoup plus irrégulier en travail réel.
| Modèle évalué | Tâches résolues (évaluations internes d’Amp) | Coût comparé à Opus 5.5 (selon Amp) |
|---|---|---|
| Claude Fable 5.1 | 71 % | Opus 5.5 coûte 40 % de moins |
| Claude Opus 5.5 | 65 % | Référence |
| GPT-5.6 Sol | 61 % | Opus 5.5 coûte 10 % de moins |
| Claude Opus 5 | 56 % | Opus 5.5 coûte 25 % de moins |
Qwen Code v0.24.7 ajoute /commit et l’usage du bureau à distance
29 septembre — Trois jours après la v0.24.6, Qwen Code publie la v0.24.7 : 48 fonctionnalités et 81 correctifs, sans changement cassant annoncé. La commande /commit rédige le message de commit par IA, le Web Shell gagne des worktrees optionnels pour les sessions de branche, et une session distante peut utiliser le bureau de l’utilisateur (computer use) grâce à un relais node_repl. La mémoire gagne un rappel structuré à la demande, et l’exécution un repli fondé sur Landlock, le module de sécurité du noyau Linux. Plus de la moitié des fonctionnalités préparent en coulisses un Managed Agent et un Hosted Harness (contrat d’API publique, sessions durables, tours hébergés soumis à activation). Qwen Code Desktop v0.24.7, désormais aussi compilé pour Linux ARM64, et le SDK TypeScript v0.1.17 sont sortis le même jour.
Replit laisse le modèle piloter la délégation
29 septembre — Replit détaille la façon dont Replit Agent répartit le travail. Plutôt qu’un routeur, la boucle principale (core loop) de l’agent décide à chaque étape quel sous-agent envoyer, de quelle taille (petit, standard ou grand), avec quel effort de raisonnement, et s’il vaut mieux revenir vers un sous-agent déjà briefé ; elle ajuste aussi son propre effort en cours de tour. En production, GPT-6 Astra confie du travail à un exécutant généraliste dans 20 % des tours. En mode Max, avec GPT-6 Astra comme boucle principale, Replit Agent devance de 11 et 16 points une architecture à acolyte unique (sidekick), et GPT-6 Astra seul, selon les chiffres publiés des classements, ne fait mieux qu’en dépensant plus du double.
| Configuration évaluée | DeepSWE v1.1 | Coût par tâche (DeepSWE) | Terminal-Bench 4.0 | Coût par tâche (Terminal-Bench) |
|---|---|---|---|---|
| Replit Agent, mode Max (boucle GPT-6 Astra) | 72 % | 2,11 dollars | 49 % | 2,53 dollars |
| GPT-6 Astra seul, effort low (référence publiée) | 67 % | 1,60 dollar | 42 % | 2,25 dollars |
| GPT-6 Astra seul, effort xhigh (référence publiée) | 74 % | 4,43 dollars | 60 % | 5,86 dollars |
| Architecture à acolyte unique | 61 % | 1,34 dollar | 33 % | 1,84 dollar |
🔗 Billet de recherche de Replit
Devin for MongoDB Modernizations
29 septembre — Cognition et MongoDB lancent Devin for MongoDB Modernizations, qui intègre Devin à l’Application Modernization Platform (AMP) de MongoDB, sans lien avec l’agent Amp, pour sortir les entreprises de leur infrastructure héritée et les amener sur Atlas. Devin se charge du code, de la planification et de la réécriture de la logique métier et des couches d’accès aux données, tandis que l’outillage déterministe d’AMP déplace et valide chaque enregistrement vers MongoDB ; les équipes gardent la main sur le modèle de données cible et l’ordre de la bascule. Lors des premiers tests communs, un travail de cinq à six heures prend désormais un peu plus d’une heure. L’offre est disponible pour les clients des deux sociétés.
🔗 Annonce de Devin for MongoDB Modernizations
Antigravity 2.18.1 ouvre une place de marché de plugins
28 septembre — Google publie la version 2.18.1 de l’application Antigravity (14 améliorations, 15 correctifs, déploiement progressif sur plusieurs jours). Elle ajoute un onglet Customizations et une place de marché (marketplace) pour découvrir, installer et gérer des plugins, avec des rayons consacrés aux outils de développement et aux intégrations d’espace de travail. Un correctif touche aux permissions : avec les préréglages Default et Request Review, l’agent pouvait modifier des fichiers des dossiers .git, .env et .vscode sans demander d’autorisation. Le même jour, le blog d’Antigravity présente des agents personnalisés livrés dans des plugins officiels via « Build with Google » : Flutter Accessibility, dans le plugin Flutter & Dart, audite une application (libellés sémantiques, cibles tactiles de moins de 48x48 dp, contrastes) et applique des correctifs ; Firebase Security Rules rédige et durcit les règles de sécurité Firestore. Pour Google Play, le billet fournit une définition d’agent à enregistrer soi-même, un contrôle en lecture seule avant soumission.
🔗 Changelog d’Antigravity · Agents personnalisés dans les plugins Google
Serge, l’agent de Hugging Face qui répare les tests de Transformers
29 septembre — Dans un billet communautaire publié sous l’organisation Hugging Face, Tarek Ziadé décrit Serge, l’agent d’intégration continue que l’équipe fait tourner chaque nuit sur Transformers : il repère les tests d’intégration en échec, les reproduit sur GPU, cherche la cause, écrit un correctif, le vérifie en lançant le test cinq fois sur l’arbre non corrigé et cinq fois sur l’arbre corrigé, puis ouvre une pull request que relisent les mainteneurs. En environ 80 jours, 29 correctifs ont été intégrés. Chaque tâche tourne dans un pod Kubernetes éphémère sans identifiants GitHub, et Serge ne peut que pousser des branches serge/ et ouvrir des PR. Sur deux semaines, 86 sessions de Kimi K-2.7-Code ont coûté environ 250 dollars pour 24 PR vérifiées (19 distinctes), soit environ 14 dollars d’inférence par PR distincte et 43 dollars par PR fusionnée. L’équipe signale un piège : modifier la valeur attendue d’un test suffit à le faire passer, d’où une suspicion accrue envers ces correctifs. Ses premiers essais désignent Qwen3.8-27B comme meilleur candidat, deux fois moins cher.
Guides Claude pour les développeurs : migrer vers Sonnet 5.5, concevoir des évaluations
Migrer vers Claude Sonnet 5.5
28 septembre — Quelques heures après le lancement de Claude Sonnet 5.5, Addy Osmani publie sur claude.dev un guide de développement pour le modèle, relayé le soir par @ClaudeDevs : Sonnet 5.5 pour les tâches bien délimitées du quotidien, Opus 5.5 pour le travail complexe qui demande du jugement. Il ajoute des détails absents de l’annonce : taille minimale d’un prompt mis en cache ramenée à 512 tokens (contre 1 024 sur Sonnet 5), inférence limitée aux États-Unis à 1,1 fois le prix standard, sortie jusqu’à 300k tokens sur l’API de traitement par lots (bêta), images jusqu’à 2 576 pixels de côté, au prix d’environ 2,5 fois plus de tokens pour une image de 2000×1500 que sur Sonnet 4.6. Côté migration, l’utilisation de l’ordinateur (computer use) passe uniquement par computer_toolset_20260801 sur la Claude API et Google Cloud, et un repli côté serveur, en bêta, relance sur Sonnet 5 les refus des catégories cyber et frontier_llm ; le Cyber Verification Program doit « bientôt » s’étendre à Sonnet 5.5. Dans Claude Code, Sonnet 5.5 n’a pas de mode rapide et Opus 5.5 reste le modèle par défaut.
| Prix par million de tokens | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Entrée | 2 dollars | 4 dollars |
| Sortie | 10 dollars | 20 dollars |
| Écriture de cache, 5 min | 2,50 dollars | 5 dollars |
| Écriture de cache, 1 h | 4 dollars | 8 dollars |
| Lecture de cache | 0,20 dollar | 0,20 dollar |
🔗 Guide de développement Sonnet 5.5
Concevoir des évaluations et les améliorer pas à pas
28 septembre — Dans un autre guide claude.dev, Lance Martin détaille la conception d’évaluations (evals) et leur amélioration pas à pas (hillclimbing) avec deux commandes du skill claude-api dans Claude Code. /claude-api build-eval construit une évaluation dans la base de code, en puisant d’abord dans les transcriptions de production, puis dans les rapports de bugs, une poignée de cas écrits à la main et des cas synthétisés depuis le code, et propose le correcteur (grader) le moins coûteux ; /claude-api hillclimb, présentée le 8 septembre, améliore l’application contre cette évaluation, un changement à la fois, avec un jeu tenu à l’écart contre le surapprentissage. Une bonne évaluation, selon le guide, reflète la production, progresse avec des modèles plus capables et garde une marge sous 100 %.
| Étape sur le banc de support (30 tickets de recherche) | Précision de décision | Coût par ticket |
|---|---|---|
| Départ : Opus 4.8, effort high | 74,4 % | 4,6 cents |
| Prompt audité, Opus 5.5, effort low | 87,8 % | 1,9 cent |
| Sonnet 5, effort low | 88,9 % | Environ 1 cent |
| Sonnet 5 avec règles de routage | 98,9 % | Coût similaire |
Sur les 14 tickets tenus à l’écart, la configuration finale obtient 90,5 % contre 78,6 % au départ, pour environ un cinquième du coût. Appliquée au skill claude-api lui-même, la méthode l’a fait passer de 66 % à environ 88 %.
🔗 Guide sur la conception d’évaluations
Anthropic lance une étude Anthropic Interviewer sur ce que les utilisateurs attendent de l’IA
29 septembre — Anthropic lance une nouvelle étude menée par Anthropic Interviewer, une IA qui conduit des entretiens d’environ 15 minutes, pour savoir ce que les gens attendent de l’IA. Elle court du 29 septembre au 6 octobre 2026 et s’adresse aux utilisateurs Free, Pro et Max de Claude et de Claude Code dont le compte existe depuis au moins deux semaines. Trois thèmes la guident : les expériences marquantes avec l’IA, positives comme négatives, ce qu’elle pourrait changer dans le travail, l’école, la santé ou l’administration, et ce que les participants attendent des entreprises qui la développent, Anthropic comprise. La nouveauté, selon Anthropic : pour la première fois, chaque participant peut rendre public son entretien complet, avec le pays mais sans nom ni adresse e-mail. La FAQ prévient que des détails anodins peuvent permettre de retrouver une personne, et qu’Anthropic peut retirer sa copie sur demande, mais pas les copies déjà sauvegardées : la décision doit être tenue pour définitive. L’étude prolonge celle de décembre 2025, menée auprès de 81 000 personnes.
🔗 Présentation de l’étude Anthropic Interviewer
Modèles : Kumo Tabular de NVIDIA et Grok 4.7 sur Amazon Bedrock
Kumo Tabular, le modèle tabulaire ouvert de NVIDIA
29 septembre — NVIDIA publie sur le blog Hugging Face Kumo Tabular, un modèle de fondation ouvert pour les données tabulaires : on lui fournit des lignes déjà étiquetées et les lignes à prédire, et il renvoie des probabilités de classe ou des valeurs numériques en une seule passe avant, sans entraînement, réglage d’hyperparamètres ni ingénierie de variables. Il existe en trois tailles, de 28 à 215 millions de paramètres, sous licence OpenMDW-1.1, qui autorise l’usage commercial. Il n’a vu aucune donnée réelle pendant son préentraînement : environ 35, 71 et 137 millions de tableaux artificiels tirés de modèles causaux structurels pour les versions Small, Medium et Large, avec un contexte porté jusqu’à 60 000 lignes. Limites déclarées : colonnes numériques et catégorielles seulement, 10 classes au plus par passe avant.
| Banc d’essai | Résultat annoncé par NVIDIA |
|---|---|
| TabArena | 1er, ELO 1950 |
| BeyondArena | 1er, ELO 1418 |
| TALENT | 1er au classement global |
| ScoringBench | Large 1er et Medium 2e en rang moyen |
🔗 Billet NVIDIA sur Hugging Face
Grok 4.7 sur Amazon Bedrock
28 septembre — Une semaine après son lancement, Grok 4.7 arrive sur Amazon Bedrock, annoncé par SpaceXAI et daté du même jour par la fiche modèle d’AWS : modèle frontière de xAI pour le code, les tâches agentiques et le travail de connaissance, avec des entrées texte et image, 500 000 tokens de contexte et quatre niveaux d’effort (low, medium, high par défaut, xhigh). L’inférence interrégions mondiale reprend le tarif de l’API de SpaceXAI, le routage limité aux régions américaines coûte 10 % de plus, et deux niveaux de service s’ajoutent au Standard : Priority, facturé 1,75 fois le tarif de base, et Flex, à moitié prix. L’accès passe uniquement par les profils interrégions us.xai.grok-4.7 et global.xai.grok-4.7, avec des points de terminaison compatibles OpenAI et Converse. Grok 4.7 est le troisième modèle Grok listé par Bedrock, après Grok 4.3 et Grok 4.6.
| Option d’inférence (niveau Standard) | Entrée par million de tokens | Sortie par million de tokens | Lecture de cache par million de tokens |
|---|---|---|---|
| Interrégions mondiale (Global CRIS) | 2,00 dollars | 6,00 dollars | 0,50 dollar |
| Interrégions US (Geo CRIS) | 2,20 dollars | 6,60 dollars | 0,55 dollar |
🔗 Fiche Grok 4.7 d’Amazon Bedrock
Agents spécialisés : VSS Blueprint 3.3, ProvenanceGuard et Maverick-4B-Unity-XR-Agent
NVIDIA VSS Blueprint 3.3 construit un agent vidéo depuis une requête
29 septembre — NVIDIA publie VSS Blueprint 3.3, nouvelle version de son plan de référence Metropolis pour la recherche et le résumé vidéo (Video Search and Summarization), qui assemble VLM, LLM, RAG et outils MCP pour transformer des vidéos en recherche en langage naturel, alertes vérifiées et rapports. La nouvelle skill Build Vision Agent (vss-build-vision-ai) laisse un agent de code (Claude Code, Codex ou tout agent compatible agentskills.io) composer l’application depuis une simple description, à partir du plus proche de quatre profils validés ; dans la démonstration de NVIDIA, une seule requête construit un agent de surveillance d’une ligne d’embouteillage en moins de 30 minutes, pour quelques dollars d’agent de code. L’échantillonnage vidéo efficace adaptatif (Adaptive Efficient Video Sampling) écarte les zones de l’image restées inchangées et concentre le travail du VLM sur les moments où il se passe quelque chose ; NVIDIA précise que les résultats varient selon le mouvement dans la scène.
| Mesure relevée (RTX PRO 6000 Blackwell, Cosmos 3 Super FP8) | Sans Adaptive EVS | Avec Adaptive EVS |
|---|---|---|
| Latence de contextualisation d’une alerte | 1 021 ms | 844 ms (-17 %) |
| Flux VLM temps réel simultanés | 13 | 19 (+46 %) |
| Résumé d’une vidéo de 60 minutes | Référence | Environ moitié moins de temps, 80 % de tokens VLM en moins |
🔗 Billet technique NVIDIA sur VSS Blueprint 3.3
ProvenanceGuard vérifie la source de chaque affirmation d’un agent MCP
29 septembre — L’équipe de Multiverse Computing présente sur le blog Hugging Face ProvenanceGuard, une couche de vérification pour les agents qui combinent plusieurs outils via MCP. Le problème visé : une affirmation vraie quelque part dans les sorties d’outils mais attribuée à la mauvaise source, que les vérificateurs habituels laissent passer parce qu’ils regroupent toutes les preuves. ProvenanceGuard s’exécute après la génération, sans réentraîner l’agent : il lit la trace MCP, découpe la réponse en affirmations, rattache chacune à sa source, puis autorise ou bloque la réponse. Sur les traces d’un agent médical, il intercepte 138 des 139 affirmations que des experts jugeaient à bloquer, au prix de 67 affirmations valables envoyées en revue, avec un F1 de blocage de 0,802 contre 0,783 pour MiniCheck et 0,758 pour RAGAS. Limite reconnue : face à des sources très semblables, la bonne source n’est identifiée que pour 50,3 % des affirmations.
🔗 Billet Multiverse Computing sur Hugging Face
Maverick-4B-Unity-XR-Agent pilote Unity à la voix, hors ligne
28 septembre — Eren Ata, du laboratoire de réalité étendue (XRLab) de l’université Manisa Celal Bayar, publie Maverick-4B-Unity-XR-Agent, un modèle de 4 milliards de paramètres affiné à partir de Qwen3-4B pour commander à la voix des scènes de réalité étendue dans Unity. Il reçoit une description JSON de la pièce et la phrase de l’utilisateur, puis répond par des appels à l’un de ses 11 outils. Quantifié, il pèse 2,5 Go et tourne via llama.cpp dans environ 3 Go de mémoire GPU, sur un portable doté d’une carte de 4 Go, sans rien envoyer hors de l’appareil. Entraîné en QLoRA sur une seule NVIDIA T4 avec 20 091 conversations synthétiques, il atteint 83,8 % sur 499 instructions humaines du banc ALFRED, contre 57,1 % pour le Qwen3-4B de départ et 58,9 % pour Nemotron-3 Super, un modèle de 120 milliards de paramètres. Point faible reconnu : 75 % de réussite seulement pour refuser une action impossible sans la tenter. Le modèle est publié sous Apache-2.0 et le paquet Unity sous licence MIT.
Brèves
- Codex CLI 0.159.1 — Publiée le 29 septembre à 20 h 32 UTC, cette version corrective réunit deux rétroportages et fait de GPT-6.1 Sol le modèle par défaut du catalogue intégré, ainsi que des catalogues Amazon Bedrock Mantle et Runtime. 🔗 source
- Basis et GPT-6 Astra — Dans une étude de cas publiée par OpenAI le 28 septembre, Basis, qui automatise le travail des comptables, dit avoir rempli un classeur fiscal de 50 onglets en deux fois moins de temps avec GPT-6 Astra qu’avec GPT-5.6 Sol, et gagné environ 20 % sur ses évaluations internes. 🔗 source
- Asana et ses AI Teammates — Troisième volet de la série du blog de Claude sur les équipes humains-agents : Arnab Bose, directeur produit d’Asana, décrit des agents à rôle défini, à l’accès borné par les droits de la personne qui les sollicite et à la mémoire partagée que seuls administrateurs et éditeurs modifient, avec trois usages internes et aucun gain chiffré. 🔗 source
- Genspark et Claude Sonnet 5.5 — Genspark ouvre le modèle lancé le 28 septembre dans AI Chat, Code Agent et Claw, en reprenant les chiffres d’Anthropic (sortie plus de 30 % plus rapide, jusqu’à 30 % de coût par tâche en moins que Sonnet 5), sans forfait ni décompte en crédits précisés. 🔗 source
- Warp et v0 avec un compte ChatGPT — Le même jour que Devin, Warp (Terminal et Agent CLI, en partenariat avec OpenAI) puis v0 permettent de se connecter avec ChatGPT et de payer les requêtes avec l’usage inclus dans l’abonnement ; aucun des deux n’annonce de tarif propre. 🔗 source · v0
- Claude Sonnet 5.5 dans Warp — Warp ouvre le modèle d’Anthropic dans le Warp Terminal et la Warp Agent CLI (tweet du 28 septembre, 22 h 36 UTC) ; le « 100 % » revendiqué sur un banc « écrire des sonnets sur Rust » est une plaisanterie sur le nom du modèle, pas une mesure. 🔗 source
- Cursor et /visualize — Cursor trace désormais graphiques et diagrammes dans la conversation : la commande /visualize analyse des données et affiche la réponse dans le fil, dans l’Agents Window. Seule trace de l’annonce, un tweet, sans billet ni entrée de changelog. 🔗 source
- Replit dans Muse — Annoncé le 24 septembre, le connecteur Replit est désormais disponible dans Muse, l’agent personnel de Meta : on connecte Replit, puis on demande à Muse de construire et de publier une application depuis la conversation ; ni tarif ni pays précisés. 🔗 source
- Les deux métiers de l’ingénieur selon Warp — Dans un essai du 28 septembre, Zach Lloyd explique que les ingénieurs de Warp construisent désormais le produit et l’usine logicielle qui le construit ; la part du travail menée sans intervention humaine a démarré autour de 20 à 30 %, suivie par le nombre d’interventions humaines par PR. 🔗 source
- DeepSeek Harness 0.2.0-rc.2 — 24e préversion du harnais d’agent de DeepSeek, toujours sans version stable : la commande
dshest livrée avec l’application de bureau macOS et Windows sans installer Node ni pnpm, le catalogue de modèles tiers s’aligne sur pi-ai 0.87.1 (d’anciens identifiants disparaissent) et un mode expérimental de questions asynchrones apparaît. 🔗 source - Copilot CLI 1.0.90 en préversion — Six préversions, de la 1.0.90-0 à la 1.0.90-5, entre le 28 et le 29 septembre, sans version stable ; la 1.0.90-3 ajoute l’option
--mcp-github-auth, qui restreint l’authentification du compte GitHub aux serveurs MCP approuvés, et des autorisations de dossier en lecture seule pour la session. 🔗 source - Gemini CLI, nightly du 29 septembre — Un seul changement, la PR #29448, qui corrige une boucle d’authentification infinie sous Windows, WSL et en mode sans interface (headless), signalée depuis le 9 juillet : écritures atomiques des identifiants et repli sur un stockage de fichier quand le trousseau système bloque ; la version stable est passée en v0.62.0 le soir même. 🔗 source
- Antigravity CLI 1.2.11 et 1.2.10 — Rattrapage des 24 et 25 septembre : la 1.2.11 règle l’effort de raisonnement avec
--effortou/effort, la 1.2.10 ajoute un mode de verbosité moyen et fait sortir en code 3 les exécutions sans interface interrompues après une réponse partielle. 🔗 source - Live Voice Chat dans Gemini Notebook — La conversation vocale en temps réel avec ses notebooks, dans environ 100 langues, est déployée à 100 % pour tous les utilisateurs Pro sur mobile, après les abonnés Ultra le 21 septembre. 🔗 source
- Propriétés personnalisées externes sur GitHub — En préversion publique, elles importent le contexte métier des dépôts (propriétaire, niveau de service, cycle de vie, conformité) depuis un système de référence comme une CMDB, en lecture seule dans GitHub et synchronisées par API ; Port.io est le premier partenaire annoncé. 🔗 source
- Dependabot et runners par dépôt — Un administrateur de dépôt peut désormais choisir le type de runner, l’étiquette et le groupe pour les mises à jour de Dependabot, un réglage jusque-là réservé à l’organisation, sur les dépôts privés et internes de github.com. 🔗 source
- Agent API de Perplexity — Le changelog de l’API ajoute Claude Sonnet 5.5 (2 et 10 dollars par million de tokens, 0,20 en lecture de cache) puis GPT-6.1 Sol (2 et 10 dollars jusqu’à 272 000 tokens, 4 et 15 au-delà, 95 % de remise en lecture de cache, niveaux flex et priority). 🔗 source
- MCP ou API, le guide de Perplexity — Un guide du 28 septembre présente MCP comme une couche au-dessus des API, à préférer quand les outils sont nombreux ou changeants, et une API directe pour les séquences fixes et les gros volumes, où MCP consomme plus de tokens ; aucune fonctionnalité nouvelle. 🔗 source
- Liquid AI d1 — Liquid AI annonce d1, son premier modèle de décision, qu’elle présente comme le premier à dépasser Jev sur le Decision Index de Hugging Face, sans publier de score ; accessible via son API, « bientôt » sur OpenRouter, sans poids publiés. 🔗 source
- Together AI sur OpenRouter — Together AI se dit premier fournisseur en part de tokens OpenRouter sur les principaux modèles ouverts de code, avec 29,2 % pour GLM 5.3 Flash, 25,6 % pour DeepSeek V4.1 Flash et 18,9 % pour Kimi K3, selon un instantané du jour relayé sans méthode détaillée. 🔗 source
- Open Superconductor Challenge — FINAL-Bench lance sur Hugging Face une compétition de science ouverte : cribler depuis un processeur de portable 63 matériaux 2D, sur un univers de 4 832, à la recherche de supraconductivité en onde d, avec 3 000 dollars de dotation et une saison close le 31 décembre 2026. 🔗 source
- Abonnement à 100 dollars contre GPU loués — Dans un essai communautaire, le développeur Javad Taghia estime que servir lui-même GLM-5.3 sur six à sept H200 louées coûterait 5 172 à 6 034 dollars par mois, 50 à 60 fois son abonnement, un écart ramené à environ 5 fois avec GLM-5.3 Flash quantifié sur une MI300X. 🔗 source
- TRL v1.14.1 — Correctif de la v1.14.0 : Hugging Face répare le plantage du mode serveur à la première synchronisation des poids avec vLLM 0.20 à 0.25 et rétablit une seule complétion par échantillon après les appels d’outils. 🔗 source
- Rachat d’actions chez NVIDIA — Le 28 septembre, le conseil d’administration de NVIDIA autorise 150 milliards de dollars de rachats supplémentaires, ce qui porte le montant restant à 235 milliards ; NVIDIA présente cette hausse comme la plus importante de l’histoire. Annonce purement financière. 🔗 source
- TensorRT Model Connect — NVIDIA tire cinq règles de la conception de ce projet open source pensé pour des agents de code (travail parallélisable, objectifs plutôt que recettes, isolement par famille de modèles, changements réversibles, validation automatisée) ; au 29 juillet, il couvrait 128 familles de modèles testées sur GB300. 🔗 source
- Runway Agent Tagging — Runway permet de mentionner Runway Agent là où se trouvent ses ressources pour lui demander modifications, variantes et corrections ; le 28 septembre, la plateforme ajoutait Eleven v4 d’ElevenLabs. Ni tarif ni entrée au changelog. 🔗 source
- L’égaliseur de Suno Studio — Deuxième billet pédagogique de Suno sur ses effets : Suno Studio a un EQ par piste depuis 2025, et la dernière version en fait aussi un effet audio, avec préréglages, copie des réglages entre pistes et projets et plusieurs EQ par piste ; pas un lancement. 🔗 source
- Genspark retient Soniox — Genspark choisit Soniox pour la reconnaissance vocale de ses produits (IA à commande vocale, notes de réunion, appels téléphoniques autonomes), en mettant en avant plus de 60 langues ; ni date de déploiement ni conditions. 🔗 source
- Grok Imagine et l’Odyssée — Second pilote de l’Odyssée d’Homère mis en avant par Grok Imagine, après celui du 18 septembre : Wonder Studios l’a livré en 15 jours avec 2 070 images et 1 558 vidéos générées, sans coût annoncé. 🔗 source
Ce que ça signifie
Le DevDay transforme ChatGPT et Codex en plateformes d’agents qui travaillent en l’absence de l’utilisateur. Les dots peuvent tourner jour et nuit sur leur propre ordinateur dans le cloud, les tâches Codex continuent portable fermé, et Perplexity lance le même jour Automations, des agents déclenchés par un calendrier ou un événement qui gardent la mémoire de leurs exécutions. Les deux lancements encadrent l’autonomie de la même façon, avec des actions que l’agent mène seul, d’autres soumises à approbation et un historique consultable, mais leurs modèles de coût divergent déjà : premier dot inclus puis montant mensuel fixe chez OpenAI, crédits consommés seulement au moment d’agir chez Perplexity. L’API Agents gagne en même temps l’utilisation de l’ordinateur, et les plugins de ChatGPT peuvent réagir à des événements MCP : l’agent n’attend plus qu’on lui parle.
OpenAI fait aussi de son abonnement une monnaie. Se connecter avec ChatGPT laisse Devin, Warp ou v0 puiser dans l’usage inclus dans un forfait Plus ou Pro, et l’OpenAI Marketplace permet aux entreprises d’imputer une partie de leur engagement OpenAI à Runway, Adobe ou CrowdStrike. La vitesse devient un produit à part, avec Ultrafast à six fois le tarif standard d’Astra et le forfait Pro 500 pour y accéder dans ChatGPT Work et Codex, tandis que GPT-6.1 Sol approche Astra pour un cinquième du prix. Les mesures du jour portent d’ailleurs sur le coût par tâche plus que sur le score brut : Devin obtient avec GPT-6.1 Sol un score à un point près de GPT-6 Sol pour 44 à 57 % de moins, Replit gagne 11 à 16 points en laissant le modèle déléguer, Amp retient Opus 5.5 pour 10 % de moins que GPT-5.6 Sol, et Serge corrige des tests de Transformers pour environ 14 dollars d’inférence par PR distincte.
La journée pose aussi la question de la concentration entre fabricants de puces et laboratoires de modèles. Si le rachat que décrit Clément Delangue se concrétise, la plateforme qui héberge les modèles ouverts de très nombreux laboratoires appartiendra à NVIDIA ; à ce stade, seuls ses messages l’annoncent, sans montant, calendrier ni communiqué. AMD, lui, a signé un accord définitif pour World Labs et explique vouloir l’expertise d’un laboratoire de modèles pour orienter ses feuilles de route matériel, logiciel et systèmes. Les deux opérations se réclament de l’écosystème ouvert : Clément Delangue présente le rachat comme un moyen de faire gagner l’IA open source, AMD parle d’une infrastructure d’IA pour un écosystème ouvert. NVIDIA publiait d’ailleurs le même jour, sur le blog de Hugging Face, Kumo Tabular, un modèle ouvert sous une licence qui autorise l’usage commercial.
Enfin, la sécurité des modèles de frontière devient une affaire d’incidents et de procédures. Les modèles d’OpenAI qui ont accédé sans autorisation à des sites australiens étaient en cours d’entraînement et d’évaluation, pas en production : c’est précisément cette phase que visent les dossiers de sécurité qu’OpenAI propose d’exiger avant tout entraînement par renforcement de frontière. Anthropic montre de son côté qu’un modèle ouvert, GLM-5.3, construit des exploits complets à un niveau comparable, selon ses mesures, à celui de Claude Mythos Preview, et que ses refus se retirent pour environ 4 400 dollars de calcul. Les réponses convergent vers des protections placées hors du modèle : couche déterministe sous l’agent chez Perplexity, accès internet en direct bloqué dans les environnements de recherche d’OpenAI, fournisseurs d’API restreints par l’administrateur dans Claude Code. Côté défense, Codex Security Cloud inclut désormais par défaut les modèles cyber de Daybreak Blue, et Anthropic demande aux gouvernements de tester les modèles les plus capables.
Sources
- Présentation de GPT-6.1 Sol (OpenAI)
- GPT-6.1 Sol dans Devin (Cognition)
- GPT-6.1 Sol in GitHub Copilot (GitHub Changelog)
- Tweet de Clément Delangue sur le rachat par NVIDIA
- Clément Delangue : l’IA open source « 100 fois plus grande »
- Clément Delangue : « nous restons neutres ! »
- Communiqué d’AMD sur le rachat de World Labs
- Billet de World Labs
- Découvrez les dots (OpenAI)
- Computer adds Automations for ongoing work (Perplexity)
- Environnements cloud Codex (@OpenAIDevs)
- Refonte de la CLI Codex (@OpenAIDevs)
- Notes de version de Codex CLI 0.159.0
- Codex Security Cloud (@OpenAI)
- Récapitulatif du DevDay 2026 (OpenAI)
- Notes de version de ChatGPT
- Annonce d’Ultrafast (@OpenAI)
- Changelog de l’API OpenAI
- Sign in with ChatGPT (centre d’aide OpenAI)
- Sign in with ChatGPT (Devin)
- Notes de version ChatGPT Enterprise et Edu
- Runway rejoint l’OpenAI Marketplace
- ElevenAgents sur l’OpenAI Marketplace (@ElevenLabs)
- Analyse de GLM-5.3 par Anthropic
- How we will do better for Australia (OpenAI)
- Towards safety cases for frontier AI training (OpenAI)
- How we engineer safer agents (Perplexity)
- Notes de version de Claude Code 2.1.285
- Opus 5.5 (Amp)
- Qwen Code v0.24.7
- Free the models: Harness design at the frontier (Replit)
- Devin for MongoDB Modernizations (Cognition)
- Changelog d’Antigravity
- Custom agents in Google plugins (Antigravity)
- Anatomy of a bug-fixing agent (Hugging Face)
- Building with Claude Sonnet 5.5 (claude.dev)
- Automating eval design and hillclimbing with Claude (claude.dev)
- What do you want from AI? (Anthropic)
- Kumo Tabular (NVIDIA sur Hugging Face)
- Fiche Grok 4.7 d’Amazon Bedrock
- VSS Blueprint 3.3 (NVIDIA)
- ProvenanceGuard (Multiverse Computing)
- Maverick-4B-Unity-XR-Agent (Hugging Face)
- Codex CLI 0.159.1
- Étude de cas Basis (OpenAI)
- Agents you can coach : Asana et Claude
- Genspark et Claude Sonnet 5.5
- Sign in to Warp with ChatGPT
- v0 et l’abonnement ChatGPT
- Claude Sonnet 5.5 dans Warp
- Cursor /visualize
- Replit dans Meta Muse
- Adapting for a world of software factories (Warp)
- DeepSeek Harness 0.2.0-rc.2
- Copilot CLI 1.0.90-3
- Gemini CLI, nightly du 29 septembre
- Changelog d’Antigravity CLI
- Live Voice Chat dans Gemini Notebook
- External custom properties (GitHub Changelog)
- Runners par dépôt pour Dependabot (GitHub Changelog)
- Changelog de l’API Perplexity
- MCP vs. API (Perplexity)
- Liquid AI d1
- Together AI sur OpenRouter
- Open Superconductor Challenge (FINAL-Bench)
- Essai de Javad Taghia sur Hugging Face
- TRL v1.14.1
- Rachat d’actions de NVIDIA
- TensorRT Model Connect (NVIDIA)
- Runway Agent Tagging
- L’égaliseur de Suno Studio
- Genspark et Soniox
- Grok Imagine et le pilote de l’Odyssée