ai-powered-markdown-translatorArtikel vertaald van het Frans naar het Nederlands met gemini-3.8-flash-high.
GPT-6 en Intelligent UI komen beschikbaar voor alle gebruikers van ChatGPT: GPT-6 Sol voor betaalde abonnementen vanaf 7 oktober, GPT-6 Luna voor Free en Go vanaf 8 oktober. Anthropic voltooit zijn 5.5-familie met Claude Haiku 5.5, vanaf 0,10 dollar per miljoen inputtokens, terwijl het Windows-evenement van Microsoft de pre-orders voor RTX Spark-pc’s opent en aankondigt dat GitHub Copilot zijn taken binnenkort kan toevertrouwen aan een lokaal model. OpenAI publiceert ook 722 manuscripten met wiskundige resultaten geproduceerd door een intern model.
ChatGPT stapt over op GPT-6 en Intelligent UI voor iedereen, leest audiobestanden en bereidt College Planner voor
7 oktober — OpenAI breidt GPT-6 uit naar alle gebruikers van ChatGPT. Het gaat niet om een nieuw basismodel: GPT-6 Sol en GPT-6 Luna werden sinds september al aangeboden aan betalende klanten (hier behandeld op 22 september). Dit keer arriveren oktoberversies van deze twee modellen, afgestemd op alledaagse gesprekken, in het tabblad Chat: GPT-6 Sol voor Plus, Pro, Business en Enterprise vanaf 7 oktober, GPT-6 Luna voor Free en Go vanaf 8 oktober. Ze vervangen GPT-5.6 Sol en GPT-5.6 Luna in ChatGPT, terwijl Codex en ChatGPT Work op de septemberversies blijven. OpenAI zegt zich hiermee te richten tot de ruim 1,2 miljard mensen die ChatGPT wekelijks gebruiken.
De meest zichtbare vernieuwing heet Intelligent UI. GPT-6 stelt zijn antwoorden samen met tekst, beeldmateriaal en interactieve elementen (grafieken, knoppen, formulieren, interactieve diagrammen, kaarten) en kan op verzoek een kleine tool maken, zoals een spaarcalculator, een rekeningverdeler of een spel; wanneer eenvoudige tekst volstaat, houdt ChatGPT het daarbij. OpenAI baseert zich hiervoor op een bibliotheek van native componenten en op een compiler die de interface toont terwijl deze wordt gegenereerd. Intelligent UI werkt van Instant- tot Extra High-inspanning, zonder apart quotum, maar niet met Pro-inspanning, die wordt toevertrouwd aan GPT-6 Pro (aangedreven door GPT-6 Astra), en ook niet in de oudere desktopapplicaties voor macOS en Windows.
Tweede verandering: ChatGPT kan beginnen met antwoorden terwijl het nadenkt of tools gebruikt, en zijn antwoord vervolgens voltooien zonder nieuwe prompt. Volgens interne evaluaties van OpenAI begint GPT-6 Instant gemiddeld 44% eerder met antwoorden dan GPT-5.6 Instant op vragen die een webzoekopdracht vereisen, en start GPT-6 Extra High binnen dezelfde tijd als GPT-5.6 Medium, met een betere algehele score dan GPT-5.6 Extra High.
| Abonnement of inspanningsinstelling | Model gebruikt in ChatGPT | Tijdschema en details |
|---|---|---|
| Plus, Pro, Business en Enterprise | GPT-6 Sol (Instant, Medium, High, Extra High) | Wereldwijde uitrol vanaf 7 oktober |
| Free en Go | GPT-6 Luna | Vanaf 8 oktober |
| Pro-inspanning (Pro 100 en 200 dollar, Business, Enterprise) | GPT-6 Pro, aangedreven door GPT-6 Astra | Zonder Intelligent UI |
| ChatGPT Work en Codex | Septemberversies van GPT-6 Sol en GPT-6 Luna | Geen verandering |
Wat veiligheid betreft classificeert de op dezelfde dag gepubliceerde systeemkaart deze versies als capaciteit “High” op het gebied van cyberbeveiliging en biologie en chemie onder het Preparedness Framework, zonder deze drempel te bereiken voor zelfverbetering; ze nemen de waarborgen van GPT-5.6 over, met een betere weerstand tegen omzeilingspogingen (jailbreaks), ook over meerdere beurten. In de API verwijst de snapshot chat-latest voortaan naar dit nieuwe model van ChatGPT, waarbij OpenAI de GPT-6-familie aanbeveelt voor productie.
GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot.
🇳🇱 GPT-6 en Intelligent UI worden nu uitgerold in ChatGPT voor iedereen. In ChatGPT biedt Intelligent UI snelle en interactieve antwoorden die alledaagse vragen visueler maken, complexe onderwerpen gemakkelijker te begrijpen maken en direct interactieve tools beschikbaar stellen die zijn afgestemd op je taak. — @OpenAI op X
🔗 GPT-6 and Intelligent UI for everyone · Systeemkaart, update van oktober · GPT-6 and other models in ChatGPT
Audiobestanden in ChatGPT
6 oktober — ChatGPT accepteert nu audiobestanden als bijlage. Je voegt een opname toe aan een gesprek om een transcriptie, samenvatting of antwoorden over de inhoud te krijgen, of om een vergadering, interview of les om te zetten in gestructureerde notities of zelfs een concept voor een follow-up-e-mail. De functie is voorbehouden aan betaalde abonnementen en werkruimtes, inclusief Enterprise: het Free-abonnement heeft er “voorlopig” geen toegang toe. De geaccepteerde formaten zijn WAV, MP3, OGG, FLAC, AAC, M4A en PCM, evenals WebM en MP4 als ze alleen audio bevatten, tot 512 MB per bestand. OpenAI waarschuwt dat transcripties fouten kunnen bevatten, dat sprekeridentificatie onbetrouwbaar blijft en dat de prestaties variëren per taal.
🔗 Releaseopmerkingen van ChatGPT · Uploading files and audio to ChatGPT
ChatGPT for Teens: eerste gebruikscijfers en College Planner op komst
7 oktober — OpenAI geeft een eerste tussenstand over ChatGPT for Teens, de ervaring die standaard wordt toegepast op accounts die zijn geïdentificeerd als behorend tot jongeren onder de 18 jaar. Volgens het bedrijf hebben bijna 1,2 miljoen tieners Learning Visualizations gebruikt in één week en meer dan 180.000 de Study Mode; ze besteden er gemiddeld minder dan 15 minuten per dag aan, en minder dan 2% zit er langer dan drie aaneengesloten uren op. De aangekondigde nieuwe functie, College Planner, komt “binnenkort”, eerst in de Verenigde Staten voor middelbare scholieren van het 10e tot het 12e leerjaar die mikken op een vierjarige universiteit: één plan brengt toelatingseisen, deadlines, taken en aanvragen voor financiële hulp, inclusief studiebeurzen, samen. OpenAI ondersteunt ook College Advising Corps en, voor drie jaar, het Digital Wellness Lab van het Boston Children’s Hospital, zonder bedragen te noemen.
🔗 Helping teens learn, plan, and shape the future of AI
Claude Haiku 5.5, volgens Anthropic ongeveer 75% goedkoper dan Haiku 4.5
7 oktober — Twee weken na Opus 5.5 en negen dagen na Sonnet 5.5 completeert Anthropic de Claude 5.5-familie met Claude Haiku 5.5 (claude-haiku-5-5). Het model richt zich op taken met een hoog volume en kostengevoeligheid (samenvattingen, contextcompressie, databasequery’s, classificatie), de rol van subagent voor Opus 5.5 en Sonnet 5.5 bij coderen, en gebruikssituaties waarin snelheid telt, zoals live klantenservice of browserbesturing: het is het snelste model van Anthropic bij standaardsnelheid, hoewel de Opus-modellen in Fast Mode sneller blijven. Het is ook de eerste Haiku met een inspanningsinstelling (standaard medium), met een contextvenster van 1 miljoen tokens en tot 128.000 tokens aan output.
De prijsstelling kent twee staffels. Tot 100.000 prompttokens kost Haiku 5.5 0,10 dollar per miljoen inputtokens en 0,50 dollar per outputtoken, wat 90% minder is dan Haiku 4.5; daarboven stijgt dit naar 0,50 en 2,50 dollar, 50% minder. De benadrukte besparing van “ongeveer 75%” is een door Anthropic berekend gemiddelde: 90% van de naar Haiku 4.5 verzonden verzoeken bleef onder de drempel, en het nieuwe opdelen in tokens (tokenizer) telt ongeveer 30% meer tokens voor dezelfde tekst.
| Tarieftype (per miljoen tokens) | Haiku 5.5 tot 100.000 prompttokens | Haiku 5.5 boven 100.000 tokens | Haiku 4.5 |
|---|---|---|---|
| Inputtokens | 0,10 dollar | 0,50 dollar | 1 dollar |
| Outputtokens | 0,50 dollar | 2,50 dollar | 5 dollar |
| Cache-leesacties | 0,01 dollar | 0,05 dollar | 0,10 dollar |
| Cache-schrijfacties | 0,125 dollar | 0,625 dollar | 1,25 dollar |
Op de door Anthropic gepubliceerde benchmarks is het verschil met Haiku 4.5 groot, en Haiku 5.5 presteert beter dan GPT-6 Luna van OpenAI overal waar beide voorkomen. Het blijft daarentegen achter bij Sonnet 5.5, dat Anthropic, samen met Opus 5.5, nog steeds aanbeveelt voor complexe agentische code.
| Geëvalueerde benchmark (cijfers van Anthropic) | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 (agentische code) | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| OSWorld 2.1, offline-subset | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Humanity’s Last Exam, zonder tools | 45,9 % | 10,2 % | — | 56,9 % |
| FrontierCode 1.1, Main | 46,4 % | — | 42,4 % | 52,1 % (Xhigh-inspanning) |
| Chartography, zonder tools | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
Zes klanten hebben getuigd over hun vroege tests: HubSpot meldt 92,8% op zijn CRM-suite, de hoogste score tot nu toe, AlphaSense 0,84 vergeleken met 0,76 voor Haiku 4.5 over 400 query’s, en Box 11 punten hoger bij ongeveer de helft minder latentie. De migratie vanaf Haiku 4.5 vereist werk: de gids vermeldt elf veranderingen, waaronder het einde van budget_tokens, de parameters temperature, top_p en top_k en prefilling, en het commando /claude-api migrate van Claude Code automatiseert een deel daarvan. Wat beveiliging betreft beschrijft Anthropic cyberwaarborgen die restrictiever zijn dan die van Haiku 4.5, maar iets minder dan die van zijn andere recente modellen: meer defensieve taken toegestaan dan bij Sonnet 5.5, penetratietests nog altijd geblokkeerd.
De lancering gaat gepaard met een prijsverlaging: de cache-leesacties voor Sonnet 5.5 dalen vanaf 7 oktober van 0,20 naar 0,10 dollar per miljoen tokens, wat het model volgens Anthropic ongeveer 20% goedkoper maakt voor de meeste agentische taken. Haiku 5.5 is vanaf nu beschikbaar via de Claude-API, Amazon Web Services, Google Cloud en Microsoft Azure, evenals in Claude Code.
Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5.
🇳🇱 Dit is Claude Haiku 5.5: het goedkoopste, snelste en best presterende kleine model dat we ooit hebben uitgebracht. Gemiddeld kost het ongeveer 75% minder om te draaien dan Claude Haiku 4.5. — @claudeai op X
🔗 Aankondiging van Claude Haiku 5.5 · Migratiegids voor Haiku 5.5
Haiku 5.5 in Cursor: 48,4% op CursorBench
7 oktober — Cursor stelt Claude Haiku 5.5 direct op de lanceringsdag beschikbaar, in te schakelen via de modelinstellingen. Volgens Cursor is het bij korte query’s 10 keer goedkoper dan Claude Haiku 4.5. Op CursorBench, de ranglijst die Cursor op zijn website publiceert, staat Haiku 5.5 met Max-inspanning op de 10e plaats met een slagingspercentage van 48,4% voor 1,12 dollar per taak, net voor Sonnet 5.5 met High-inspanning, waarvan Cursor de kosten op 7 oktober heeft herberekend om rekening te houden met de nieuwe prijsstelling, en voor Opus 5 met Max-inspanning. Het model verricht echter meer werk: gemiddeld 325.934 tokens en 163 stappen per taak, tegenover 37.391 tokens en 41 stappen voor Sonnet 5.5 met High-inspanning.
| Door Cursor geteste configuratie | Positie op ranglijst | CursorBench-score | Kosten per taak |
|---|---|---|---|
| Opus 5.5, Max-inspanning | 1 | 57,8 % | 13,43 dollar |
| Haiku 5.5, Max-inspanning | 10 | 48,4 % | 1,12 dollar |
| Sonnet 5.5, High-inspanning | 11 | 47,8 % | 1,20 dollar |
| Opus 5, Max-inspanning | 13 | 46,6 % | 11,95 dollar |
| Haiku 5.5, Low-inspanning | 54 | 30,9 % | 0,08 dollar |
🔗 Aankondiging van Cursor op X · CursorBench-ranglijst
Maandelijks API-tegoed van 100 tot 500 dollar voor Max- en Team-abonnementen
7 oktober — Aangekondigd in hetzelfde blogbericht als Haiku 5.5, komt er een maandelijks tegoed beschikbaar op het Claude Platform voor Max- en Team-abonnees, met een uitrol verspreid over enkele dagen. Het is bedoeld voor het bouwen van eigen tools, applicaties en agents met de API; volgens @ClaudeDevs werkt het met alle modellen, inclusief Haiku 5.5, zowel in eigen code als in tools van derden.
| Betreffend abonnement | Maandelijks API-tegoed |
|---|---|
| Max 5x | 100 dollar |
| Max 20x | 200 dollar |
| Team, Standard-seat | 20 dollar per seat |
| Team, Premium-seat | 100 dollar per seat |
| Plafond voor een Team-team | 500 dollar, gedeeld |
| Free, Pro en Enterprise | Komen niet in aanmerking |
Bij Team worden de tegoeden van de seats opgeteld in een gezamenlijke pool: drie Standard-seats en twee Premium leveren bijvoorbeeld 260 dollar per maand op. Het tegoed dekt alle modellen van de Claude API, inclusief de Message Batches API, evenals de Console Playground, Claude Managed Agents en de Claude Agent SDK. Het dekt geen interactief gebruik van Claude Code (terminal, IDE, desktop- of webapplicatie), noch extra verbruik boven de limieten van het abonnement, noch Claude-modellen die worden aangeboden via Amazon Bedrock, Google Cloud Vertex AI of Microsoft Foundry, en het wijzigt de gebruikslimieten van Claude, Claude Code of Cowork niet.
Om het te claimen, is een abonnement vereist dat al minstens zeven dagen actief is op een in aanmerking komend plan, waarna een organisatie van de Claude Console moet worden gekoppeld via de factureringsinstellingen van claude.ai, zonder een betaalmethode toe te voegen. Er kan slechts één organisatie worden gekoppeld, en alleen de ondersteuning kan deze wijzigen. Het tegoed wordt bij elke factureringscyclus vernieuwd, kan niet worden meegenomen en wordt vóór gekochte tegoeden gebruikt; zodra het op is, stoppen de aanroepen tot het volgende tegoed, tenzij de organisatie tegoeden heeft aangeschaft of automatisch opwaarderen heeft ingeschakeld, en er wordt niets in rekening gebracht op het Claude-abonnement. In mei had Anthropic een maandelijks tegoed voor programmatisch gebruik aangekondigd vanaf 15 juni; de helppagina verduidelijkt dat het nieuwe tegoed niet overeenkomt met deze “Agent SDK-tegoeden”, die volgens de pagina niet beschikbaar zijn.
🔗 Helppagina: maandelijkse API-tegoeden voor Max- en Team-abonnementen · Aankondiging van @ClaudeDevs
Lokale AI op Windows: NVIDIA opent pre-orders voor RTX Spark-pc’s en toont preview van DGX Station for Windows
7 oktober — NVIDIA en Microsoft maken van het Windows AI and Surface-evenement in San Francisco, met een gesprek tussen Jensen Huang en Satya Nadella, gebruik om RTX Spark commercieel te lanceren, de chip voor Windows-pc’s die op 2 juni tijdens Build werd aangekondigd. Pre-orders voor laptops zijn geopend sinds 7 oktober, met beschikbaarheid vanaf 16 oktober; mini-pc’s volgen in november. Acer, ASUS, Dell, HP, Lenovo, Microsoft, MSI en Gigabyte bereiden machines voor, en Microsoft presenteert een Surface Laptop Ultra die rond de chip is gebouwd. Het blogbericht van NVIDIA vermeldt geen prijzen.
RTX Spark combineert een Blackwell RTX-GPU en een Grace-CPU die verbonden zijn met 600 GB/s, goed voor één petaflop aan AI-rekenkracht in FP4 en tot 128 GB aan uniform geheugen. NVIDIA benadrukt de lokale uitvoering van grote modellen, zonder gegevens naar de cloud te sturen en zonder verbruiksteller, met dezelfde CUDA-stack als op haar servers. De chip richt zich ook op creators (NVFP4, hardwarematige AV1- en 4:2:2-encoding) en gamers, met gaming in 1440p met meer dan 100 frames per seconde dankzij DLSS 5.
Voor bedrijven toont NVIDIA een preview van DGX Station for Windows, eveneens aangekondigd op Build in juni, die het omschrijft als de eerste desktop-AI-supercomputer van het Windows-ecosysteem: krachtig genoeg om lokaal modellen met circa een biljoen parameters te draaien zonder Windows te verlaten, terwijl Linux-tools toegankelijk blijven via WSL. Er is geen datum of prijs, enkel een inschrijving om op de hoogte te worden gehouden. Van haar kant brengt Microsoft Microsoft Execution Containers (MXC) naar algemene beschikbaarheid, de infrastructuur die agents op de achtergrond laat draaien onder controle van Windows.
| Vergeleken onderdeel | RTX Spark | DGX Station for Windows |
|---|---|---|
| Chip | Blackwell RTX-GPU (tot 6.144 cores) en Grace-CPU (tot 20 cores) | GB300 Grace Blackwell Ultra Desktop-superchip |
| Geheugen | Tot 128 GB, uniform | 748 GB, coherent |
| AI-rekenkracht in FP4 | 1 petaflop | Tot 20 petaflops |
| Aangekondigde beschikbaarheid | Laptops in pre-order, beschikbaar op 16 oktober; mini-pc’s in november | Preview, zonder datum of prijs |
🔗 NVIDIA-blogbericht over het Windows-evenement
Lokaal ontwikkelen op Windows: Copilot gaat routeren naar MAI Code 1.1 Flash, sandbox algemeen beschikbaar, Replit bereidt desktopapplicatie voor
7 oktober — GitHub Copilot zal binnenkort zelfstandig kunnen kiezen tussen een model dat op de computer van de ontwikkelaar draait en een model in de cloud. Volgens het bericht van Microsoft en GitHub op het Microsoft Command Line-blog komt deze routering “tegen het einde van de maand” beschikbaar: het is momenteel nog niet beschikbaar. GitHub presenteert dit als de volgende stap voor Project HydraFusion, zijn orchestrator die taken al verdeelt over meerdere modellen, en benadrukt een besparing op AI-tegoeden, zonder deze te becijferen.
Er zijn twee manieren van gebruik voorzien in Copilot CLI, de GitHub Copilot-app en VS Code. De Auto-modus zal, beurt na beurt, kiezen tussen lokale inferentie en de cloud op basis van de context van de taak en de status van de cache; de ontwikkelaar kan ook zelf een lokaal model aanwijzen, zoals MAI Code 1.1 Flash via de Windows ML-provider of elk willekeurig model dat wordt aangeboden via een lokaal eindpunt (endpoint) dat compatibel is met de OpenAI-API. Het bericht herinnert eraan: lokale inferentie maakt de sessie niet offline.
De demonstratie draait op een Surface Laptop Ultra uitgerust met RTX Spark. Microsoft AI laat hierop een lokale versie draaien van MAI Code 1.1 Flash, een mixture-of-experts-model gespecialiseerd in code, met 137 miljard parameters waarvan 6,8 miljard actief. Gekwantiseerd naar ongeveer 3,3 bits per gewicht weegt het 53 GB, 80% minder dan de cloudvariant, met een geheugenpiek van 75,5 GB bij een context van 256.000 tokens.
| Geëvalueerde benchmark (Microsoft-tests van 5 oktober) | MAI Code 1.1 Flash | Gekwantiseerde versie op apparaat | GPT OSS 120B (GGUF-versie van Unsloth) |
|---|---|---|---|
| SWE-Bench Verified (500 taken) | 72,6 % | 70,80 % | 32,0 % |
| Terminal-Bench 2.1 (89 taken) | 62,9 % | 66,29 % | 23,6 % |
Microsoft geeft aan dat deze tests draaiden op een llama.cpp-runtime-omgeving voor Windows ARM64 en dat de resultaten variëren afhankelijk van het apparaat en de configuratie. Een eerste bouwsteen is al beschikbaar in de terminal: sinds previewversie 1.0.94-0 van Copilot CLI detecteert de opdracht /model de modellen van een lokale Ollama-instantie. Er wordt niets toegevoegd zonder bevestiging, Ollama en het model moeten al geïnstalleerd zijn, en alleen modellen die toolaanroepen en streaming ondersteunen worden voorgesteld.
🔗 Bringing local models and sandboxed tools to Windows and GitHub Copilot · Discover local models in GitHub Copilot CLI
De lokale sandbox van Copilot algemeen beschikbaar
7 oktober — De lokale sandbox van GitHub Copilot verlaat de openbare preview die op 2 juni startte: deze is nu algemeen beschikbaar in Copilot CLI, de GitHub Copilot-app en VS Code-sessies die via Agent Host lopen, zonder extra kosten. Tools en opdrachten die door Copilot worden uitgevoerd, draaien dan met beperkte toegang tot bestanden, het netwerk, Git- en GitHub CLI-inloggegevens en andere systeemmogelijkheden, volgens beleidsregels die zijn ingesteld door de ontwikkelaar of diens organisatie; een organisatie kan instellingen afdwingen die ontwikkelaars niet kunnen versoepelen, ongeacht het gebruikte model. De engine, Microsoft eXecution Container (MXC), is een opensource-bibliotheek van het Windows-team die leunt op ProcessContainer onder Windows, Seatbelt onder macOS en bubblewrap onder Linux, zonder virtuele machine. De beperkingen ervan staan vast: ingebouwde bestandstools worden beheerd door Copilot zelf en niet door het systeem, en externe MCP-servers blijven buiten de lokale sandbox.
🔗 Local sandboxing for GitHub Copilot now generally available
Replit bouwt applicaties lokaal op Windows
7 oktober — Replit kondigt, samen met Microsoft, de preview aan van een desktopapplicatie die applicaties rechtstreeks op de computer van de gebruiker bouwt en uitvoert, onder Windows. Replit bood al een desktopapplicatie aan: het nieuwe zit in dit lokale bouwen, waarbij elke build in zijn eigen sandbox draait, gebaseerd op Microsoft Execution Containers en OpenShell, de opensource-runtime van NVIDIA. Vroege toegang verloopt via een wachtlijst, zonder datum of prijzen, en er wordt geen macOS-versie genoemd. Replit presenteerde deze preview op het podium tijdens het Windows-evenement van 7 oktober.
🔗 Aankondiging van Replit op X · Wachtlijst voor de preview
OpenAI publiceert 722 manuscripten met wiskundige resultaten geproduceerd door een intern model
6 oktober — OpenAI publiceert in één keer een grote verzameling wiskundige resultaten die zijn voortgebracht door een geavanceerd intern model dat niet publiekelijk beschikbaar is. De op de avond van 6 oktober aangekondigde GitHub-repository openai/math bevat 722 manuscripten, verdeeld over 372 families gerangschikt per discipline: een hoofdresultaat kan daarin vergezeld gaan van aanvullende argumenten, gevolgen of alternatieve bewijzen.
De overgrote meerderheid van de resultaten is afkomstig van dezelfde procedure: ongeveer 4.000 problemen die aan het model zijn voorgelegd, met per resultaat gemiddeld het equivalent van drie uur denkwerk van ChatGPT Pro. OpenAI legt uit dat het zijn evaluaties heeft uitgebreid naar open onderzoeksvraagstukken nadat het zijn bestaande wiskundige evaluaties had verzadigd. Twee werken vormen een uitzondering op deze procedure: een nulpuntsvrije regio van de Riemann-zèta-functie, waarvan de formulering voor de leesbaarheid door een mens is bijgeschaafd, en het bewijs van een specifiek geval van het Hodge-vermoeden, namelijk dat voor CM-abelse variëteiten.
| Door OpenAI gepubliceerde indicator | Aangekondigde waarde |
|---|---|
| Gepubliceerde manuscripten | 722 |
| Families van resultaten | 372 |
| Aan het model voorgelegde problemen | Ongeveer 4.000 |
| Gemiddelde rekentijd per resultaat | Ongeveer drie uur denkwerk van ChatGPT Pro |
| Gepubliceerde redeneersamenvattingen | 10 |
Niet alle resultaten zijn op dezelfde manier geverifieerd. Veel bewijzen zijn geformaliseerd in Lean, een taal waarmee een bewijs machinaal kan worden gecontroleerd, maar niet alle: OpenAI waarschuwt dat “sommige niet-geformaliseerde resultaten fouten kunnen bevatten”, belooft deze snel te corrigeren en zal gaandeweg nieuwe formaliseringen toevoegen. De tien samenvattingen van het redeneerproces van het model gaan over onderwerpen zoals de irrationaliteitsmaat van π, de Mahler-vermoedens, het vermoeden van directe eindigheid van Kaplansky in karakteristiek twee of het isomorfisme van factoren van vrije groepen.
De publicatie zelf is voorbereid met de onafhankelijke adviesgroep voor wiskunde en AI van het Institute for Advanced Study: herzienings- en citatieprotocollen, correcties gepubliceerd als nieuwe versies, en een behouden geschiedenis. OpenAI kondigt ook de financiering aan van workshops, conferenties en programma’s gewijd aan deze resultaten, en zegt te werken aan “verantwoorde” toegang voor wetenschappers tot het model dat deze heeft gegenereerd, zonder tijdschema.
We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results.
🇳🇱 We brengen een breed scala aan nieuwe wiskundige resultaten naar buiten die zijn geproduceerd door een geavanceerd intern model. We hebben de onafhankelijke adviesgroep voor wiskunde en kunstmatige intelligentie van het Institute for Advanced Study geraadpleegd en hebben ons gebaseerd op hun advies en openbare aanbevelingen om te bepalen hoe we deze resultaten publiceren. — @OpenAI op X
🔗 Vooruitgang in wiskundige AI delen · openai/math-repository op GitHub
Perplexity publiceert pplx-embed-v2-late, multivector-embeddings voor tekst en afbeeldingen
7 oktober — Perplexity Research publiceert pplx-embed-v2-late, twee late-interactie-embeddingmodellen (late interaction) met 0.6B en 9B parameters, beschikbaar op Hugging Face onder een MIT-licentie. Waar een dense embedding elk document comprimeert tot één enkele vector, behouden deze modellen van het ColBERT-type een vector van 128 dimensies per token en scoren ze elk query-document-paar via MaxSim: elk token van de query wordt gekoppeld aan het dichtstbijzijnde token van het document. Ze zoeken in tekst, afbeeldingen en gerenderde pagina’s (pdf’s, dia’s, scans) zonder tussenkomst van OCR, waardoor tabellen, figuren en opmaak behouden blijven.
De twee formaten delen dezelfde embeddingruimte, omdat ze token voor token zijn gedistilleerd uit een interne teacher van 18B, gebaseerd op een basismodel van 27B. Een corpus dat met het 9B-model is geïndexeerd, kan daardoor worden bevraagd met query’s die zijn gecodeerd met het 0.6B-model: op ViDoRe v3 met afbeeldingen behaalt deze configuratie 63,5%, vergeleken met 62,3% met de 0.6B aan beide kanten, zonder extra kosten per query. De 0.6B, gesnoeid op basis van Qwen3.5-0.8B, dient zo als een lichte query-encoder, tot op het apparaat zelf.
| Geëvalueerde benchmark (metingen van Perplexity) | Score van de 9B | Score van de 0.6B | Vergelijkingspunt |
|---|---|---|---|
| 72 gespecialiseerde taken (nDCG@10) | 81,3 % | 78,0 % | De 9B loopt 1,6 punt voor op het volgende model |
| Q2D-Web, webzoekopdrachten (Recall@1000) | 74,8 % | 73,6 % | nemotron-embed-8b: 69,3 % |
| ViDoRe v3 in afbeeldingen (nDCG@10) | 65,2 % | 62,3 % | Alleen EVIE loopt voor op de 9B |
| BrowseComp+ (GPT-OSS-120B-agent) | 64,0 % | — | Volgende beste ColBERT: 4,9 punten lager |
| MADQA (Gemini 3.5 Flash-agent) | 92,4 % | 90,1 % | Mixedbread Agentic Search: 93,4 % |
De 9B wint niet overal, en Perplexity schrijft dat ook: EVIE van Tencent presteert beter op ViDoRe v3 in afbeeldingen, gemini-embedding-2 op MIRACL-Vision en op de interne benchmark PPLX-Q2I, en Mixedbread Agentic Search behaalt een hogere score op MADQA — een verschil dat volgens Perplexity binnen het betrouwbaarheidsinterval valt. De ontwikkelaar erkent ook dat de opslag en de scoringskosten toenemen met de lengte van de documenten. Een technisch rapport is aangekondigd voor “later dit jaar”, en Perplexity is van plan om zijn late-interactie-, dense en contextuele embeddings geleidelijk open te stellen op zijn API-platform, zonder specifieke datum.
🔗 Blogpost van Perplexity Research · pplx-embed-v2-late-9b op Hugging Face
Code-agents: Claude Code 2.1.293, Codex CLI 0.161.0, Cursor op iOS, Antigravity 2.21.0 en Warp Factories
Vijf tools voor code-agents evolueren: Claude Code stapt over op Haiku 5.5, Codex CLI maakt verbinding met MCP-servers vanuit de terminal, Cursor kan worden bediend vanaf een iPhone, Antigravity bundelt de acties van zijn agent en Warp stelt zich open voor de tools van Microsoft.
Claude Code 2.1.293 stapt standaard over op Haiku 5.5
7 oktober — Versie 2.1.293 van Claude Code, die enkele minuten na de aankondiging van Haiku 5.5 werd gepubliceerd, maakt dit het standaard Haiku-model op de Anthropic-API. De versie voegt een veld agentType toe aan de payload van subagentStatusLine om aangepaste sub-agents te onderscheiden, en een optie isDeferred die vanaf het begin het schema toont van tools die door mods zijn gedeclareerd. De kern bestaat uit 38 fixes op een totaal van 56 wijzigingen: Claude kon na een compactie zijn laatste acties van vóór die compactie pas daarna plaatsen, en vervolgens voltooid werk intrekken of overdoen; regels die beperkt zijn tot een specifiek pad en geneste CLAUDE.md-bestanden worden nu ook geladen wanneer Claude een bestand leest met cat of grep in Bash; een geheugenlek in MCP-HTTP-verbindingen is verholpen. Twee recente wijzigingen zijn teruggedraaid (het weigeringsbericht voor de automatische modus uit 2.1.281 en een fix voor cloudsessies uit 2.1.290), en de limiet voor kanaalregels van Claude Tag is verhoogd van 20 naar 50.
🔗 Claude Code 2.1.293 op GitHub
Codex CLI 0.161.0 plaatst Daybreak achter een optie
7 oktober — Codex CLI 0.161.0 is de eerste stabiele versie sinds 0.160.1 van 5 oktober. Met het commando /mcp login <name> kan verbinding worden gemaakt met een MCP-server zonder de huidige terminalsessie te verlaten, en spraakgesprekken krijgen de optie om de microfoon, de luidspreker en de invoerkanalen te kiezen. Daybreak, de cyber-productlijn van OpenAI, verdwijnt achter een optie: de schakelaar /daybreak en de Daybreak-status in de statusbalk blijven verborgen zolang de gebruiker deze niet activeert met --enable cli_daybreak (of features.cli_daybreak=true), en zonder deze optie wordt de automatische Cyber-routering overgeslagen. Voor één enkele beurt kiest codex exec --cyber-access-program een Cyber-toegangsprogramma. Aan de kant van Amazon Bedrock komen multi-agent V2 en de Ultra-redeneerinspanning naar compatibele modellen, en Bedrock Mantle ondersteunt nu AWS GovCloud-regio’s. De fixes hebben betrekking op permissies, het hervatten van threads en de detectie van een beschadigde SQLite-database.
Cursor bestuurt computer-agents vanaf iOS
6 oktober — De iOS-app van Cursor toont voortaan de agents die lokaal op de computer draaien: je kunt zien wat elke agent doet en erop reageren, en de aankondigingstweet noemt ook het starten van nieuwe taken. De agents verlaten de machine niet, de app maakt er verbinding mee: de computer moet dus ingeschakeld en online blijven, en een instelling Keep this computer awake voorkomt dat het apparaat in slaapstand gaat, mits aangesloten op netstroom en met het scherm geopend. De functie is standaard ingeschakeld, behalve in Enterprise-organisaties, waar een beheerder deze moet activeren; het koppelen wordt bevestigd in de desktopapplicatie en cloud-agents zijn niet vereist. De eind juni uitgebrachte iOS-app legde de nadruk op cloud-agents: nu worden juist de lokale agents toegankelijk vanaf de telefoon.
Antigravity 2.21.0 bundelt de acties van zijn agent
6 oktober — De Antigravity-app van Google gaat naar versie 2.21.0, met 9 verbeteringen en 14 fixes. De geavanceerde zoekfunctie vindt een gesprek terug op basis van de inhoud, met ⌘+K (Ctrl+K op Windows). Het tabblad met geplande taken (Scheduled Tasks) heet nu Automations: je kunt er direct een automatisering starten met Run Now, of de agent vragen om te helpen bij het maken van een nieuwe via Create with Prompt. De bestandswijzigingen, terminalcommando’s en leesacties die de agent tussen twee antwoorden door uitvoert, worden voortaan samengevoegd op één inklapbare regel, vergezeld van een korte samenvatting. Tot de bugfixes behoort een probleem waarbij een afgebroken MP4- of MOV-video die door de agent werd gelezen, de rest van het gesprek kon laten mislukken, en een instellingenbestand dat was opgeslagen met Windows Kladblok of PowerShell niet meer werkte. De changelog waarschuwt dat het enkele dagen kan duren voordat een versie alle gebruikers bereikt.
Warp Factories breidt uit naar Microsoft Teams en Azure DevOps
7 oktober — Warp stelt Warp Factories, zijn platform voor softwarefabrieken (software factories), open voor Microsoft Teams en Azure DevOps Services. In Teams wijst het vermelden van de Warp-app in een geconfigureerd kanaal of een thread de taak toe aan de fabriek met de context van het gesprek; de fabriek rapporteert haar voortgang in dezelfde thread en stuurt pull requests daarheen voor beoordeling. In Azure DevOps kan de fabriek worden vermeld vanuit een werkitem (work item) of een pull request, of kunnen uitvoeringen worden getriggerd op basis van de gebeurtenissen daarvan; elke fabriek krijgt een eigen identiteit voor Git-bewerkingen, met beperkte toegang tot de geselecteerde repositories. Beide integraties zijn beschikbaar voor alle klanten van Warp Factories. Warp presenteert deze dubbele native ondersteuning als een primeur in de sector; Devin was al geïntegreerd met Teams en Azure DevOps Server.
API’s en platforms: de computer use- en browser use-toolsets van de Claude-SDK’s, Grok 4.7 op Microsoft Foundry
Twee aankondigingen voor ontwikkelaars die bouwen op gehoste modellen: Anthropic vereenvoudigt de besturing van een computer of browser, en Grok 4.7 bereikt algemene beschikbaarheid bij Microsoft.
De computer use- en browser use-toolsets van de Claude-SDK’s
7 oktober — De Python- en TypeScript-SDK’s van Claude integreren, in bèta, de toolsets (toolsets) computer use en browser use. Tot nu toe gaf de API aan waar Claude op wilde klikken of wat hij wilde typen, en moest je een eigen lus schrijven om elke actie om te zetten in een commando. De SDK neemt deze lus nu voor zijn rekening: de ontwikkelaar maakt een subklasse van BetaAbstractBrowserToolset20260801 of BetaAbstractComputerToolset20260801, schrijft een methode per actie, en de SDK routeert de aanroepen, past het opgegeven URL- en bestandsbeleid toe, vraagt om goedkeuringen en bouwt de resultaten op die naar het model worden teruggestuurd. Anthropic levert geen kant-en-klare browser of driver mee: men kan een eigen automatisering of een driver van Browser Use, Browserbase, E2B of Daytona koppelen, en een minimaal voorbeeld met het Chrome DevTools Protocol is gepubliceerd in de repository claude-quickstarts. Het uitvoeren van JavaScript en het uploaden van bestanden zijn standaard uitgeschakeld, en zonder URL-beleid wordt geen enkel adres gecontroleerd.
🔗 Thread van @ClaudeDevs op X · Documentatie van de SDK-toolsets
Grok 4.7 algemeen beschikbaar op Microsoft Foundry
7 oktober — Grok 4.7, het model van SpaceXAI dat op 21 september uitkwam, is beschikbaar op Microsoft Foundry, zo maakte @SpaceXAI afgelopen nacht bekend. De documentatie van Microsoft classificeert het als algemeen beschikbaar (general availability), tussen de modellen die rechtstreeks door Azure worden verkocht: tekst en afbeeldingen als invoer, een context van 500.000 tokens (invoer en uitvoer gecombineerd), tool calling, toegang via Chat Completions of via de Responses API, en redeneerinspanning van low tot xhigh, standaard high. Microsoft verbindt zich ertoe om algemeen beschikbare Grok-modellen, te beginnen met Grok 4.7, minimaal zes maanden aan te bieden; Grok 4.6 staat daar nog steeds in preview. De prijzenpagina van Azure vermeldde Grok 4.7 op de avond van 7 oktober nog niet. Na Amazon Bedrock (28 september) en Google Cloud in preview (1 oktober) wordt Grok 4.7 zo aangeboden bij de drie grote cloudproviders.
🔗 Deploy and use Grok models in Microsoft Foundry
Open modellen: Open d1 van Liquid AI, Bolmo van Ai2 in Nature met Bwen 8B en Blama 8B
Twee publicaties met open gewichten: de ene om snel beslissingen te nemen aan de rand van het netwerk, de andere om tekst byte voor byte te lezen.
Open d1, de open beslissingsmodellen van Liquid AI
7 oktober — Liquid AI stelt zijn familie van beslissingsmodellen open met Open d1: twee modellen met open gewichten, d1-3B (tekst en beeld) en d1-omni-600M (tekst met beeld of audio), waarvan de laatste een vroege onderzoeksversie is. Ze genereren geen tekst: ze kennen in één enkele doorgang een waarschijnlijkheid toe aan elk toegestaan antwoord. Volgens Liquid AI behaalt d1-3B een score van 48,57 op de Decision Index 0.2.1, de beste score onder de 10 miljard parameters, vóór Decider 35B-A3B (47,11), en een gemiddelde van 82,9 op zeven openbare datasets. Gemeten in samenwerking met NVIDIA varieert de latentie voor een vraag van 8 ms op een RTX 4090 tot 50 ms op een Jetson Orin Nano, wat geschikt is voor toepassingen aan de rand van het netwerk (edge). Er zijn geen vision- of audiobenchmarks gepubliceerd. De gewichten staan op Hugging Face onder de eigen licentie van Liquid AI (lfm1.0), met GGUF-versies; de d1 van 29 september was alleen toegankelijk via een API.
🔗 Blogpost van Liquid AI op Hugging Face
Bolmo van Ai2 in Nature, met Bwen 8B en Blama 8B
7 oktober — Ai2 publiceert in Nature, online op 7 oktober, de methode achter Bolmo, zijn familie van volledig open modellen die rechtstreeks bytes lezen in plaats van subwoorden. Het lezen van bytes voorkomt de blinde vlekken van een vast vocabulaire (spelfouten, ongebruikelijke tekenreeksen, bepaalde schriftsystemen), maar vereiste tot nu toe een volledige training vanaf nul. De conversie naar bytes (byteifying) vertrekt juist vanuit een reeds goed presterend subwoordmodel en transformeert dit via een korte aanvullende training. Bolmo 1B en 7B, afgeleid van Olmo, dateren van december; Ai2 presenteert ook Bwen 8B (afgeleid van Qwen 3 8B, Apache-2.0-licentie) en Blama 8B (afgeleid van Llama 3 8B, llama3-licentie), waarvan de repositories al bestaan sinds 26 augustus, evenals ‘Stage 1’-checkpoints waarin alleen de nieuwe byte-laag is getraind. Volgens Ai2 benaderen beide modellen hun oorspronkelijke modellen en overtreft Bwen 8B Bolmo 7B, zonder dat er cijfers zijn gepubliceerd.
SynthID Detector voor iedereen geopend om afbeeldingen, video’s en audio te verifiëren
7 oktober — Google stelt SynthID Detector open voor iedereen, de tool die onzichtbare SynthID-watermerken herkent in door AI gegenereerde content. De tool, die vorig jaar werd gepresenteerd in een voorlopige versie voor mediaprofessionals, is nu wereldwijd en in het Engels toegankelijk op synthid.com. Gebruikers kunnen er een afbeelding, video of audiobestand uploaden. De verificatie dekt content van Google en die van partners OpenAI, NVIDIA en Kakao, en binnenkort Apple. Het portaal waarschuwt dat het geen generalistische AI-detector is: content afkomstig van een model zonder SynthID, of die zwaar is bewerkt, kan als ‘niet gedetecteerd’ uit de bus komen. Google claimt sinds 2023 meer dan 180 miljard afbeeldingen en video’s en 240.000 jaar aan audio van een watermerk te hebben voorzien, vergeleken met de in juli aangekondigde 100 miljard en 60.000 jaar, en meer dan een miljoen verificaties per dag in Search, de Gemini-app en Chrome.
🔗 Google expands SynthID Detector for AI content
Beveiliging: de classifier van GitHub voor gelekte geheimen
7 oktober — GitHub neemt een gefinetunede ModernBERT-classifier in gebruik, speciaal bedoeld voor gelekte geheimen en gebouwd in samenwerking met Microsoft Applied Sciences: hij leest de code rond een waarde om waarschijnlijke inloggegevens te herkennen, inclusief wachtwoorden zonder herkenbaar format. Hij evalueert een batch kandidaten in minder dan 2 ms en zou volgens GitHub het aantal geheimen dat bij een push wordt geblokkeerd ‘meer dan verdubbelen’. Vanaf nu schakelen waarschuwingen voor door AI gedetecteerde wachtwoorden over naar dit model, zonder extra kosten. AI-gestuurde push-bescherming, in besloten preview, moet ‘later deze maand’ verschijnen voor organisaties die ervoor in aanmerking komen, en de controles via het Copilot-commando /security-review gaan ‘binnenkort’ in besloten preview, beide tegen inwisseling van AI-credits. Het essay van Erin Havens, productmanager beveiliging bij GitHub, memoreert dat bij een op de drie pull requests een AI-agent betrokken is en dat push-bescherming slechts ongeveer 30% van de nieuw gedetecteerde geheimen tegenhoudt.
🔗 Secret protection must scale with software
Infrastructuur: GitHub herbouwt Git voor agent-activiteit
6 oktober — GitHub herbouwt zijn Git-infrastructuur om het tempo van agentische ontwikkeling bij te benen. Volgens de engineering-blogpost van Brian Celenza is de totale Git-activiteit tussen september 2025 en augustus 2026 gestegen van 218,2 naar 473,3 miljard gebeurtenissen per maand; ontwikkelaars en agents produceerden 7,38 miljard commits in september 2026, meer dan vijf keer zoveel als een jaar eerder, en pushes zijn met een factor 4,9 toegenomen. De huidige architectuur, Spokes, repliceert elke repository naar meerdere servers en valideert elke update via een meerderheidsstemming: het toevoegen van kopieën voor leesacties vertraagt dus schrijfacties. De nieuwe architectuur scheidt opslag en compute, met de referentiedata in Azure Blob Storage en lichte processen (workers) die leesacties vanuit een cache bedienen. In interne benchmarks meet GitHub tot 35 keer meer schrijfdoorvoer, zonder datum voor de omschakeling.
🔗 Building Git infrastructure for agent-scale development
Spraak-AI: ElevenLabs ondertekent intentieverklaring met Indiase deelstaat
7 oktober — Ter gelegenheid van zijn Summit in Bengaluru heeft ElevenLabs zijn eerste intentieverklaring (MOU) ondertekend met de regering van een Indiase deelstaat, voor een proefproject met spraak-AI. Het bedrijf noemt de deelstaat niet en geeft geen tijdschema, reikwijdte of bedrag: de aankondiging bestaat uit een tweet, zonder blogpost. Het cijfer dat ermee gepaard gaat, verduidelijkt het belang: in het afgelopen jaar heeft ElevenAgents meer dan 100 miljoen gesprekken gevoerd in India, waarvan meer dan 70% in het Hindi, Kannada, Tamil en Telugu. De Summit bracht meer dan 500 bedrijfsleiders, ontwikkelaars en partners samen.
🔗 Aankondiging van @ElevenLabs op X
Onderzoek: PivotOPD, de methode van NVIDIA om de doorslaggevende fout van een agent te herstellen
7 oktober — Onderzoekers van NVIDIA presenteren PivotOPD, een trainingsmethode voor agents die meerdere actierondes achter elkaar uitvoeren. Hun bevinding: op ALFWorld bevat 59% van de mislukkingen van drie Qwen3-modellen een “pivot-fout”, die al vroeg wordt gemaakt, waarna de agent in de verkeerde richting blijft doorgaan. PivotOPD bouwt voort op on-policy distillatie (on-policy distillation): bij elke pivot-fout geeft een docentmodel de juiste actie aan, gevolgd door een herstelactie voor de volgende rondes, zodat de leerling leert de fout te voorkomen en ervan te herstellen. Ten opzichte van 13 referentiemethoden behaalt het het beste gemiddelde op ALFWorld, WebShop en Search-based QA met Qwen3-leerlingen van 1.7B en 8B, en herstelt het 72,7% van de 72 nagespeelde pivot-fouten, vergeleken met 20,3% bij standaarddistillatie. De winst vertaalt zich ook naar code: een Nemotron-3.5-leerling stijgt van 62,8% naar 66,0% op SWE-Bench Verified. Het artikel staat op arXiv; de code wordt binnenkort verwacht.
Optimalisatie: mPDLP verdeelt gigantische lineaire programma’s over meerdere GPU’s in cuOpt
7 oktober — NVIDIA voegt aan cuOpt, zijn open-source optimalisatiebibliotheek, mPDLP toe: een solver voor lineair programmeren verdeeld over meerdere GPU’s die via NVLink zijn verbonden, bedoeld voor grote planningsvraagstukken (toeleveringsketens, elektriciteitsnetten). Door onderling afhankelijke variabelen en restricties op dezelfde GPU te groeperen, beperkt het de uitwisselingen en verlaagt het het piekgeheugen per GPU met een factor tot wel 6. Op een DGX B200-node bedraagt de versnelling tot 11,4 keer bij de PDLP-berekening en 4,2 keer end-to-end; ten opzichte van D-PDLP is mPDLP 1,2 tot 2,5 keer sneller bij de meeste grote problemen, maar langzamer bij de drie grootste instanties en bij kleine problemen. Kinaxis lost een toeleveringsketen met meer dan 135 miljoen variabelen 3,3 keer sneller op via acht H100’s, en PSR lost een energiemodel met 185 miljoen variabelen meer dan 5 keer sneller op via acht B200’s.
Robotica: robots assembleren GB300-testtrays
7 oktober — Het Seattle Robotics Lab van NVIDIA legt uit hoe het robots leert om de testtrays voor GB300 te assembleren, waarmee de modules vóór verzending worden gecontroleerd. Samen met Foxconn, dat deze systemen produceert, zijn twee handelingen geselecteerd: het plaatsen en op 16 punten vastschroeven van een stroomrail (busbar), en het aansluiten van vier connectoren die op flexibele kabels zijn gemonteerd. De met Foxconn gestelde eis is een slagingspercentage van 99,5%, in maximaal twee keer de tijd van een gekwalificeerde operator, zonder botsingen. De robots komen dicht in de buurt, maar halen het nog niet: meer dan 95% slagingskans in 160 seconden voor de rail (tegenover de beoogde 124), en 90 tot 95% voor de connectoren, bij 40 seconden per kabel. Het team combineert een klassieke perceptie- en controlepijplijn, DOPER-pose-schatting en reinforcement learning in Isaac Lab, bijgesteld op de echte robot. NVIDIA belooft DOPER en zijn orchestrator TALOS openbaar te maken, zonder datum.
🔗 Technisch blogbericht van NVIDIA over de GB300-trays
In het kort
- De iOS-app van ChatGPT 1.2026.272 — Deze toont pagina-voorbeelden direct in de antwoorden, opent Codex-taaklinks in de app en heeft voor Codex Mobile de goedkeuringskiezer herzien en de feed van lange threads versneld. 🔗 bron
- Radisson Hotel Group — Volgens een casestudy van OpenAI converteert hun ChatGPT-plug-in, gebouwd in zes weken met Accenture Song, ongeveer 1,5 keer beter dan hun organische zoekverkeer in juli-augustus 2026, en wordt 54% van de betaal- en boekingsevents uit hun advertentiecampagne in ChatGPT toegeschreven aan loutere advertentievertoningen. 🔗 bron
- Jump Trading — De kwantitatieve handelsonderneming vertrouwt analyses die meerdere dagen kunnen duren en talrijke databronnen kruisen toe aan GPT-6 Astra-agents, met menselijke controle aan het einde van het proces; de casestudy van OpenAI vermeldt geen cijfers over winst of opbrengst. 🔗 bron
- ChatGPT plug-in-extensies — In de thread bij de videotutorial noemt OpenAI Developers Adobe, Canva, Figma, Shopify, Instacart en Atlassian als bedrijven die er gebruik van maken, naast tldraw en MagicPath; ze werden op 29 september gepresenteerd, starten een plug-in vanuit de zijbalk, ondersteunen @-vermeldingen en voegen bestandsviewers toe. 🔗 bron
- Every en Claude Managed Agents — Het team van Every bouwde op Claude Managed Agents een bedrijfsagent die iedereen in Slack gebruikt om vaardigheden (skills) te delen bij elk nieuw model, en stelde deze vervolgens open voor zijn abonnees; Anthropic deelt een video-interview, zonder cijfers. 🔗 bron
- Zed 1.23 en preview 1.24.1 — Versie 1.23 wordt stabiel met voorvertoning van JSONL- en NDJSON-bestanden, en previewversie 1.24.1 maakt het mogelijk om een terminaltabblad naar het Agent Panel te slepen, ondersteunt aangepaste Amazon Bedrock-modellen met tools, afbeeldingen en redenering (thinking), maakt Git-tags aan en verkleint het binaire Linux-bestand met ongeveer 23%. 🔗 bron
- Puck, de meta-agent van Amp — Deze ondersteunt nu meerdere afzonderlijke gesprekken: de +-knop opent een nieuw gesprek, een klik op de naam laat je wisselen tussen gesprekken, en gesprekken die drie dagen inactief blijven, worden apart gearchiveerd. 🔗 bron
- Copilot CLI 1.0.93 — Deze is nu stabiel en past configuratiewijzigingen van MCP-servers tussen twee beurten toe zonder de sessie te herstarten, en stelt de commandosandbox voor iedereen open via /sandbox en —sandbox; ook de Copilot SDK 1.0.17 is nu stabiel. 🔗 bron
- Gebruiksstatistieken van Copilot — Deze onderschatten de activiteit van agents sinds meerdere IDE’s hun sessies via de Copilot SDK laten lopen; de fix vereist een update (VS Code 1.139.0 vanaf nu, Visual Studio 18.12 in oktober, JetBrains eind oktober, Eclipse en Xcode tegen november), en de verloren gegevens worden niet hersteld. 🔗 bron
- Gemini CLI v0.65.0-nightly.20261007 — Deze nightly-release trapt de 0.65.0-reeks af met vijf fixes, waarvan twee tegen gegevensverlies: projectinstellingen worden alleen-lezen in een niet-vertrouwde map, waar
gemini mcp addvoorheen.gemini/settings.jsonkon leegmaken, en het direct afsluiten van een hervatte sessie verwijdert de geschiedenis ervan niet langer. 🔗 bron - Transformers.js 4.3.1 — Daags na de lancering van EmbeddingGemma 2 berekent de bibliotheek de multimodale embeddings ervan (740 miljoen parameters, 768 dimensies) rechtstreeks in de browser, via WebGPU of WASM, of onder Node.js. 🔗 bron
- RL Environment Explorer — Adithya S K van Hugging Face presenteert deze Space van FineEnvs om reinforcement learning-omgevingen van de Hub (OpenEnv, Harbor, MiMo, Verifiers, NeMo Gym) te verkennen, visualiseren en starten: meer dan 12 miljoen taakinvoergegevens, voornamelijk afkomstig uit enkele grote OpenEnv-omgevingen. 🔗 bron
- Seb-9B — Stas Veretennikov publiceert dit lokale beslissingsmodel onder de Apache-2.0-licentie (tekst, JSON of afbeelding, tot 20 opties), dat een gemiddelde van 0,792 behaalt over 17 publieke suites tegenover 0,786 voor Jev 1.13; de auteur voerde alle metingen uit en vermeldt dat zijn trainingsdata het trainingsgedeelte van een van de benchmarks bevatte, zonder de testcases ervan. 🔗 bron
- Nemotron op de Olympiades 2026 — NVIDIA licht het gemeenschappelijke recept toe (supervised fine-tuning, reinforcement learning, een lus die genereert, verifieert en corrigeert) achter 535,4 uit 600 op de IOI 2026, bij niet-officiële deelname, en 30 uit 42 op de IMO 2026, bij een gouden drempel van 29, en publiceert de benchmark Nemotron-IMO-Bench met 200 vraagstukken. 🔗 bron
- Instadocs: AI Gone Wild — Netflix kondigt voor 12 oktober deze documentaire aan over de reconstructie van de cyberaanval die Hugging Face in juli trof, volgens Netflix uitgevoerd door autonome agents die zijn gemaakt door onderzoekers van OpenAI. 🔗 bron
- Runway in de app-directory van ChatGPT — Zodra de plug-in is geïnstalleerd en het Runway-account is gekoppeld, kan via een @Runway-vermelding in een gesprek beeld- of videogeneratie worden gestart; Runway vermeldt geen prijzen of creditkosten. 🔗 bron
- Face Swap van Luma — De functie vervangt het gezicht van een personage in een bestaand shot om te itereren zonder opnieuw te hoeven beginnen; de aankondiging bestaat uit twee tweets, zonder productpagina, prijs of details over het model. 🔗 bron
- DSX Air — NVIDIA laat zien hoe wijzigingen in een AI-fabriek kunnen worden getest op deze digitale tweeling: agents passen de wijziging toe, controleren configuratie, beveiliging en isolatie en brengen vervolgens rapport uit, waarbij ingebruikname in productie onderworpen blijft aan menselijke validatie; methodologisch artikel, zonder cijfers. 🔗 bron
- cuPhoton — Een tutorial van NVIDIA past deze open-source toolkit toe op de analyse van astronomische beelden op GPU, van het uitlezen van FITS-bestanden tot het beoordelen van kandidaten; de aangekondigde versnellingen, tot wel 14.900 keer, hebben betrekking op specifieke bewerkingen en niet op de end-to-end verwerking. 🔗 bron
- Cosmos en SynthID — Inhoud die wordt gegenereerd door de NVIDIA Cosmos-modellen op build.nvidia.com draagt het SynthID-watermerk en kan nu door iedereen worden gecontroleerd met de door Google opengestelde detector. 🔗 bron
- De TypeScript-SDK van SpaceXAI 0.2.3 — Deze voegt een serviceniveau
fasttoe, uitwisselbaar metpriority, en de identifiergrok-imagine-video-1.5-lite, een lichter videomodel dat ontbreekt in de release notes: volgens de gegevens op de modellenpagina accepteert het geen audio als invoer en kost het per seconde vier keer minder dangrok-imagine-video-1.5in 480p. 🔗 bron - Gids RAG vs. LLM — Perplexity publiceert een educatieve gids die RAG en LLM’s als complementair presenteert, drie soorten RAG onderscheidt (naïef, modulair, geavanceerd) en toelicht wanneer een LLM alleen volstaat; geen nieuwe functies of cijfers. 🔗 bron
Wat dit betekent
Kleine modellen worden het massaproduct. Vanaf 8 oktober is het GPT-6 Luna die antwoordt aan gratis gebruikers van ChatGPT, en Anthropic zet Haiku 5.5 in op 0,10 dollar per miljoen inputtokens onder 100.000 prompttokens, terwijl de prijs voor cache-leesacties van Sonnet 5.5 wordt gehalveerd. Deze modellen vangen het leeuwendeel van het volume op: alledaagse gesprekken, sub-agents, samenvattingen, compacties. De ranglijst van Cursor herinnert er echter aan dat de prijs per token niet alles zegt: bij Max-inspanning verbruikt Haiku 5.5 bijna negen keer meer tokens per taak dan Sonnet 5.5 bij High-inspanning, voor kosten per taak die nauwelijks lager liggen (1,12 dollar tegenover 1,20). Het maandelijkse API-tegoed van de Max- en Team-abonnementen nodigt abonnees intussen uit om deze modellen in hun eigen code uit te proberen.
AI verplaatst zich ook naar het werkstation. RTX Spark-laptops verschijnen op 16 oktober, DGX Station for Windows belooft tot 20 petaflops op een bureau, en Copilot zal tegen het einde van de maand zelf bepaalde taken lokaal toevertrouwen aan MAI Code 1.1 Flash. Replit bouwt applicaties voortaan op de machine van de gebruiker. Agents die code uitvoeren op een pc roepen een beveiligingsvraagstuk op, en dezelfde bouwsteen keert overal terug: Microsoft Execution Containers (MXC), algemeen beschikbaar onder Windows, isoleert zowel de commando’s van Copilot als de builds van Replit. GitHub rolt op zijn beurt een speciale classifier uit voor gelekte geheimen en herbouwt zijn Git-infrastructuur, omdat één op de drie pull requests nu al een agent betreft en het aantal commits in een jaar tijd meer dan vervijfvoudigd is.
Het antwoord wordt ook een interface. Met Intelligent UI reageert ChatGPT met grafieken, formulieren of een kleine tool die op verzoek wordt opgebouwd, en begint het al met antwoorden voordat het klaar is met nadenken. Aan de kant van de ontwikkelaars ondersteunen de Claude-SDK’s de lus van computer use en browser use, en Cursor maakt het mogelijk om vanaf een iPhone de agents te volgen die op de computer werken en erop te reageren. In al deze drie gevallen is tekst nog maar een deel van de interactie: de AI toont, klikt en rapporteert, de gebruiker houdt toezicht.
Tot slot worden veel van de cijfers van vandaag gemeten door de partijen die ze publiceren: de benchmarks van Haiku 5.5 door Anthropic, die van MAI Code 1.1 Flash door Microsoft, Q2D-Web door Perplexity, dat het heeft ontworpen, de scores van Open d1 door Liquid AI, en de met een factor 35 toegenomen schrijfdoorvoer door de interne tests van GitHub. OpenAI waarschuwt zelf dat niet-geformaliseerde resultaten van zijn 722 manuscripten fouten kunnen bevatten, en de snelheidswinsten voor GPT-6 zijn afkomstig van interne evaluaties. Deze metingen blijven nuttig om producten onderling te plaatsen; externe evaluaties, zoals de CursorBench-ranglijst, waarin de ene toolmaker het model van een ander meet, zullen het mogelijk maken om ze te verifiëren.
Bronnen
- GPT-6 and Intelligent UI for everyone (OpenAI)
- Aankondiging van GPT-6 voor iedereen (@OpenAI)
- Systeemkaart GPT-6 Sol en GPT-6 Luna, update van oktober
- GPT-6 and other models in ChatGPT
- Releasenotes van ChatGPT
- Uploading files and audio to ChatGPT
- Helping teens learn, plan, and shape the future of AI (OpenAI)
- Aankondiging van Claude Haiku 5.5 (Anthropic)
- Lancering van Claude Haiku 5.5 (@claudeai)
- Migratiegids voor Haiku 5.5
- Haiku 5.5 in Cursor (@cursor_ai)
- CursorBench-ranglijst
- Maandelijkse API-credits voor Max- en Team-abonnementen (Claude-ondersteuning)
- Aankondiging van API-credits (@ClaudeDevs)
- RTX Spark en DGX Station for Windows (NVIDIA-blog)
- Bringing local models and sandboxed tools to Windows and GitHub Copilot (Microsoft Command Line)
- Discover local models in GitHub Copilot CLI
- Local sandboxing for GitHub Copilot now generally available
- Preview van de desktop-app van Replit (@Replit)
- Wachtlijst voor de desktop-app van Replit
- Vooruitgang van AI in wiskunde delen (OpenAI)
- Repository openai/math
- Aankondiging van de wiskundige resultaten (@OpenAI)
- Multimodal embeddings beyond a single vector (Perplexity Research)
- pplx-embed-v2-late-9b op Hugging Face
- Claude Code 2.1.293
- Codex CLI 0.161.0
- Remote control for local agents (changelog van Cursor)
- Changelog van Antigravity
- Warp Factories, Microsoft Teams en Azure DevOps (Warp-blog)
- Toolsets computer use en browser use in de SDK’s (@ClaudeDevs)
- Documentatie van de toolsets van de Claude SDK
- Deploy and use Grok models in Microsoft Foundry
- Open d1 (Liquid AI op Hugging Face)
- Bolmo in Nature (Ai2)
- Google expands SynthID Detector for AI content
- Secret protection must scale with software (GitHub)
- Building Git infrastructure for agent-scale development (GitHub)
- Memorandum van overeenstemming met een Indiase deelstaat (@ElevenLabs)
- PivotOPD (NVIDIA Research)
- mPDLP in cuOpt (technische NVIDIA-blog)
- The machines that make the machines (technische NVIDIA-blog)
- Changelog ChatGPT en Codex, ChatGPT voor iOS 1.2026.272
- Radisson Hotel Group brings hotel discovery into ChatGPT (OpenAI)
- How Jump Trading is scaling quant research with ChatGPT (OpenAI)
- Plug-inextensies voor ChatGPT (@OpenAIDevs)
- Every en Claude Managed Agents (@claudeai)
- Zed v1.24.1-pre
- Many, Many Pucks (Amp)
- Copilot CLI 1.0.93
- Update your IDE to restore agent activity in Copilot usage metrics
- Gemini CLI v0.65.0-nightly.20261007
- Transformers.js 4.3.1
- RL Environment Explorer (@adithya_s_k)
- Seb-9B head to head (Hugging Face-blog)
- Nemotron op de IOI en de IMO 2026 (Hugging Face-blog)
- Instadocs: AI Gone Wild (@netflix)
- Runway in ChatGPT (@runwayml)
- Face Swap (@LumaLabsAI)
- Validate AI factory changes with digital twins and AI agents (technische NVIDIA-blog)
- Faster scientific image analysis with NVIDIA cuPhoton
- Cosmos en SynthID (@NVIDIAAI)
- TypeScript-SDK van SpaceXAI 0.2.3
- RAG vs. LLM (Perplexity)