ai-powered-markdown-translatorArtikel översatt från fr till sv med gemini-3.8-flash-high.
GPT-6 och Intelligent UI kommer till alla ChatGPT-användare: GPT-6 Sol för betalda abonnemang från och med den 7 oktober, GPT-6 Luna för Free och Go från och med den 8 oktober. Anthropic kompletterar sin 5.5-familj med Claude Haiku 5.5, från 0,10 dollar per miljon indatatokens, samtidigt som Microsofts Windows-evenemang öppnar förbeställningarna för RTX Spark-datorer och meddelar att GitHub Copilot snart kommer att kunna lägga ut sina uppgifter på en lokal modell. OpenAI publicerar även 722 manuskript med matematiska resultat framtagna av en intern modell.
ChatGPT växlar till GPT-6 och Intelligent UI för alla, läser ljudfiler och förbereder College Planner
7 oktober — OpenAI utökar GPT-6 till alla ChatGPT-användare. Det rör sig inte om en ny basmodell: GPT-6 Sol och GPT-6 Luna erbjöds redan betalande kunder sedan september (rapporterat här den 22 september). Denna gång lanseras oktoberversioner av dessa två modeller, anpassade för vardagliga konversationer, i Chat-fliken: GPT-6 Sol för Plus, Pro, Business och Enterprise från och med den 7 oktober, GPT-6 Luna för Free och Go från och med den 8 oktober. De ersätter GPT-5.6 Sol och GPT-5.6 Luna i ChatGPT, medan Codex och ChatGPT Work förblir på septemberversionerna. OpenAI uppger att man därmed når de drygt 1,2 miljarder människor som använder ChatGPT varje vecka.
Den mest synliga nyheten kallas Intelligent UI. GPT-6 bygger sina svar med text, grafik och interaktiva element (diagram, knappar, formulär, interaktiva grafer, kartor) och kan på begäran skapa ett litet verktyg, som en sparkalkylator, en notoräknare eller ett spel; när en enkel text räcker håller sig ChatGPT till det. OpenAI förlitar sig för detta på ett bibliotek med interna komponenter och på en kompilator som visar gränssnittet i takt med genereringen. Intelligent UI fungerar från Instant- till Extra High-effort, utan separat kvot, men varken med Pro-effort, som hanteras av GPT-6 Pro (driven av GPT-6 Astra), eller i de äldre skrivbordsapparna för macOS och Windows.
Den andra förändringen: ChatGPT kan börja svara medan den tänker eller använder verktyg, för att sedan komplettera sitt svar utan en ny prompt. Enligt interna utvärderingar från OpenAI börjar GPT-6 Instant svara i genomsnitt 44 % tidigare än GPT-5.6 Instant på frågor som kräver webbsökning, och GPT-6 Extra High startar inom samma tidsram som GPT-5.6 Medium, med en bättre totalpoäng än GPT-5.6 Extra High.
| Abonnemang eller effort-inställning | Modell som används i ChatGPT | Tidsplan och detaljer |
|---|---|---|
| Plus, Pro, Business och Enterprise | GPT-6 Sol (Instant, Medium, High, Extra High) | Global utrullning från 7 oktober |
| Free och Go | GPT-6 Luna | Från och med 8 oktober |
| Pro-effort (Pro 100 och 200 dollar, Business, Enterprise) | GPT-6 Pro, driven av GPT-6 Astra | Utan Intelligent UI |
| ChatGPT Work och Codex | Septemberversioner av GPT-6 Sol och GPT-6 Luna | Inga ändringar |
På säkerhetssidan klassificerar systemkortet som publicerades samma dag dessa versioner med kapacitetsnivån ”High” inom cybersäkerhet samt biologi och kemi enligt Preparedness Framework, utan att nå denna tröskel för självförbättring; de övertar skyddsåtgärderna från GPT-5.6, med förbättrad motståndskraft mot jailbreak-försök (jailbreaks), även över flera samtalsomgångar. I API:et pekar ögonblicksbilden chat-latest nu mot denna nya ChatGPT-modell, och OpenAI rekommenderar GPT-6-familjen för produktion.
GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot.
🇸🇪 GPT-6 och Intelligent UI rullas nu ut i ChatGPT för alla. I ChatGPT ger Intelligent UI snabba, interaktiva svar som gör vardagliga frågor mer visuella, komplexa ämnen lättare att förstå och tillhandahåller direkt interaktiva verktyg anpassade för din uppgift. — @OpenAI på X
🔗 GPT-6 and Intelligent UI for everyone · Systemkort, oktoberuppdatering · GPT-6 and other models in ChatGPT
Ljudfiler i ChatGPT
6 oktober — ChatGPT tar nu emot ljudfiler som bilagor. Man kan bifoga en inspelning till en konversation för att få en transkribering, en sammanfattning eller svar om dess innehåll, eller för att omvandla ett möte, en intervju eller en lektion till strukturerade anteckningar, eller till och med ett utkast till ett uppföljningsmejl. Funktionen är förbehållen betalabonnemang och betalda arbetsytor, inklusive Enterprise: Free-abonnemanget har inte tillgång till den ”för närvarande”. De format som stöds är WAV, MP3, OGG, FLAC, AAC, M4A och PCM, samt WebM och MP4 om de endast innehåller ljud, upp till 512 MB per fil. OpenAI varnar för att transkriberingarna kan innehålla fel, att talaridentifiering fortfarande är opålitlig och att prestandan varierar mellan olika språk.
🔗 Versionsanteckningar för ChatGPT · Uploading files and audio to ChatGPT
ChatGPT for Teens: första användningssiffrorna och College Planner på gång
7 oktober — OpenAI ger en första statusuppdatering om ChatGPT for Teens, upplevelsen som tillämpas som standard för konton som identifierats tillhöra personer under 18 år. Enligt företaget använde nära 1,2 miljoner tonåringar Learning Visualizations under en vecka och över 180 000 Study Mode; de tillbringar i genomsnitt mindre än 15 minuter per dag där, och mindre än 2 % överskrider tre sammanhängande timmar. Den aviserade nyheten, College Planner, kommer ”snart”, till en början i USA för gymnasieelever i årskurs 10 till 12 som siktar på ett fyraårigt universitet: en och samma plan kommer att samla ansökningskrav, deadlines, uppgifter och ansökningsprocesser för studiestöd, inklusive stipendier. OpenAI stödjer även College Advising Corps och under tre år Digital Wellness Lab vid Boston Children’s Hospital, utan att ange något belopp.
🔗 Helping teens learn, plan, and shape the future of AI
Claude Haiku 5.5, cirka 75 % billigare än Haiku 4.5 enligt Anthropic
7 oktober — Två veckor efter Opus 5.5 och nio dagar efter Sonnet 5.5 kompletterar Anthropic Claude 5.5-familjen med Claude Haiku 5.5 (claude-haiku-5-5). Modellen riktar sig till volymkrävande och kostnadskänsliga uppgifter (sammanfattningar, kontextkomprimering, databasfrågor, klassificering), rollen som underagent till Opus 5.5 och Sonnet 5.5 vid kodning, samt användningsområden där hastighet är avgörande, som live-kundsupport eller webbläsarstyrning: det är Anthropics snabbaste modell vid standardhastighet, även om Opus i Fast Mode fortfarande är snabbare. Det är också den första Haiku-modellen med en effort-inställning (medium som standard), med ett kontextfönster på 1 miljon tokens och upp till 128 000 utdatatokens.
Prissättningen följer två nivåer. Upp till 100 000 prompt-tokens kostar Haiku 5.5 0,10 dollar per miljon indatatokens och 0,50 dollar för utdata, vilket är 90 % mindre än Haiku 4.5; därutöver stiger det till 0,50 respektive 2,50 dollar, 50 % mindre. Den framhävda besparingen på ”cirka 75 %” är ett genomsnitt beräknat av Anthropic: 90 % av anropen till Haiku 4.5 låg under tröskeln, och den nya tokeniseraren (tokenizer) räknar cirka 30 % fler tokens för samma text.
| Pristyp (per miljon tokens) | Haiku 5.5 upp till 100 000 prompt-tokens | Haiku 5.5 över 100 000 tokens | Haiku 4.5 |
|---|---|---|---|
| Indatatokens | 0,10 dollar | 0,50 dollar | 1 dollar |
| Utdatatokens | 0,50 dollar | 2,50 dollar | 5 dollar |
| Cacheläsningar | 0,01 dollar | 0,05 dollar | 0,10 dollar |
| Cacheskrivningar | 0,125 dollar | 0,625 dollar | 1,25 dollar |
I de riktmärken (benchmarks) som publicerats av Anthropic är klyftan till Haiku 4.5 stor, och Haiku 5.5 överträffar OpenAIs GPT-6 Luna överallt där båda förekommer. Den ligger dock fortfarande efter Sonnet 5.5, som Anthropic alltjämt rekommenderar, tillsammans med Opus 5.5, för komplex agentisk kodning.
| Utvärderat benchmark (Anthropics siffror) | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 (agentisk kod) | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| OSWorld 2.1, offline-delmängd | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Humanity’s Last Exam, utan verktyg | 45,9 % | 10,2 % | — | 56,9 % |
| FrontierCode 1.1, Main | 46,4 % | — | 42,4 % | 52,1 % (Xhigh-effort) |
| Chartography, utan verktyg | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
Sex kunder har delat med sig av sina tidiga tester: HubSpot uppger 92,8 % på sin CRM-svit, dess högsta resultat hittills, AlphaSense 0,84 jämfört med 0,76 för Haiku 4.5 över 400 förfrågningar, och Box 11 poäng högre med ungefär halverad latens. Migreringen från Haiku 4.5 kräver en del arbete: guiden listar elva förändringar, däribland slutet för budget_tokens, parametrarna temperature, top_p och top_k samt förhandsifyllning (prefill), och kommandot /claude-api migrate i Claude Code automatiserar en del av detta. På säkerhetssidan beskriver Anthropic cyberskydd som är mer restriktiva än för Haiku 4.5 men något mindre än för dess andra nyligen släppta modeller: fler defensiva uppgifter är tillåtna än med Sonnet 5.5, medan penetrationstester fortfarande blockeras.
Lanseringen åtföljs av en prissänkning: cacheläsningar för Sonnet 5.5 sänks från 0,20 till 0,10 dollar per miljon tokens från och med den 7 oktober, vilket enligt Anthropic gör modellen cirka 20 % billigare för de flesta agentiska uppgifter. Haiku 5.5 är tillgänglig nu via Claude API, Amazon Web Services, Google Cloud och Microsoft Azure, samt i Claude Code.
Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5.
🇸🇪 Här är Claude Haiku 5.5: den billigaste, snabbaste och mest kapabla lilla modell vi någonsin släppt. I genomsnitt kostar den cirka 75 % mindre att köra än Claude Haiku 4.5. — @claudeai på X
🔗 Tillkännagivande av Claude Haiku 5.5 · Migreringsguide till Haiku 5.5
Haiku 5.5 i Cursor: 48,4 % på CursorBench
7 oktober — Cursor gör Claude Haiku 5.5 tillgänglig redan på lanseringsdagen, att aktivera i dess modellinställningar. Enligt Cursor är den 10 gånger billigare än Claude Haiku 4.5 vid korta förfrågningar. På CursorBench, topplistan som Cursor publicerar på sin webbplats, placerar sig Haiku 5.5 med Max-effort på 10:e plats med 48,4 % framgång för 1,12 dollar per uppgift, strax före Sonnet 5.5 med High-effort, vars kostnader Cursor räknade om den 7 oktober för att ta hänsyn till dess nya pris, och före Opus 5 med Max-effort. Den arbetar dock mer: i genomsnitt 325 934 tokens och 163 steg per uppgift, jämfört med 37 391 tokens och 41 steg för Sonnet 5.5 med High-effort.
| Konfiguration testad av Cursor | Placering på topplistan | CursorBench-poäng | Kostnad per uppgift |
|---|---|---|---|
| Opus 5.5, effort Max | 1 | 57,8 % | 13,43 dollar |
| Haiku 5.5, effort Max | 10 | 48,4 % | 1,12 dollar |
| Sonnet 5.5, effort High | 11 | 47,8 % | 1,20 dollar |
| Opus 5, effort Max | 13 | 46,6 % | 11,95 dollar |
| Haiku 5.5, effort Low | 54 | 30,9 % | 0,08 dollar |
🔗 Cursors tillkännagivande på X · CursorBench-topplista
En månatlig API-kredit på 100 till 500 dollar för Max- och Team-abonnemang
7 oktober — Tillkännagiven i samma inlägg som Haiku 5.5 rullas nu en månatlig kredit för Claude Platform ut till Max- och Team-prenumeranter under loppet av några dagar. Den är avsedd för att bygga egna verktyg, applikationer och agenter med API:et; enligt @ClaudeDevs fungerar den med alla modeller, inklusive Haiku 5.5, i såväl egen kod som i verktyg från tredje part.
| Berört abonnemang | Månatlig API-kredit |
|---|---|
| Max 5x | 100 dollar |
| Max 20x | 200 dollar |
| Team, Standard-plats | 20 dollar per plats |
| Team, Premium-plats | 100 dollar per plats |
| Tak för ett Team-team | 500 dollar, gemensamt |
| Free, Pro och Enterprise | Ej berättigade |
På Team slås platsernas krediter samman i en gemensam pott: tre Standard-platser och två Premium ger till exempel 260 dollar per månad. Krediten täcker alla modeller i Claude API, inklusive Message Batches API, samt Console Playground, Claude Managed Agents och Claude Agent SDK. Den täcker inte Claude Code vid interaktiv användning (terminal, IDE, skrivbords- eller webbapplikation), inte heller extra användning utöver abonnemangets gränser eller Claude-modeller som tillhandahålls via Amazon Bedrock, Google Cloud Vertex AI eller Microsoft Foundry, och den ändrar inte användningsgränserna för Claude, Claude Code eller Cowork.
För att hämta den krävs ett abonnemang som varit aktivt i minst sju dagar på en berättigad plan, och sedan koppla en organisation i Claude Console från faktureringsinställningarna på claude.ai, utan att lägga till någon betalningsmetod. Endast en organisation kan kopplas, och endast supporten kan ändra den. Krediten förnyas vid varje faktureringscykel, kan inte sparas och används före köpta krediter; när den är förbrukad pausas anropen fram till nästa kredit, såvida inte organisationen har köpt krediter eller aktiverat automatisk påfyllning, och ingenting debiteras på Claude-prenumerationen. I maj tillkännagav Anthropic en månatlig kredit för programmatisk användning från och med den 15 juni; hjälpsidan förtydligar att den nya krediten inte motsvarar dessa “Agent SDK-krediter”, vilka anges som otillgängliga.
🔗 Hjälpsida: månatliga API-krediter för Max- och Team-abonnemang · Tillkännagivande från @ClaudeDevs
Lokal AI på Windows: NVIDIA öppnar förhandsbokningar för RTX Spark-datorer och förhandsvisar DGX Station for Windows
7 oktober — NVIDIA och Microsoft utnyttjar evenemanget Windows AI and Surface, som anordnades i San Francisco med ett samtal mellan Jensen Huang och Satya Nadella, för att kommersiellt lansera RTX Spark, chippet för Windows-datorer som tillkännagavs på Build den 2 juni. Förhandsbokningarna av bärbara datorer är öppna sedan den 7 oktober, med tillgänglighet den 16 oktober; mini-PC-datorer följer i november. Acer, ASUS, Dell, HP, Lenovo, Microsoft, MSI och Gigabyte förbereder enheter, och Microsoft visar upp en Surface Laptop Ultra byggd kring chippet. NVIDIAs blogginlägg anger inga priser.
RTX Spark kombinerar en Blackwell RTX-GPU och en Grace-CPU med en förbindelse på 600 GB/s, vilket ger en petaflops AI-beräkning i FP4 och upp till 128 GB enhetligt minne. NVIDIA lyfter fram lokal körning av stora modeller, utan dataöverföring till molnet eller användningsmätare, med samma CUDA-stack som på deras servrar. Chippet riktar sig även till kreatörer (NVFP4, hårdvaru-AV1 och 4:2:2-kodning) och gamers, med spel i 1440p på över 100 bildrutor per sekund tack vare DLSS 5.
För företag förhandsvisar NVIDIA DGX Station for Windows, som också tillkännagavs på Build i juni, och beskriver den som Windows-ekosystemets första AI-superdator för skrivbordet: tillräckligt för att köra modeller i storleksordningen tusen miljarder parametrar lokalt utan att lämna Windows, samtidigt som Linux-verktyg förblir tillgängliga via WSL. Det finns varken datum eller pris, bara en anmälan för att få aviseringar. För sin del gör Microsoft Microsoft Execution Containers (MXC) allmänt tillgängligt, infrastrukturen som kör agenter i bakgrunden under Windows kontroll.
| Jämförd egenskap | RTX Spark | DGX Station for Windows |
|---|---|---|
| Chip | Blackwell RTX-GPU (upp till 6 144 kärnor) och Grace-CPU (upp till 20 kärnor) | GB300 Grace Blackwell Ultra Desktop-superchip |
| Minne | Upp till 128 GB, enhetligt | 748 GB, koherent |
| AI-beräkning i FP4 | 1 petaflops | Upp till 20 petaflops |
| Tillkännagiven tillgänglighet | Bärbara kan förhandsbokas, tillgängliga 16 oktober; mini-PC i november | Förhandsvisning, utan datum eller pris |
🔗 NVIDIAs blogginlägg om Windows-evenemanget
Utveckla lokalt på Windows: Copilot kommer att dirigera till MAI Code 1.1 Flash, dess sandlåda blir allmänt tillgänglig, Replit förbereder en skrivbordsapp
7 oktober — GitHub Copilot kommer snart att på egen hand kunna välja mellan en modell som körs på utvecklarens dator och en modell i molnet. Enligt Microsofts och GitHubs inlägg på bloggen Microsoft Command Line kommer denna dirigering “före månadens slut”: den är ännu inte tillgänglig. GitHub presenterar det som nästa steg för Project HydraFusion, dess orkestrerare som redan fördelar uppgifter mellan flera modeller, och lyfter fram en besparing av AI-krediter, utan att kvantifiera den.
Två användningssätt planeras i Copilot CLI, GitHub Copilot-appen och VS Code. Auto-läget kommer omgång för omgång att välja mellan lokal inferens och molnet beroende på uppgiftens kontext och cachestatus; utvecklaren kan också själv välja en lokal modell, MAI Code 1.1 Flash via Windows ML-providern eller vilken modell som helst som exponeras via en lokal slutpunkt (endpoint) kompatibel med OpenAI:s API. Inlägget påminner om att lokal inferens inte gör sessionen offline.
Demonstrationen körs på en Surface Laptop Ultra utrustad med RTX Spark. Microsoft AI kör där en lokal version av MAI Code 1.1 Flash, en expertblandning (mixture-of-experts) specialiserad på kod, med 137 miljarder parametrar varav 6,8 miljarder aktiva. Kvantiserad till cirka 3,3 bitar per vikt tar den upp 53 GB, 80 % mindre än molnvarianten, med en minnestopp på 75,5 GB vid 256 000 tokens kontext.
| Utvärderat benchmark (Microsoft-tester från 5 oktober) | MAI Code 1.1 Flash | Kvantiserad version på enheten | GPT OSS 120B (Unsloths GGUF-version) |
|---|---|---|---|
| SWE-Bench Verified (500 uppgifter) | 72,6 % | 70,80 % | 32,0 % |
| Terminal-Bench 2.1 (89 uppgifter) | 62,9 % | 66,29 % | 23,6 % |
Microsoft preciserar att dessa tester kördes på en llama.cpp-körmiljö för Windows ARM64 och att resultaten varierar beroende på enhet och konfiguration. En första byggsten är redan tillgänglig i terminalen: sedan förhandsversion 1.0.94-0 av Copilot CLI identifierar kommandot /model modeller från en lokal Ollama-instans. Inget läggs till utan bekräftelse, Ollama och modellen måste redan vara installerade, och endast modeller som hanterar verktygsanrop och strömning (streaming) föreslås.
🔗 Bringing local models and sandboxed tools to Windows and GitHub Copilot · Discover local models in GitHub Copilot CLI
Copilots lokala sandlåda i allmän tillgänglighet
7 oktober — Den lokala sandlådan i GitHub Copilot lämnar den offentliga förhandsversionen som öppnades den 2 juni: den blir allmänt tillgänglig i Copilot CLI, GitHub Copilot-appen och VS Code-sessioner som går via Agent Host, utan extra kostnad. Verktyg och kommandon som körs av Copilot körs då med begränsad åtkomst till filer, nätverk, Git- och GitHub CLI-inloggningsuppgifter och andra systemfunktioner, enligt policyer fastställda av utvecklaren eller dennes organisation; ett företag kan tvinga fram inställningar som utvecklare inte kan lätta på, oavsett vilken modell som används. Motorn, Microsoft eXecution Container (MXC), är ett open source-bibliotek från Windows-teamet som bygger på ProcessContainer på Windows, Seatbelt på macOS och bubblewrap på Linux, utan virtuell maskin. Dess begränsningar är tydligt angivna: de inbyggda filverktygen styrs av Copilot själv och inte av systemet, och fjärranslutna MCP-servrar förblir utanför den lokala sandlådan.
🔗 Local sandboxing for GitHub Copilot now generally available
Replit bygger applikationer lokalt på Windows
7 oktober — Replit tillkännager tillsammans med Microsoft förhandsversionen av en skrivbordsapplikation som bygger och kör applikationer direkt på användarens dator, på Windows. Replit erbjöd redan en skrivbordsapp: nyheten ligger i detta lokala byggande, där varje bygge körs i en egen sandlåda baserad på Microsoft Execution Containers och OpenShell, NVIDIAs körmiljö i öppen källkod. Tidig åtkomst sker via en väntelista, utan datum eller pris, och ingen macOS-version nämns. Replit presenterade denna förhandsversion på scenen under Windows-evenemanget den 7 oktober.
🔗 Replit-meddelande på X · Väntelista för förhandsversionen
OpenAI publicerar 722 manuskript med matematiska resultat framtagna av en intern modell
6 oktober — OpenAI publicerar på ett bräde en omfattande samling matematiska resultat framtagna av en intern spetsmodell som inte är offentligt tillgänglig. GitHub-arkivet openai/math, som tillkännagavs på kvällen den 6 oktober, samlar 722 manuskript indelade i 372 familjer sorterade efter disciplin: ett huvudresultat kan där åtföljas av kompletterande argument, följdsatser eller alternativa bevis.
Den stora majoriteten av resultaten härrör från samma procedur: cirka 4 000 problem som ställdes till modellen, med i genomsnitt motsvarande tre timmars eftertanke i ChatGPT Pro per resultat. OpenAI förklarar att de utökade sina utvärderingar till öppna forskningsproblem efter att ha mättat sina befintliga matematiktester. Två arbeten utgör undantag från denna procedur: ett nollställefritt område för Riemanns zetafunktion, vars formulering bearbetades av en människa för läsbarhetens skull, och beviset för ett specialfall av Hodges förmodan, det för abelska CM-mångfalder.
| Indikator publicerad av OpenAI | Tillkännagivet värde |
|---|---|
| Publicerade manuskript | 722 |
| Resultatfamiljer | 372 |
| Problem som ställdes till modellen | Cirka 4 000 |
| Genomsnittlig beräkning per resultat | Cirka tre timmars eftertanke i ChatGPT Pro |
| Publicerade resonemangssammanfattningar | 10 |
Alla resultat är inte verifierade på samma sätt. Många bevis är formaliserade i Lean, ett språk som gör det möjligt att verifiera bevis via dator, men inte alla: OpenAI varnar för att “vissa icke-formaliserade resultat kan innehålla fel”, lovar att korrigera dem snabbt och kommer att lägga till nya formaliseringar efter hand. De tio sammanfattningarna av modellens resonemang berör ämnen som irrationalitetsmåttet för π, Mahlers förmodanden, Kaplanskys förmodan om direkt ändlighet i karakteristik två eller isomorfin hos fria gruppfaktorer.
Själva publiceringen förbereddes tillsammans med den oberoende rådgivande gruppen för matematik och AI vid Institute for Advanced Study: gransknings- och citeringsprotokoll, rättelser publicerade som nya versioner, bevarad versionshistorik. OpenAI tillkännager också finansiering av workshops, konferenser och program tillägnade dessa resultat, och uppger att de arbetar på en “ansvarsfull” åtkomst för forskare till modellen som tog fram dem, utan någon tidsplan.
We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results.
🇸🇪 Vi publicerar ett brett spektrum av nya matematiska resultat framtagna av en intern spetsmodell. Vi har rådfrågat den oberoende rådgivande gruppen för matematik och artificiell intelligens vid Institute for Advanced Study, och vi har förlitat oss på deras råd och offentliga rekommendationer för att besluta om hur dessa resultat ska publiceras. — @OpenAI på X
🔗 Dela AI-framsteg inom matematik · openai/math-arkivet på GitHub
Perplexity publicerar pplx-embed-v2-late, multivektor-embeddings för text och bilder
7 oktober — Perplexity Research publicerar pplx-embed-v2-late, två embeddingmodeller med sen interaktion (late interaction) på 0,6B och 9B parametrar, tillgängliga på Hugging Face under MIT-licens. Där en tät embedding komprimerar varje dokument till en enda vektor, bevarar dessa ColBERT-liknande modeller en 128-dimensionell vektor per token och poängsätter varje sökfråga-dokument-par med MaxSim: varje token i sökfrågan matchas mot den närmaste tokenen i dokumentet. De söker i text, bilder och renderade sidor (PDF-filer, presentationer, skanningar) utan att gå via OCR, vilket bevarar tabeller, figurer och layout.
De två storlekarna delar samma embeddingrymd eftersom de destilleras token för token från en intern lärarmodell på 18B, hämtad från en bas på 27B. En korpus som indexerats med 9B kan därför genomsökas med sökfrågor kodade med 0,6B: på bildbaserade ViDoRe v3 når denna konfiguration 63,5 %, mot 62,3 % med 0,6B på båda sidor, utan extra kostnad per sökfråga. 0,6B-modellen, beskuren från Qwen3.5-0.8B, fungerar därmed som en lätt sökfrågekodare, ända ut på enheten.
| Utvärderat benchmark (Perplexitys mätningar) | Poäng för 9B | Poäng för 0,6B | Jämförelsepunkt |
|---|---|---|---|
| 72 specialiserade uppgifter (nDCG@10) | 81,3 % | 78,0 % | 9B ligger 1,6 poäng före nästa modell |
| Q2D-Web, webbsökning (Recall@1000) | 74,8 % | 73,6 % | nemotron-embed-8b: 69,3 % |
| ViDoRe v3 för bilder (nDCG@10) | 65,2 % | 62,3 % | Endast EVIE ligger före 9B |
| BrowseComp+ (GPT-OSS-120B-agent) | 64,0 % | — | Näst bästa ColBERT: 4,9 poäng lägre |
| MADQA (Gemini 3.5 Flash-agent) | 92,4 % | 90,1 % | Mixedbread Agentic Search: 93,4 % |
9B vinner inte överallt, och Perplexity skriver det själva: Tencents EVIE slår den på bildbaserade ViDoRe v3, gemini-embedding-2 på MIRACL-Vision och på det interna benchmarktestet PPLX-Q2I, och Mixedbread Agentic Search får ett högre resultat på MADQA – en skillnad som Perplexity bedömer ligger inom konfidensintervallet. Utvecklaren medger också att lagring och poängsättningskostnad ökar med dokumentens längd. En teknisk rapport aviseras ”senare i år”, och Perplexity planerar att gradvis öppna sina embeddings med sen interaktion, täta embeddings och kontextuella embeddings på sin API-plattform, utan angivet datum.
🔗 Inlägg från Perplexity Research · pplx-embed-v2-late-9b på Hugging Face
Kodagenter: Claude Code 2.1.293, Codex CLI 0.161.0, Cursor på iOS, Antigravity 2.21.0 och Warp Factories
Fem verktyg för kodagenter utvecklas: Claude Code anammar Haiku 5.5, Codex CLI ansluter till MCP-servrar från terminalen, Cursor styrs från en iPhone, Antigravity grupperar sin agents åtgärder och Warp öppnar upp för Microsoft-verktyg.
Claude Code 2.1.293 växlar till Haiku 5.5 som standard
7 oktober — Version 2.1.293 av Claude Code, som släpptes bara några minuter efter tillkännagivandet av Haiku 5.5, gör den till standardmodellen för Haiku på Anthropic-API:et. Den lägger till ett agentType-fält i nyttolasten för subagentStatusLine för att särskilja anpassade underagenter, samt flaggan isDeferred som exponerar schemat för verktyg deklarerade av moddar redan från start. Det huvudsakliga innehållet består av 38 buggfixar av 56 ändringar: Claude kunde efter en komprimering förlägga sina senaste åtgärder före komprimeringen och därefter ta bort eller göra om redan slutfört arbete; sökvägsbegränsade regler och kapslade CLAUDE.md läses nu även in när Claude läser en fil med cat eller grep i Bash; en minnesläcka i MCP HTTP-anslutningar har åtgärdats. Två nyligen genomförda ändringar backas (avvisningsmeddelandet för autoläge från 2.1.281 och en fix för molnsessioner från 2.1.290), och gränsen för kanalregler i Claude Tag höjs från 20 till 50.
🔗 Claude Code 2.1.293 på GitHub
Codex CLI 0.161.0 lägger Daybreak bakom ett tillval
7 oktober — Codex CLI 0.161.0 är den första stabila versionen sedan 0.160.1 den 5 oktober. Kommandot /mcp login <name> gör det möjligt att ansluta till en MCP-server utan att lämna den pågående terminalsessionen, och röstsamtal får stöd för val av mikrofon, högtalare och ingångskanaler. Daybreak, OpenAIs cyberserie, hamnar bakom ett tillval: växeln /daybreak och Daybreak-statusen i statusraden förblir dolda tills användaren aktiverar den med --enable cli_daybreak (eller features.cli_daybreak=true), och utan den hoppas den automatiska Cyber-routningen över. För en enstaka omgång väljer codex exec --cyber-access-program ett Cyber-åtkomstprogram. På Amazon Bedrock-sidan kommer multiagent V2 och resonemangsinsatsen Ultra till kompatibla modeller, och Bedrock Mantle stöder AWS GovCloud-regioner. Buggfixarna rör behörigheter, återupptagande av trådar och detektering av skadade SQLite-databaser.
Cursor styr datorns agenter från iOS
6 oktober — Cursors iOS-app visar nu agenterna som körs lokalt på datorn: man kan se vad varje agent gör och svara den, och i tillkännagivandets tweet nämns även möjligheten att starta nya uppgifter. Agenterna lämnar inte datorn, appen ansluter till den: datorn måste därför vara påslagen och uppkopplad, och inställningen Keep this computer awake förhindrar viloläge så länge datorn är ansluten till ström och skärmen är öppen. Funktionen är aktiverad som standard, förutom i Enterprise-organisationer där en administratör måste aktivera den; parkopplingen godkänns i skrivbordsappen, och molnagenter krävs inte. iOS-appen som släpptes i slutet av juni lyfte fram molnagenter: nu blir det de lokala agenterna som blir tillgängliga från telefonen.
Antigravity 2.21.0 grupperar sin agents åtgärder
6 oktober — Googles Antigravity-app uppdateras till version 2.21.0, med 9 förbättringar och 14 buggfixar. Den avancerade sökningen hittar en konversation utifrån dess innehåll med ⌘+K (Ctrl+K i Windows). Fliken för schemalagda uppgifter (Scheduled Tasks) blir Automations: där kan man köra en automatisering direkt med Run Now, eller be agenten vägleda skapandet av en ny med Create with Prompt. Filändringar, terminalkommandon och filläsningar som agenten utför mellan två svar grupperas nu i en enda hopfällbar rad tillsammans med en kort sammanfattning. Bland buggfixarna fanns ett problem där en trunkerad MP4- eller MOV-video som lästes av agenten kunde få hela den efterföljande konversationen att krascha, och en inställningsfil som sparats med Anteckningar i Windows eller PowerShell slutade fungera. Ändringsloggen varnar för att det kan ta några dagar innan en version når alla användare.
Warp Factories öppnar upp för Microsoft Teams och Azure DevOps
7 oktober — Warp öppnar Warp Factories, sin plattform för programvarufabriker (software factories), för Microsoft Teams och Azure DevOps Services. I Teams tilldelas fabriken uppgiften tillsammans med konversationens kontext om man omnämner Warp-appen i en konfigurerad kanal eller tråd; den rapporterar om sina framsteg i samma tråd och skickar dit sina pull requests för granskning. I Azure DevOps kan fabriken omnämnas från ett arbetsobjekt (work item) eller en pull request, eller så utlöser händelser körningar; varje fabrik får en egen identitet för Git-operationer, med begränsad åtkomst till de valda kodförråden. Båda integrationerna är tillgängliga för alla Warp Factories-kunder. Warp framställer detta dubbla inbyggda stöd som en branschförstling; Devin hade redan stöd för Teams och Azure DevOps Server.
API:er och plattformar: toolsets för computer use och browser use i Claudes SDK:er, Grok 4.7 på Microsoft Foundry
Två nyheter för utvecklare som bygger på hostade modeller: Anthropic förenklar styrningen av en dator eller webbläsare, och Grok 4.7 når allmän tillgänglighet hos Microsoft.
Toolsets för computer use och browser use i Claudes SDK:er
7 oktober — Claudes Python- och TypeScript-SDK:er integrerar nu, i beta, verktygsuppsättningarna (toolsets) computer use och browser use. Tidigare angav API:et vad Claude ville klicka på eller skriva, och utvecklaren fick bygga en egen loop för att översätta varje åtgärd till ett kommando. Nu hanterar SDK:et denna loop: utvecklaren subklassar BetaAbstractBrowserToolset20260801 eller BetaAbstractComputerToolset20260801, skriver en metod per åtgärd, och SDK:et dirigerar anropen, tillämpar de angivna URL- och filpolicyerna, begär godkännanden och bygger resultaten som skickas tillbaka till modellen. Anthropic tillhandahåller varken webbläsare eller färdiga drivrutiner: man kopplar in sin egen automatisering eller en drivrutin från Browser Use, Browserbase, E2B eller Daytona, och ett minimalt exempel med Chrome DevTools Protocol finns publicerat i claude-quickstarts-arkivet. Körning av JavaScript och filuppladdning är inaktiverade som standard, och utan någon URL-policy kontrolleras inga adresser.
🔗 Tråd från @ClaudeDevs på X · Dokumentation för SDK-toolsets
Grok 4.7 i allmän tillgänglighet på Microsoft Foundry
7 oktober — Grok 4.7, SpaceXAI:s modell som släpptes den 21 september, är tillgänglig på Microsoft Foundry, meddelade @SpaceXAI under natten. Microsofts dokumentation klassar den som allmänt tillgänglig, bland modellerna som säljs direkt via Azure: text och bild som indata, ett kontextfönster på 500 000 tokens (kombinerad in- och utdata), verktygsanrop, åtkomst via Chat Completions eller Responses API, samt resonemangsnivå från low till xhigh, med high som standard. Microsoft åtar sig att erbjuda Grok-modeller i allmän tillgänglighet, från och med Grok 4.7, i minst sex månader; Grok 4.6 finns fortfarande kvar där i förhandsversion. Azures prissida listade ännu inte Grok 4.7 under kvällen den 7 oktober. Efter Amazon Bedrock (28 september) och Google Cloud i förhandsversion (1 oktober) erbjuds därmed Grok 4.7 hos de tre stora molnleverantörerna.
🔗 Driftsätt och använd Grok-modeller i Microsoft Foundry
Öppna modeller: Liquid AI:s Open d1, Ai2:s Bolmo i Nature med Bwen 8B och Blama 8B
Två lanseringar med öppna vikter, den ena för snabba beslut i nätverkskanten (edge), den andra för att läsa text byte för byte.
Open d1, Liquid AI:s öppna beslutsmodeller
7 oktober — Liquid AI öppnar upp sin familj av beslutsmodeller med Open d1: två modeller med öppna vikter, d1-3B (text och bild) och d1-omni-600M (text med bild eller ljud), den senare i en tidig forskningsversion. De genererar inte text: i en enda körning tilldelar de en sannolikhet till varje tillåtet svar. Enligt Liquid AI uppnår d1-3B 48,57 i Decision Index 0.2.1, det bästa resultatet under 10 miljarder parametrar, före Decider 35B-A3B (47,11), och ett genomsnitt på 82,9 över sju publika dataset. Uppmätt tillsammans med NVIDIA sträcker sig dess latens för en fråga från 8 ms på en RTX 4090 till 50 ms på en Jetson Orin Nano, vilket gör den väl lämpad för nätverkskanten (edge). Inga benchmarktester för bild eller ljud har publicerats. Vikterna finns på Hugging Face under Liquid AI:s egen licens (lfm1.0), tillsammans med GGUF-versioner; d1 från den 29 september var endast tillgänglig via API.
🔗 Inlägg från Liquid AI på Hugging Face
Ai2:s Bolmo i Nature, med Bwen 8B och Blama 8B
7 oktober — Ai2 publicerar i Nature, online den 7 oktober, metoden bakom Bolmo, sin familj av helt öppna modeller som läser byte direkt i stället för delord. Att läsa byte undviker en fast vokabulärs blinda fläckar (stavning, ovanliga strängar, vissa skriftsystem), men krävde hittills fullständig träning från grunden. Byte-konvertering (byteifying) utgår däremot från en redan välpresterande delordsmodell och transformerar den genom en kort vidareträning. Bolmo 1B och 7B, baserade på Olmo, härstammar från december; Ai2 presenterar även Bwen 8B (baserad på Qwen 3 8B, Apache-2.0-licens) och Blama 8B (baserad på Llama 3 8B, llama3-licens), vars kodförråd har funnits sedan den 26 augusti, samt ”Stage 1”-kontrollpunkter där endast det nya bytelagret tränas. Enligt Ai2 närmar sig båda modellerna sina ursprungsmodeller och Bwen 8B överträffar Bolmo 7B, utan att några siffror har publicerats.
SynthID Detector öppet för alla för att verifiera bilder, videor och ljud
7 oktober — Google gör SynthID Detector tillgängligt för alla, verktyget som identifierar osynliga SynthID-vattenstämplar i AI-genererat innehåll. Efter att ha presenterats förra året i en förhandsversion för mediebranschen är det nu tillgängligt på synthid.com, över hela världen och på engelska. Man laddar upp en bild, en video eller en ljudfil. Verifieringen omfattar innehåll från Google och dess partner OpenAI, NVIDIA och Kakao, samt snart Apple. Portalen varnar för att det inte rör sig om en generell AI-detektor: innehåll från en modell utan SynthID, eller som har manipulerats kraftigt, kan markeras som ”ej upptäckt”. Google uppger att över 180 miljarder bilder och videor samt 240 000 år av ljud har vattenmärkts sedan 2023, jämfört med de 100 miljarder och 60 000 år som meddelades i juli, samt fler än en miljon verifieringar om dagen i Search, Gemini-appen och Chrome.
🔗 Google utökar SynthID Detector för AI-innehåll
Säkerhet: GitHubs klassificerare för läckta hemligheter
7 oktober — GitHub driftsätter en finjusterad ModernBERT-klassificerare dedikerad till läckta hemligheter, utvecklad tillsammans med Microsoft Applied Sciences: den läser koden runt ett värde för att upptäcka sannolika inloggningsuppgifter, inklusive lösenord utan igenkännbart format. Den utvärderar en batch av kandidater på under 2 ms och kan, enligt GitHub, ”mer än fördubbla” antalet hemligheter som blockeras vid push. Från och med nu övergår varningar för AI-identifierade lösenord till denna modell, utan extra kostnad. AI-baserat push-skydd, i privat förhandsversion, väntas ”senare denna månad” för berättigade organisationer, och kontroller via Copilots kommando /security-review kommer ”snart” i privat förhandsversion – båda mot AI-krediter. Erin Havens, produktchef för säkerhet på GitHub, påpekar i en essä att en av tre pull requests involverar en AI-agent och att push-skyddet endast stoppar cirka 30 % av de nya hemligheter som upptäcks.
🔗 Skyddet av hemligheter måste skala med programvaran
Infrastruktur: GitHub bygger om Git för agentaktivitet
6 oktober — GitHub bygger om sin Git-infrastruktur för att hålla jämna steg med agentbaserad utveckling. Enligt ett tekniskt blogginlägg av Brian Celenza ökade den totala Git-aktiviteten från 218,2 till 473,3 miljarder händelser per månad mellan september 2025 och augusti 2026; utvecklare och agenter genererade 7,38 miljarder commits i september 2026, mer än fem gånger fler än ett år tidigare, och antalet pushes ökade 4,9 gånger. Den nuvarande arkitekturen, Spokes, replikerar varje arkiv över flera servrar och validerar varje uppdatering genom majoritetsomröstning: att lägga till kopior för läsningar saktar därför ner skrivningar. Den nya arkitekturen separerar lagring och beräkning, med referensdata i Azure Blob Storage och lätta processer (workers) som betjänar läsningar från en cache. I sina interna prestandatester uppmäter GitHub upp till 35 gånger högre skrivgenomströmning, utan något datum för övergången.
🔗 Building Git infrastructure for agent-scale development
Röst-AI: ElevenLabs undertecknar en avsiktsförklaring med en indisk delstat
7 oktober — I samband med sitt toppmöte i Bengaluru undertecknade ElevenLabs sin första avsiktsförklaring (MOU) med regeringen i en indisk delstat för ett pilotprojekt inom röst-AI. Företaget namnger inte delstaten och ger varken tidsplan, omfattning eller belopp: tillkännagivandet ryms i en tweet, utan något blogginlägg. Den medföljande siffran belyser omfattningen: under det gångna året har ElevenAgents genomfört över 100 miljoner konversationer i Indien, varav mer än 70 % på hindi, kannada, tamil och telugu. Toppmötet samlade fler än 500 företagsledare, utvecklare och partner.
🔗 Tillkännagivande från @ElevenLabs på X
Forskning: PivotOPD, NVIDIAs metod för att återhämta sig från en agents avgörande fel
7 oktober — Forskare från NVIDIA presenterar PivotOPD, en träningsmetod för agenter som utför flera åtgärdsomgångar i följd. Deras slutsats: på ALFWorld innehåller 59 % av misslyckandena för tre Qwen3-modeller ett ”pivotfel” som begås tidigt, varefter agenten fortsätter i fel riktning. PivotOPD bygger vidare på on-policy-destillering (on-policy distillation): vid varje pivotfel anger en lärarmodell rätt åtgärd och sedan en korrigerande åtgärd för de efterföljande omgångarna, så att studentmodellen lär sig att både undvika felet och återhämta sig från det. Jämfört med 13 referensmetoder uppnår den det bästa genomsnittet på ALFWorld, WebShop och Search-based QA med Qwen3-studenter på 1.7B och 8B, och återhämtar 72,7 % av de 72 återuppspelade pivotfelen, jämfört med 20,3 % för standarddestillering. Vinsten överförs även till kod: en Nemotron-3.5-student ökar från 62,8 % till 66,0 % på SWE-Bench Verified. Artikeln finns på arXiv; koden utlovas inom kort.
Optimering: mPDLP fördelar gigantiska linjära program över flera GPU:er i cuOpt
7 oktober — NVIDIA lägger till mPDLP i cuOpt, sitt open source-optimeringsbibliotek: en lösare för linjär programmering fördelad över flera GPU:er anslutna via NVLink, avsedd för storskaliga planeringsproblem (försörjningskedjor, elnät). Genom att gruppera sammanhängande variabler och bivillkor på samma GPU begränsas datautbytet och toppminnet per GPU minskas med upp till 6 gånger. På en DGX B200-nod når accelerationen 11,4 gånger för PDLP-beräkningen och 4,2 gånger från ände till ände; jämfört med D-PDLP är mPDLP 1,2 till 2,5 gånger snabbare på de flesta stora problem, men långsammare på de tre största instanserna och på små problem. Kinaxis löser en försörjningskedja med över 135 miljoner variabler 3,3 gånger snabbare på åtta H100, och PSR löser en energimodell med 185 miljoner variabler mer än 5 gånger snabbare på åtta B200.
Robotik: Robotar monterar testbrickor för GB300
7 oktober — NVIDIAs Seattle Robotics Lab beskriver hur de lär robotar att montera testbrickor för GB300, vilka verifierar modulerna före leverans. Två arbetsmoment valdes ut tillsammans med Foxconn, som tillverkar dessa system: att placera och skruva fast en samlingsskena vid 16 punkter, samt att ansluta fyra kontakter monterade på flexibla kablar. Kravet som sattes upp tillsammans med Foxconn är 99,5 % framgångsgrad, på högst dubbelt så lång tid som en kvalificerad operatör, utan kollisioner. Robotarna närmar sig målet utan att nå det helt: över 95 % framgångsgrad på 160 sekunder för skenan (jämfört med målet på 124 sekunder), och 90 till 95 % för kontakterna, med 40 sekunder per kabel. Teamet kombinerar en klassisk perceptions- och styrkedja, poseskattning med DOPER och förstärkningsinlärning i Isaac Lab, finjusterat på den verkliga roboten. NVIDIA utlovar att publicera DOPER och dess orkestrerare TALOS, utan angivet datum.
🔗 Inlägg på NVIDIAs tekniska blogg om GB300-testbrickor
Notiser
- ChatGPT:s iOS-app 1.2026.272 — Den visar förhandsvisningar av sidor direkt i svaren, öppnar Codex-uppgiftslänkar i appen och gör, på Codex Mobile-sidan, om godkännandeväljaren samt snabbar upp flödet i långa trådar. 🔗 källa
- Radisson Hotel Group — Enligt en fallstudie från OpenAI konverterar deras ChatGPT-plugin, byggt på sex veckor tillsammans med Accenture Song, ungefär 1,5 gånger bättre än deras organiska sökning under juli–augusti 2026, och 54 % av betalnings- och bokningshändelserna från deras annonskampanj i ChatGPT tillskrivs enkla annonsvisningar. 🔗 källa
- Jump Trading — Det kvantitativa handelsföretaget överlåter analyser till GPT-6 Astra-agenter som kan köras i flera dagar genom att korskörda ett stort antal datakällor, med mänsklig granskning i slutet av kedjan; OpenAIs fallstudie publicerar inga siffror över prestandavinster. 🔗 källa
- ChatGPT-plugintillägg — I tråden till sin videohandledning nämner OpenAI Developers Adobe, Canva, Figma, Shopify, Instacart och Atlassian bland de företag som använder dem, utöver tldraw och MagicPath; de presenterades den 29 september och startar ett plugin från sidofältet, hanterar @-omnämnanden och lägger till filvisare. 🔗 källa
- Every och Claude Managed Agents — Teamet på Every har byggt en företagsagent ovanpå Claude Managed Agents som alla använder i Slack för att dela sina färdigheter (skills) med varje ny modell, och öppnade den sedan för sina prenumeranter; Anthropic vidarebefordrar en videointervju, utan några siffror. 🔗 källa
- Zed 1.23 och förhandsversion 1.24.1 — Version 1.23 blir stabil med förhandsgranskning av JSONL- och NDJSON-filer, och förhandsversion 1.24.1 gör det möjligt att dra en terminalflik till Agent Panel, stöder anpassade Amazon Bedrock-modeller med verktyg, bilder och reflektion, skapar Git-taggar och minskar Linux-binären med cirka 23 %. 🔗 källa
- Puck, Amps meta-agent — Den stöder nu flera separata konversationer: +-knappen öppnar en ny, ett klick på dess namn gör det möjligt att växla mellan dem, och konversationer som varit inaktiva i tre dagar läggs undan separat. 🔗 källa
- Copilot CLI 1.0.93 — Har blivit stabil; den tillämpar konfigurationsändringar för MCP-servrar mellan omgångar utan att sessionen behöver startas om, och öppnar kommandosandlådan för alla via /sandbox och —sandbox; Copilot SDK 1.0.17 blir också stabil. 🔗 källa
- Användningsmått för Copilot — De underrapporterade agentaktiviteten sedan flera IDE:er började dirigera sina sessioner genom Copilot SDK; korrigeringen kräver en uppdatering (VS Code 1.139.0 nu direkt, Visual Studio 18.12 i oktober, JetBrains i slutet av oktober, Eclipse och Xcode senast i november), och förlorade data kommer inte att återställas. 🔗 källa
- Gemini CLI v0.65.0-nightly.20261007 — Denna nightly-version inleder 0.65.0-serien med fem buggfixar, varav två mot dataförlust: projektinställningar blir skrivskyddade i en opålitlig mapp, där
gemini mcp addkunde tömma.gemini/settings.json, och att omedelbart avsluta en återupptagen session raderar inte längre dess historik. 🔗 källa - Transformers.js 4.3.1 — Dagen efter lanseringen av EmbeddingGemma 2 beräknar biblioteket dess multimodala inbäddningar (740 miljoner parametrar, 768 dimensioner) direkt i webbläsaren, i WebGPU eller WASM, eller under Node.js. 🔗 källa
- RL Environment Explorer — Adithya S K från Hugging Face presenterar detta FineEnvs-Space för att bläddra i, visualisera och köra förstärkningsinlärningsmiljöer från Hubben (OpenEnv, Harbor, MiMo, Verifiers, NeMo Gym): över 12 miljoner uppgiftsposter, främst från ett fåtal stora OpenEnv-miljöer. 🔗 källa
- Seb-9B — Stas Veretennikov publicerar denna lokala beslutsmodell under Apache-2.0-licens (text, JSON eller bild, upp till 20 alternativ), som uppnår 0,792 i genomsnitt över 17 offentliga testsviter jämfört med 0,786 för Jev 1.13; författaren har genomfört alla mätningar och specificerar att träningsdata inkluderade träningsdelen av en av testsviterna, utan dess testfall. 🔗 källa
- Nemotron i olympiaderna 2026 — NVIDIA detaljerar det gemensamma receptet (övervakad finjustering, förstärkningsinlärning, en loop som genererar, verifierar och korrigerar) bakom 535,4 av 600 vid IOI 2026 vid inofficiellt deltagande, och 30 av 42 vid IMO 2026, med en guldgräns på 29, och publicerar benchmarksviten Nemotron-IMO-Bench med 200 problem. 🔗 källa
- Instadocs: AI Gone Wild — Netflix tillkännager denna dokumentär till den 12 oktober, som rekonstruerar cyberattacken mot Hugging Face i juli, vilken enligt Netflix genomfördes av autonoma agenter skapade av OpenAI-forskare. 🔗 källa
- Runway i ChatGPT:s appkatalog — När insticksprogrammet har installerats och Runway-kontot har anslutits kan ett @Runway-omnämnande i en konversation ge det i uppdrag att generera bilder eller videor; Runway anger varken pris eller kostnad i krediter. 🔗 källa
- Face Swap från Luma — Funktionen byter ut en karaktärs ansikte i en befintlig tagning för att iterera utan att behöva börja om från början; tillkännagivandet ryms i två tweets, utan produktsida, prissättning eller detaljer om modellen. 🔗 källa
- DSX Air — NVIDIA visar hur man testar förändringar i en AI-fabrik på denna digitala tvilling: agenter tillämpar ändringen, verifierar konfiguration, säkerhet och isolering, och lämnar sedan en rapport, medan driftsättning i produktion fortfarande kräver mänsklig validering; ett metodinlägg, utan siffror. 🔗 källa
- cuPhoton — En handledning från NVIDIA tillämpar denna open source-verktygslåda på astronomisk bildanalys på GPU, från inläsning av FITS-filer till granskning av kandidater; de utlovade prestandavinsterna, upp till 14 900 gånger, gäller vissa operationer och inte hela bearbetningen från början till slut. 🔗 källa
- Cosmos och SynthID — Innehåll som genereras av NVIDIA Cosmos-modeller på build.nvidia.com bär vattenstämpeln SynthID och kan nu verifieras av vem som helst med detektorn som gjorts tillgänglig av Google. 🔗 källa
- SpaceXAI:s TypeScript-SDK 0.2.3 — Lägger till en servicenivå
fast, utbytbar medpriority, och identifierarengrok-imagine-video-1.5-lite, en lättare videomodell som saknas i versionsnoteringarna: enligt uppgifter på modellsidan accepterar den inte ljud som indata och kostar fyra gånger mindre per sekund ängrok-imagine-video-1.5i 480p. 🔗 källa - Guide: RAG vs. LLM — Perplexity publicerar en pedagogisk guide som presenterar RAG och LLM som komplementära, skiljer mellan tre typer av RAG (naiv, modulär, avancerad) och förtydligar när enbart en LLM räcker; inga nya funktioner eller siffror. 🔗 källa
Vad det innebär
De små modellerna blir massmarknadsprodukten. Från och med den 8 oktober är det GPT-6 Luna som svarar gratissanvändare i ChatGPT, och Anthropic prissätter Haiku 5.5 till 0,10 dollar per miljon indatatokens under 100 000 prompttokens, samtidigt som priset för cacheläsningar för Sonnet 5.5 halveras. Dessa modeller hanterar den största delen av volymen: vardagliga konversationer, underagenter, sammanfattningar, komprimeringar. Cursors rankning påminner dock om att priset per token inte säger allt: vid Max-ansträngning förbrukar Haiku 5.5 nästan nio gånger fler tokens per uppgift än Sonnet 5.5 vid High-ansträngning, för en kostnad per uppgift som knappt är lägre (1,12 dollar mot 1,20). Den månatliga API-krediten för Max- och Team-abonnemangen uppmuntrar å sin sida prenumeranterna att prova dessa modeller i sin egen kod.
AI:n flyttar också tillbaka till arbetsstationen. Bärbara RTX Spark-datorer anländer den 16 oktober, DGX Station for Windows utlovar upp till 20 petaflops på skrivbordet, och Copilot väntas själv överlåta vissa uppgifter till MAI Code 1.1 Flash lokalt före månadens slut. Replit bygger nu applikationer på användarens maskin. Agenter som kör kod på en personlig dator väcker säkerhetsfrågor, och samma byggsten återkommer överallt: Microsoft Execution Containers (MXC), som är allmänt tillgängligt under Windows, isolerar såväl Copilot-kommandon som Replit-byggen. GitHub rullar å sin sida ut en klassificerare avsedd för läckta hemligheter och bygger om sin Git-infrastruktur, eftersom var tredje pull request redan involverar en agent och antalet commits har mer än femfaldigats på ett år.
Svaret blir också ett gränssnitt. Med Intelligent UI svarar ChatGPT med grafer, formulär eller ett litet verktyg byggt på begäran, och börjar svara innan det har tänkt klart. På utvecklarsidan stöder Claudes SDK:er loopen för computer use och browser use, och Cursor gör det möjligt att från en iPhone följa agenterna som arbetar på datorn och svara dem. I samtliga tre fall är texten bara en del av interaktionen: AI:n visar, klickar och rapporterar, medan användaren övervakar.
Slutligen mäts många av dagens siffror av dem som själva publicerar dem: prestandatesterna för Haiku 5.5 av Anthropic, för MAI Code 1.1 Flash av Microsoft, Q2D-Web av Perplexity som utvecklade det, resultaten för Open d1 av Liquid AI, och den 35-faldiga ökningen av skrivgenomströmning genom GitHubs interna tester. OpenAI varnar själva för att icke-formaliserade resultat från dess 722 manuskript kan innehålla fel, och dess hastighetsvinster för GPT-6 kommer från interna utvärderingar. Dessa mätningar är ändå användbara för att placera produkterna i förhållande till varandra; externa utvärderingar, såsom rankningen CursorBench där en verktygsutvecklare mäter en annans modell, kommer att göra det möjligt att dubbelkolla dem.
Källor
- GPT-6 and Intelligent UI for everyone (OpenAI)
- Tillkännagivande av GPT-6 för alla (@OpenAI)
- Systemkort för GPT-6 Sol och GPT-6 Luna, oktoberuppdatering
- GPT-6 and other models in ChatGPT
- Versionsanteckningar för ChatGPT
- Uploading files and audio to ChatGPT
- Helping teens learn, plan, and shape the future of AI (OpenAI)
- Tillkännagivande av Claude Haiku 5.5 (Anthropic)
- Lansering av Claude Haiku 5.5 (@claudeai)
- Migreringsguide till Haiku 5.5
- Haiku 5.5 i Cursor (@cursor_ai)
- CursorBench-topplista
- Månatliga API-krediter för Max- och Team-abonnemang (Claude-support)
- Tillkännagivande av API-kredit (@ClaudeDevs)
- RTX Spark och DGX Station for Windows (NVIDIA-bloggen)
- Bringing local models and sandboxed tools to Windows and GitHub Copilot (Microsoft Command Line)
- Discover local models in GitHub Copilot CLI
- Local sandboxing for GitHub Copilot now generally available
- Förhandsversion av skrivbordsappen Replit (@Replit)
- Väntelista för skrivbordsappen Replit
- Dela AI-framsteg inom matematik (OpenAI)
- openai/math-arkiv
- Tillkännagivande av matematiska resultat (@OpenAI)
- Multimodal embeddings beyond a single vector (Perplexity Research)
- pplx-embed-v2-late-9b på Hugging Face
- Claude Code 2.1.293
- Codex CLI 0.161.0
- Remote control for local agents (ändringslogg för Cursor)
- Ändringslogg för Antigravity
- Warp Factories, Microsoft Teams och Azure DevOps (Warps blogg)
- Toolsets för computer use och browser use i SDK:er (@ClaudeDevs)
- Dokumentation för toolsets i Claude SDK
- Deploy and use Grok models in Microsoft Foundry
- Open d1 (Liquid AI på Hugging Face)
- Bolmo i Nature (Ai2)
- Google expands SynthID Detector for AI content
- Secret protection must scale with software (GitHub)
- Building Git infrastructure for agent-scale development (GitHub)
- Avsiktsförklaring med en indisk delstat (@ElevenLabs)
- PivotOPD (NVIDIA Research)
- mPDLP i cuOpt (NVIDIA:s tekniska blogg)
- The machines that make the machines (NVIDIA:s tekniska blogg)
- Ändringslogg för ChatGPT och Codex, ChatGPT för iOS 1.2026.272
- Radisson Hotel Group brings hotel discovery into ChatGPT (OpenAI)
- How Jump Trading is scaling quant research with ChatGPT (OpenAI)
- Plugin-tillägg för ChatGPT (@OpenAIDevs)
- Every och Claude Managed Agents (@claudeai)
- Zed v1.24.1-pre
- Many, Many Pucks (Amp)
- Copilot CLI 1.0.93
- Update your IDE to restore agent activity in Copilot usage metrics
- Gemini CLI v0.65.0-nightly.20261007
- Transformers.js 4.3.1
- RL Environment Explorer (@adithya_s_k)
- Seb-9B head to head (Hugging Face-bloggen)
- Nemotron vid IOI och IMO 2026 (Hugging Face-bloggen)
- Instadocs: AI Gone Wild (@netflix)
- Runway i ChatGPT (@runwayml)
- Face Swap (@LumaLabsAI)
- Validate AI factory changes with digital twins and AI agents (NVIDIA:s tekniska blogg)
- Faster scientific image analysis with NVIDIA cuPhoton
- Cosmos och SynthID (@NVIDIAAI)
- TypeScript-SDK för SpaceXAI 0.2.3
- RAG vs. LLM (Perplexity)