ai-powered-markdown-translatorArticol tradus din fr în ro cu gpt-6.1-sol.
GPT-6 și Intelligent UI devin disponibile pentru toți utilizatorii ChatGPT: GPT-6 Sol pentru abonamentele plătite din 7 octombrie, GPT-6 Luna pentru Free și Go din 8 octombrie. Anthropic își completează familia 5.5 cu Claude Haiku 5.5, de la 0,10 dolari pe milion de tokens de intrare, în timp ce evenimentul Windows al Microsoft deschide precomenzile pentru PC-urile RTX Spark și anunță că GitHub Copilot va putea în curând să încredințeze sarcinile sale unui model local. OpenAI publică și 722 de manuscrise cu rezultate matematice produse de un model intern.
ChatGPT trece la GPT-6 și Intelligent UI pentru toți, citește fișiere audio și pregătește College Planner
7 octombrie — OpenAI extinde GPT-6 la toți utilizatorii ChatGPT. Nu este vorba despre un nou model de bază: GPT-6 Sol și GPT-6 Luna erau deja oferite clienților plătitori din septembrie (prezentate aici pe 22 septembrie). De această dată, versiunile din octombrie ale celor două modele, ajustate pentru conversațiile de zi cu zi, ajung în fila Chat: GPT-6 Sol pentru Plus, Pro, Business și Enterprise din 7 octombrie, GPT-6 Luna pentru Free și Go din 8 octombrie. Ele înlocuiesc GPT-5.6 Sol și GPT-5.6 Luna în ChatGPT, în timp ce Codex și ChatGPT Work rămân pe versiunile din septembrie. OpenAI spune că se adresează astfel celor peste 1,2 miliarde de persoane care folosesc ChatGPT în fiecare săptămână.
Cea mai vizibilă noutate se numește Intelligent UI. GPT-6 își compune răspunsurile folosind text, elemente vizuale și elemente interactive (grafice, butoane, formulare, diagrame interactive, hărți) și poate crea la cerere un mic instrument, precum un calculator de economii, un instrument pentru împărțirea notei de plată sau un joc; când un text simplu este suficient, ChatGPT se limitează la acesta. Pentru aceasta, OpenAI se bazează pe o bibliotecă de componente native și pe un compilator care afișează interfața pe măsură ce este generată. Intelligent UI funcționează de la nivelul de efort Instant până la Extra High, fără o cotă separată, dar nici cu nivelul de efort Pro, încredințat GPT-6 Pro (bazat pe GPT-6 Astra), nici în vechile aplicații desktop pentru macOS și Windows.
A doua schimbare: ChatGPT poate începe să răspundă în timp ce raționează sau folosește instrumente, apoi își poate completa răspunsul fără un nou prompt. Potrivit evaluărilor interne ale OpenAI, GPT-6 Instant începe să răspundă în medie cu 44 % mai devreme decât GPT-5.6 Instant la întrebările care necesită o căutare pe web, iar GPT-6 Extra High începe în același interval de timp ca GPT-5.6 Medium, cu un scor global mai bun decât GPT-5.6 Extra High.
| Abonament sau setare a nivelului de efort | Model utilizat în ChatGPT | Calendar și precizări |
|---|---|---|
| Plus, Pro, Business și Enterprise | GPT-6 Sol (Instant, Medium, High, Extra High) | Lansare globală din 7 octombrie |
| Free și Go | GPT-6 Luna | Din 8 octombrie |
| Nivel de efort Pro (Pro 100 și 200 dollars, Business, Enterprise) | GPT-6 Pro, bazat pe GPT-6 Astra | Fără Intelligent UI |
| ChatGPT Work și Codex | Versiunile din septembrie ale GPT-6 Sol și GPT-6 Luna | Nicio schimbare |
În privința securității, fișa de sistem publicată în aceeași zi clasifică aceste versiuni la nivelul de capacitate « High » în securitate cibernetică, precum și în biologie și chimie, conform Preparedness Framework, fără a atinge acest prag în autoîmbunătățire; ele preiau măsurile de protecție ale GPT-5.6, cu o rezistență mai bună la tentativele de ocolire a restricțiilor (jailbreaks), inclusiv pe parcursul mai multor schimburi de mesaje. În API, instantaneul chat-latest indică acum acest nou model din ChatGPT, OpenAI recomandând familia GPT-6 pentru utilizarea în producție.
GPT-6 and Intelligent UI, now rolling out in ChatGPT for everyone. Intelligent UI in ChatGPT delivers fast, interactive answers that make everyday questions more visual, complex topics easier to grasp, and interactive tools for your task available on the spot.
🇷🇴 GPT-6 și Intelligent UI sunt acum lansate în ChatGPT pentru toată lumea. În ChatGPT, Intelligent UI oferă răspunsuri rapide și interactive care fac întrebările de zi cu zi mai vizuale, subiectele complexe mai ușor de înțeles și pun imediat la dispoziție instrumente interactive adaptate sarcinii voastre. — @OpenAI pe X
🔗 GPT-6 și Intelligent UI pentru toată lumea · Fișa de sistem, actualizarea din octombrie · GPT-6 și alte modele în ChatGPT
Fișierele audio în ChatGPT
6 octombrie — ChatGPT acceptă acum fișiere audio ca atașamente. Un utilizator poate atașa o înregistrare la o conversație pentru a obține o transcriere, un rezumat sau răspunsuri despre conținutul ei, ori pentru a transforma o ședință, un interviu sau un curs în notițe structurate, chiar și într-o ciornă de e-mail de follow-up. Funcția este rezervată abonamentelor și spațiilor de lucru plătite, inclusiv Enterprise: abonamentul Free nu are acces « deocamdată ». Formatele acceptate sunt WAV, MP3, OGG, FLAC, AAC, M4A și PCM, precum și WebM și MP4 dacă acestea conțin doar audio, până la 512 Mo per fișier. OpenAI avertizează că transcrierile pot conține erori, că identificarea vorbitorilor rămâne puțin fiabilă și că performanțele variază în funcție de limbă.
🔗 Notele de versiune ChatGPT · Încărcarea fișierelor și a conținutului audio în ChatGPT
ChatGPT for Teens: primele cifre de utilizare și College Planner în pregătire
7 octombrie — OpenAI prezintă un prim bilanț al ChatGPT for Teens, experiența aplicată implicit conturilor identificate ca aparținând unor persoane sub 18 ani. Potrivit companiei, aproape 1,2 milioane de adolescenți au folosit Learning Visualizations într-o săptămână și peste 180 000 au folosit Study Mode; ei petrec în medie mai puțin de 15 minute pe zi în această experiență, iar mai puțin de 2 % depășesc trei ore consecutive. Noutatea anunțată, College Planner, va fi disponibilă « în curând », mai întâi în Statele Unite, pentru liceenii din clasele a 10-a până la a 12-a care vizează studii universitare de patru ani: un singur plan va reuni cerințele de înscriere, termenele, sarcinile și demersurile pentru obținerea ajutorului financiar, inclusiv bursele. OpenAI susține și College Advising Corps și, timp de trei ani, Digital Wellness Lab al Boston Children’s Hospital, fără a comunica vreo sumă.
🔗 Ajutăm adolescenții să învețe, să planifice și să modeleze viitorul AI
Claude Haiku 5.5, cu aproximativ 75 % mai ieftin decât Haiku 4.5, potrivit Anthropic
7 octombrie — La cincisprezece zile după Opus 5.5 și nouă zile după Sonnet 5.5, Anthropic completează familia Claude 5.5 cu Claude Haiku 5.5 (claude-haiku-5-5). Modelul vizează sarcinile cu volum mare și sensibile la costuri (rezumate, compactări ale contextului, interogări ale bazelor de date, clasificare), rolul de subagent al Opus 5.5 și Sonnet 5.5 pentru cod și utilizările în care viteza contează, precum asistența pentru clienți în timp real sau controlul unui browser: este cel mai rapid model al Anthropic la viteza standard, modelele Opus în Fast Mode rămânând mai rapide. Este și primul Haiku dotat cu o setare a nivelului de efort (medium implicit), cu un context de 1 milion de tokens și până la 128 000 de tokens de ieșire.
Tariful se bazează pe două praguri. Până la 100 000 de tokens de prompt, Haiku 5.5 costă 0,10 dolari pe milion de tokens de intrare și 0,50 dolari pentru cei de ieșire, adică cu 90 % mai puțin decât Haiku 4.5; peste acest prag, tarifele ajung la 0,50 și 2,50 dolari, cu 50 % mai puțin. Economia de « aproximativ 75 % » evidențiată este o medie calculată de Anthropic: 90 % dintre cererile trimise către Haiku 4.5 rămâneau sub prag, iar noul sistem de segmentare în tokens (tokenizer) numără cu aproximativ 30 % mai mulți tokens pentru același text.
| Tip de tarif (pe milion de tokens) | Haiku 5.5 până la 100 000 de tokens de prompt | Haiku 5.5 peste 100 000 de tokens | Haiku 4.5 |
|---|---|---|---|
| Tokens de intrare | 0,10 dollar | 0,50 dollar | 1 dollar |
| Tokens de ieșire | 0,50 dollar | 2,50 dollars | 5 dollars |
| Citiri din cache | 0,01 dollar | 0,05 dollar | 0,10 dollar |
| Scrieri în cache | 0,125 dollar | 0,625 dollar | 1,25 dollar |
În benchmark-urile publicate de Anthropic, diferența față de Haiku 4.5 este mare, iar Haiku 5.5 depășește GPT-6 Luna al OpenAI oriunde apar ambele. Rămâne însă în urma Sonnet 5.5, pe care Anthropic îl recomandă în continuare, alături de Opus 5.5, pentru codul agentic complex.
| Benchmark evaluat (cifre de la Anthropic) | Haiku 5.5 | Haiku 4.5 | GPT-6 Luna | Sonnet 5.5 |
|---|---|---|---|---|
| Terminal-Bench 4.0 (cod agentic) | 39,2 % | 0,0 % | 16,4 % | 70,6 % |
| OSWorld 2.1, subset offline | 72,4 % | 15,7 % | 48,9 % | 83,9 % |
| Humanity’s Last Exam, fără instrumente | 45,9 % | 10,2 % | — | 56,9 % |
| FrontierCode 1.1, Main | 46,4 % | — | 42,4 % | 52,1 % (efort Xhigh) |
| Chartography, fără instrumente | 46,4 % | 6,4 % | 29,1 % | 61,6 % |
Șase clienți au relatat despre testele efectuate înainte de lansare: HubSpot menționează 92,8 % pe suita sa CRM, cel mai bun scor de până acum, AlphaSense 0,84 față de 0,76 pentru Haiku 4.5 pe 400 de cereri, iar Box cu 11 puncte mai mult la o latență de aproximativ jumătate. Migrarea de la Haiku 4.5 necesită muncă: ghidul enumeră unsprezece schimbări, printre care eliminarea budget_tokens, a parametrilor temperature, top_p și top_k și a precompletării, iar comanda /claude-api migrate din Claude Code automatizează o parte dintre ele. În privința securității, Anthropic descrie măsuri de protecție cibernetică mai restrictive decât cele ale Haiku 4.5, dar puțin mai permisive decât cele ale celorlalte modele recente ale sale: mai multe sarcini defensive sunt permise decât cu Sonnet 5.5, iar testele de penetrare rămân blocate.
Lansarea este însoțită de o scădere a prețului: citirile din cache pentru Sonnet 5.5 scad de la 0,20 la 0,10 dolari pe milion de tokens din 7 octombrie, ceea ce face modelul cu aproximativ 20 % mai ieftin pentru majoritatea sarcinilor agentice, potrivit Anthropic. Haiku 5.5 este disponibil chiar acum prin API-ul Claude, Amazon Web Services, Google Cloud și Microsoft Azure, precum și în Claude Code.
Introducing Claude Haiku 5.5: the cheapest, fastest, and most capable small model we’ve ever released. On average, it costs around 75% less to run than Claude Haiku 4.5.
🇷🇴 Iată Claude Haiku 5.5: cel mai ieftin, cel mai rapid și cel mai performant model mic pe care l-am publicat vreodată. În medie, rularea sa costă cu aproximativ 75 % mai puțin decât cea a Claude Haiku 4.5. — @claudeai pe X
🔗 Anunțul Claude Haiku 5.5 · Ghid de migrare la Haiku 5.5
Haiku 5.5 în Cursor: 48,4 % pe CursorBench
7 octombrie — Cursor oferă Claude Haiku 5.5 chiar din ziua lansării, cu activare din setările sale pentru modele. Potrivit Cursor, acesta este de 10 ori mai ieftin decât Claude Haiku 4.5 pentru cererile scurte. Pe CursorBench, clasamentul pe care Cursor îl publică pe site-ul său, Haiku 5.5 cu nivelul de efort Max ocupă locul 10, cu o rată de reușită de 48,4 % la 1,12 dolari per sarcină, imediat înaintea Sonnet 5.5 cu nivelul de efort High, pentru care Cursor a recalculat costurile pe 7 octombrie ca să țină cont de noul tarif, și înaintea Opus 5 cu nivelul de efort Max. Totuși, lucrează mai mult: în medie, 325 934 de tokens și 163 de pași per sarcină, față de 37 391 de tokens și 41 de pași pentru Sonnet 5.5 cu nivelul de efort High.
| Configurație testată de Cursor | Loc în clasament | Scor CursorBench | Cost per sarcină |
|---|---|---|---|
| Opus 5.5, efort Max | 1 | 57,8 % | 13,43 dollars |
| Haiku 5.5, efort Max | 10 | 48,4 % | 1,12 dollar |
| Sonnet 5.5, efort High | 11 | 47,8 % | 1,20 dollar |
| Opus 5, efort Max | 13 | 46,6 % | 11,95 dollars |
| Haiku 5.5, efort Low | 54 | 30,9 % | 0,08 dollar |
🔗 Anunțul Cursor pe X · Clasamentul CursorBench
Un credit API lunar de 100 până la 500 de dolari pentru planurile Max și Team
7 octombrie — Anunțat în aceeași postare ca Haiku 5.5, un credit lunar utilizabil pe Claude Platform devine disponibil pentru abonații Max și Team, cu o lansare treptată pe parcursul câtorva zile. Acesta permite crearea propriilor instrumente, aplicații și agenți cu API-ul; potrivit @ClaudeDevs, funcționează cu toate modelele, inclusiv Haiku 5.5, atât în codul propriu, cât și în instrumente terțe.
| Plan vizat | Credit API lunar |
|---|---|
| Max 5x | 100 de dolari |
| Max 20x | 200 de dolari |
| Team, loc Standard | 20 de dolari per loc |
| Team, loc Premium | 100 de dolari per loc |
| Plafonul unei echipe Team | 500 de dolari, la comun |
| Free, Pro și Enterprise | Neeligibile |
În Team, creditele aferente locurilor se adună într-un fond comun: trei locuri Standard și două Premium oferă, de exemplu, 260 de dolari pe lună. Creditul acoperă toate modelele API-ului Claude, inclusiv API-ul Message Batches, precum și Playground din Console, Claude Managed Agents și Claude Agent SDK. Nu acoperă utilizarea interactivă a Claude Code (terminal, IDE, aplicație desktop sau web), nici utilizarea suplimentară dincolo de limitele planului, nici modelele Claude furnizate prin Amazon Bedrock, Google Cloud Vertex AI sau Microsoft Foundry și nu modifică limitele de utilizare ale Claude, Claude Code sau Cowork.
Pentru a-l solicita, este necesar un abonament activ de cel puțin șapte zile la un plan eligibil, apoi trebuie asociată o organizație din Claude Console prin setările de facturare de pe claude.ai, fără a adăuga o metodă de plată. Poate fi asociată o singură organizație, iar numai serviciul de asistență o poate schimba. Creditul se reînnoiește la fiecare ciclu de facturare, nu se reportează și este folosit înaintea creditelor cumpărate; odată epuizat, apelurile se opresc până la acordarea următorului credit, cu excepția cazului în care organizația a cumpărat credite sau a activat reîncărcarea automată, iar prin abonamentul Claude nu se facturează nimic. În mai, Anthropic anunțase un credit lunar pentru utilizarea programatică începând cu 15 iunie; pagina de ajutor precizează că noul credit nu corespunde acelor „credite Agent SDK”, despre care spune că nu sunt disponibile.
🔗 Pagina de ajutor: creditele API lunare ale planurilor Max și Team · Anunțul @ClaudeDevs
IA locală pe Windows: NVIDIA deschide precomenzile pentru PC-urile RTX Spark și prezintă în avanpremieră DGX Station for Windows
7 octombrie — NVIDIA și Microsoft profită de evenimentul Windows AI and Surface, organizat la San Francisco, cu o discuție între Jensen Huang și Satya Nadella, pentru a lansa comercial RTX Spark, cipul pentru PC-uri Windows anunțat la Build pe 2 iunie. Precomenzile pentru laptopuri sunt deschise din 7 octombrie, cu disponibilitate din 16 octombrie; mini-PC-urile vor urma în noiembrie. Acer, ASUS, Dell, HP, Lenovo, Microsoft, MSI și Gigabyte pregătesc dispozitive, iar Microsoft prezintă un Surface Laptop Ultra construit în jurul cipului. Postarea NVIDIA nu indică niciun preț.
RTX Spark combină un GPU Blackwell RTX și un CPU Grace conectate la 600 Go/s, pentru un petaflop de calcul IA în FP4 și până la 128 Go de memorie unificată. NVIDIA evidențiază rularea locală a modelelor mari, fără trimiterea datelor în cloud și fără contorizarea utilizării, cu același stack CUDA ca pe serverele sale. Cipul se adresează și creatorilor (NVFP4, codare hardware AV1 și 4:2:2) și jucătorilor, cu jocuri în 1440p la peste 100 de cadre pe secundă datorită DLSS 5.
Pentru companii, NVIDIA prezintă în avanpremieră DGX Station for Windows, anunțată și ea la Build în iunie, pe care o descrie drept primul supercomputer IA de birou din ecosistemul Windows: acesta poate rula local modele cu circa o mie de miliarde de parametri fără a părăsi Windows, instrumentele Linux rămânând accesibile prin WSL. Nu există nici dată, nici preț, doar posibilitatea de înscriere pentru a primi o notificare. La rândul său, Microsoft aduce la disponibilitate generală Microsoft Execution Containers (MXC), infrastructura care rulează agenții în fundal sub controlul Windows.
| Element comparat | RTX Spark | DGX Station for Windows |
|---|---|---|
| Cip | GPU Blackwell RTX (până la 6 144 de nuclee) și CPU Grace (până la 20 de nuclee) | Supercip GB300 Grace Blackwell Ultra Desktop |
| Memorie | Până la 128 Go, unificată | 748 Go, coerentă |
| Calcul IA în FP4 | 1 petaflop | Până la 20 de petaflopi |
| Disponibilitate anunțată | Laptopuri la precomandă, disponibile din 16 octombrie; mini-PC-uri în noiembrie | Avanpremieră, fără dată sau preț |
🔗 Postarea NVIDIA despre evenimentul Windows
Dezvoltare locală pe Windows: Copilot va direcționa cererile către MAI Code 1.1 Flash, sandbox-ul său ajunge la disponibilitate generală, Replit pregătește o aplicație desktop
7 octombrie — GitHub Copilot va putea în curând să aleagă singur între un model care rulează pe computerul dezvoltatorului și un model în cloud. Potrivit postării Microsoft și GitHub publicate pe blogul Microsoft Command Line, această rutare va fi disponibilă „până la sfârșitul lunii”: încă nu este disponibilă. GitHub o prezintă drept următoarea etapă a Project HydraFusion, orchestratorul său care distribuie deja sarcinile între mai multe modele, și evidențiază o economie de credite IA, fără a o cuantifica.
Sunt prevăzute două moduri de utilizare în Copilot CLI, aplicația GitHub Copilot și VS Code. Modul Auto va alege, la fiecare interacțiune, între inferența locală și cea în cloud, în funcție de contextul sarcinii și de starea cache-ului; dezvoltatorul va putea, de asemenea, să selecteze singur un model local, MAI Code 1.1 Flash prin furnizorul Windows ML sau orice model expus printr-un punct de acces local (endpoint) compatibil cu API-ul OpenAI. Postarea reamintește: inferența locală nu face ca sesiunea să fie offline.
Demonstrația rulează pe un Surface Laptop Ultra echipat cu RTX Spark. Microsoft AI rulează pe acesta o versiune locală de MAI Code 1.1 Flash, un amestec de experți (mixture-of-experts) specializat în cod, cu 137 de miliarde de parametri, dintre care 6,8 miliarde activi. Cuantizat la aproximativ 3,3 biți per pondere, ocupă 53 Go, cu 80 % mai puțin decât varianta cloud, cu un vârf de utilizare a memoriei de 75,5 Go la un context de 256 000 de tokens.
| Benchmark evaluat (teste Microsoft din 5 octombrie) | MAI Code 1.1 Flash | Versiune cuantizată pe dispozitiv | GPT OSS 120B (versiune GGUF de la Unsloth) |
|---|---|---|---|
| SWE-Bench Verified (500 de sarcini) | 72,6 % | 70,80 % | 32,0 % |
| Terminal-Bench 2.1 (89 de sarcini) | 62,9 % | 66,29 % | 23,6 % |
Microsoft precizează că aceste teste au rulat într-un mediu de execuție llama.cpp pentru Windows ARM64 și că rezultatele variază în funcție de dispozitiv și configurație. O primă componentă este deja disponibilă în terminal: începând cu versiunea preliminară 1.0.94-0 a Copilot CLI, comanda /model descoperă modelele unei instanțe Ollama locale. Nu se adaugă nimic fără confirmare, Ollama și modelul trebuie să fie deja instalate, iar propunerile includ doar modelele care acceptă apelarea instrumentelor și fluxul continuu (streaming).
🔗 Integrarea modelelor locale și a instrumentelor izolate în sandbox în Windows și GitHub Copilot · Descoperirea modelelor locale în GitHub Copilot CLI
Sandbox-ul local al Copilot ajunge la disponibilitate generală
7 octombrie — Sandbox-ul local al GitHub Copilot iese din versiunea preliminară publică lansată pe 2 iunie: ajunge la disponibilitate generală în Copilot CLI, aplicația GitHub Copilot și sesiunile VS Code care trec prin Agent Host, fără costuri suplimentare. Instrumentele și comenzile lansate de Copilot rulează astfel cu acces restricționat la fișiere, rețea, datele de autentificare Git și GitHub CLI și alte capabilități ale sistemului, conform politicilor stabilite de dezvoltator sau de organizația sa; o companie poate impune setări pe care dezvoltatorii nu le pot relaxa, indiferent de modelul utilizat. Motorul, Microsoft eXecution Container (MXC), este o bibliotecă open source a echipei Windows, care se bazează pe ProcessContainer în Windows, Seatbelt în macOS și bubblewrap în Linux, fără mașină virtuală. Limitările sale sunt documentate: instrumentele integrate pentru fișiere sunt controlate de Copilot însuși și nu de sistem, iar serverele MCP la distanță rămân în afara sandbox-ului local.
🔗 Izolarea locală în sandbox pentru GitHub Copilot este acum disponibilă general
Replit construiește aplicațiile local pe Windows
7 octombrie — Replit anunță, împreună cu Microsoft, versiunea preliminară a unei aplicații desktop care construiește și rulează aplicațiile direct pe computerul utilizatorului, în Windows. Replit oferea deja o aplicație desktop: noutatea constă în această construire locală, în care fiecare build rulează în propriul sandbox, bazat pe Microsoft Execution Containers și pe OpenShell, mediul de execuție open source al NVIDIA. Accesul anticipat se face printr-o listă de așteptare, fără dată sau preț, și nu se menționează nicio versiune pentru macOS. Replit a prezentat această versiune preliminară pe scenă în timpul evenimentului Windows din 7 octombrie.
🔗 Anunțul Replit pe X · Lista de așteptare pentru versiunea preliminară
OpenAI publică 722 de manuscrise cu rezultate matematice produse de un model intern
6 octombrie — OpenAI publică dintr-o dată un set amplu de rezultate matematice produse de un model intern de vârf, care nu este disponibil public. Anunțat în seara zilei de 6 octombrie, repository-ul GitHub openai/math reunește 722 de manuscrise grupate în 372 de familii clasificate pe discipline: un rezultat principal poate fi însoțit de argumente complementare, consecințe sau demonstrații alternative.
Marea majoritate a rezultatelor provin din aceeași procedură: aproximativ 4 000 de probleme prezentate modelului, cu o medie echivalentă cu trei ore de raționament în ChatGPT Pro per rezultat. OpenAI explică faptul că și-a extins evaluările la probleme de cercetare deschise după ce a atins limitele evaluărilor matematice existente. Două lucrări fac excepție de la această procedură: o regiune fără zerouri a funcției zeta a lui Riemann, a cărei redactare a fost ajustată de o persoană pentru lizibilitate, și demonstrarea unui caz particular al conjecturii lui Hodge, cel al varietăților abeliene CM.
| Indicator publicat de OpenAI | Valoare anunțată |
|---|---|
| Manuscrise publicate | 722 |
| Familii de rezultate | 372 |
| Probleme prezentate modelului | Aproximativ 4 000 |
| Calcul mediu per rezultat | Aproximativ trei ore de raționament în ChatGPT Pro |
| Rezumate de raționament publicate | 10 |
Nu toate rezultatele sunt verificate în același mod. Multe demonstrații sunt formalizate în Lean, un limbaj care permite verificarea unei demonstrații pe computer, însă nu toate: OpenAI avertizează că „unele rezultate neformalizate ar putea conține erori”, promite să le corecteze rapid și va adăuga noi formalizări pe parcurs. Cele zece rezumate ale raționamentului modelului abordează subiecte precum exponentul de iraționalitate al lui π, conjecturile lui Mahler, conjectura de finitudine directă a lui Kaplansky în caracteristică doi sau izomorfismul factorilor grupurilor libere.
Publicarea în sine a fost pregătită împreună cu grupul consultativ independent pentru matematică și IA al Institute for Advanced Study: protocoale de revizuire și citare, corecții publicate ca versiuni noi, păstrarea istoricului. OpenAI anunță și finanțarea unor ateliere, conferințe și programe dedicate acestor rezultate și afirmă că lucrează la un acces „responsabil” al cercetătorilor la modelul care le-a produs, fără un calendar.
We’re releasing a broad range of new mathematical results produced by an internal frontier model. We’ve been consulting with the independent Advisory Group on Mathematics and Artificial Intelligence at the Institute for Advanced Study, and we have drawn on their advice and public recommendations to inform how we release these results.
🇷🇴 Publicăm o gamă largă de noi rezultate matematice produse de un model intern de vârf. Am consultat grupul consultativ independent pentru matematică și inteligență artificială al Institute for Advanced Study și ne-am bazat pe sfaturile și recomandările sale publice pentru a decide cum să publicăm aceste rezultate. — @OpenAI pe X
🔗 Împărtășirea progreselor IA în matematică · Repository-ul openai/math pe GitHub
Perplexity lansează pplx-embed-v2-late, embeddings multivectoriale pentru text și imagini
7 octombrie — Perplexity Research lansează pplx-embed-v2-late, două modele de embeddings cu interacțiune târzie (late interaction), cu 0.6B și 9B parametri, disponibile pe Hugging Face sub licența MIT. În timp ce un embedding dens comprimă fiecare document într-un singur vector, aceste modele de tip ColBERT păstrează un vector cu 128 de dimensiuni pentru fiecare token și evaluează fiecare pereche interogare-document prin MaxSim: fiecare token al interogării este asociat cu cel mai apropiat token din document. Ele caută în text, imagini și pagini randate (PDF, diapozitive, scanări) fără a trece prin OCR, ceea ce păstrează tabelele, figurile și aranjarea în pagină.
Cele două dimensiuni folosesc același spațiu de embeddings, deoarece sunt distilate token cu token dintr-un model profesor intern de 18B, derivat dintr-un model de bază de 27B. Un corpus indexat cu 9B poate fi astfel interogat prin interogări codificate cu 0.6B: pe ViDoRe v3 pentru imagini, această configurație atinge 63,5 %, față de 62,3 % cu 0.6B de ambele părți, fără cost suplimentar la interogare. Modelul 0.6B, obținut prin pruning din Qwen3.5-0.8B, servește astfel drept encoder de interogări cu consum redus de resurse, inclusiv direct pe dispozitiv.
| Benchmark evaluat (măsurători Perplexity) | Scorul 9B | Scorul 0.6B | Termen de comparație |
|---|---|---|---|
| 72 de sarcini specializate (nDCG@10) | 81,3 % | 78,0 % | 9B depășește următorul model cu 1,6 puncte |
| Q2D-Web, căutare web (Recall@1000) | 74,8 % | 73,6 % | nemotron-embed-8b: 69,3 % |
| ViDoRe v3 pentru imagini (nDCG@10) | 65,2 % | 62,3 % | Doar EVIE depășește 9B |
| BrowseComp+ (agent GPT-OSS-120B) | 64,0 % | — | Următorul cel mai bun ColBERT: cu 4,9 puncte mai puțin |
| MADQA (agent Gemini 3.5 Flash) | 92,4 % | 90,1 % | Mixedbread Agentic Search: 93,4 % |
9B nu câștigă peste tot, iar Perplexity precizează acest lucru: EVIE, de la Tencent, îl depășește pe ViDoRe v3 pentru imagini, gemini-embedding-2 pe MIRACL-Vision și pe benchmark-ul intern PPLX-Q2I, iar Mixedbread Agentic Search obține un scor mai bun pe MADQA, o diferență pe care Perplexity o consideră cuprinsă în intervalul său de încredere. Compania recunoaște și că necesarul de stocare și costul evaluării cresc odată cu lungimea documentelor. Un raport tehnic este anunțat pentru „mai târziu în acest an”, iar Perplexity intenționează să ofere treptat acces la embeddings cu interacțiune târzie, dense și contextuale pe platforma sa API, fără a preciza o dată.
🔗 Articolul Perplexity Research · pplx-embed-v2-late-9b pe Hugging Face
Agenți de programare: Claude Code 2.1.293, Codex CLI 0.161.0, Cursor pe iOS, Antigravity 2.21.0 și Warp Factories
Cinci instrumente cu agenți de programare evoluează: Claude Code adoptă Haiku 5.5, Codex CLI se conectează la servere MCP din terminal, Cursor poate fi controlat de pe un iPhone, Antigravity grupează acțiunile agentului său, iar Warp se deschide către instrumentele Microsoft.
Claude Code 2.1.293 trece implicit la Haiku 5.5
7 octombrie — Lansată la câteva minute după anunțul Haiku 5.5, versiunea 2.1.293 a Claude Code îl face modelul Haiku implicit pe API-ul Anthropic. Adaugă un câmp agentType în payload-ul subagentStatusLine, pentru a diferenția subagenții personalizați, și o opțiune isDeferred care expune de la început schema instrumentelor declarate de moduri. Partea principală constă în 38 de remedieri din 56 de intrări: Claude putea considera că ultimele sale acțiuni de dinaintea unei compactări avuseseră loc după aceasta, apoi putea elimina sau reface lucrul deja finalizat; regulile limitate la o cale și fișierele CLAUDE.md imbricate se încarcă și când Claude citește un fișier cu cat sau grep în Bash; este eliminată o scurgere de memorie a conexiunilor MCP HTTP. Două modificări recente sunt anulate (mesajul de refuz al modului auto din 2.1.281 și o remediere a sesiunilor cloud din 2.1.290), iar limita regulilor de canal pentru Claude Tag crește de la 20 la 50.
🔗 Claude Code 2.1.293 pe GitHub
Codex CLI 0.161.0 introduce o opțiune pentru activarea Daybreak
7 octombrie — Codex CLI 0.161.0 este prima versiune stabilă de la 0.160.1 din 5 octombrie. Comanda /mcp login <name> permite conectarea la un server MCP fără a părăsi sesiunea curentă de terminal, iar conversațiile vocale primesc posibilitatea de a alege microfonul, difuzorul și canalele de intrare. Daybreak, gama cyber a OpenAI, necesită acum activarea unei opțiuni: comutatorul /daybreak și starea Daybreak din linia de stare rămân ascunse până când utilizatorul activează opțiunea cu --enable cli_daybreak (sau features.cli_daybreak=true), iar fără aceasta rutarea Cyber automată este omisă. Pentru un singur tur de conversație, codex exec --cyber-access-program selectează un program de acces Cyber. În Amazon Bedrock, multi-agent V2 și nivelul Ultra al efortului de raționament devin disponibile pe modelele compatibile, iar Bedrock Mantle acceptă regiunile AWS GovCloud. Remedierile vizează permisiunile, reluarea conversației și detectarea unei baze SQLite corupte.
Cursor controlează de pe iOS agenții de pe computer
6 octombrie — Aplicația iOS a Cursor afișează acum agenții care rulează local pe computer: se poate vedea ce face fiecare și i se poate răspunde, iar tweet-ul de anunț menționează și lansarea unor sarcini noi. Agenții rămân pe computer, iar aplicația se conectează la acesta: computerul trebuie, așadar, să rămână pornit și online, iar setarea Keep this computer awake împiedică intrarea în repaus, cu dispozitivul conectat la priză și ecranul deschis. Funcția este activată implicit, cu excepția organizațiilor Enterprise, unde trebuie activată de un administrator; asocierea se confirmă în aplicația desktop, iar agenții cloud nu sunt necesari. Aplicația iOS lansată la sfârșitul lui iunie punea în prim-plan agenții cloud: acum agenții locali devin accesibili de pe telefon.
Antigravity 2.21.0 grupează acțiunile agentului său
6 octombrie — Aplicația Antigravity de la Google trece la versiunea 2.21.0, cu 9 îmbunătățiri și 14 remedieri. Căutarea avansată găsește o conversație după conținutul său, cu ⌘+K (Ctrl+K în Windows). Fila sarcinilor programate (Scheduled Tasks) devine Automations: de aici se poate lansa imediat o automatizare cu Run Now sau i se poate cere agentului să ghideze crearea uneia noi cu Create with Prompt. Modificările de fișiere, comenzile de terminal și citirile pe care agentul le efectuează între două răspunsuri sunt acum grupate într-un singur rând pliabil, însoțit de un scurt rezumat. Printre remedieri, un videoclip MP4 sau MOV trunchiat, citit de agent, putea provoca eșecul întregii continuări a conversației, iar un fișier de setări salvat cu Notepad din Windows sau cu PowerShell nu mai funcționa. Changelog-ul avertizează că o versiune poate avea nevoie de câteva zile pentru a ajunge la toți utilizatorii.
Warp Factories se deschide către Microsoft Teams și Azure DevOps
7 octombrie — Warp deschide Warp Factories, platforma sa de fabrici de software (software factories), către Microsoft Teams și Azure DevOps Services. În Teams, menționarea aplicației Warp într-un canal sau într-un fir de discuție configurat încredințează sarcina fabricii împreună cu contextul conversației; aceasta își raportează progresul în același fir și trimite acolo pull requests pentru revizuire. În Azure DevOps, fabrica poate fi menționată dintr-un element de lucru (work item) sau dintr-un pull request ori se pot declanșa execuții la evenimentele asociate acestora; fiecare fabrică primește propria identitate pentru operațiunile Git, cu acces limitat la depozitele alese. Ambele integrări sunt disponibile pentru toți clienții Warp Factories. Warp prezintă acest suport nativ pentru ambele servicii ca pe o premieră în industrie; Devin se integra deja cu Teams și Azure DevOps Server.
API și platforme: toolsets computer use și browser use din SDK-urile Claude, Grok 4.7 pe Microsoft Foundry
Două anunțuri pentru dezvoltatorii care construiesc pe baza unor modele găzduite: Anthropic simplifică operarea unui computer sau a unui browser, iar Grok 4.7 ajunge în disponibilitate generală la Microsoft.
Toolsets computer use și browser use din SDK-urile Claude
7 octombrie — SDK-urile Python și TypeScript ale Claude integrează, în versiune beta, seturile de instrumente (toolsets) computer use și browser use. Până acum, API-ul indica pe ce voia Claude să facă clic sau ce voia să tasteze, iar dezvoltatorul trebuia să scrie propria buclă pentru a transforma fiecare acțiune într-o comandă. SDK-ul gestionează acum această buclă: dezvoltatorul creează o subclasă a BetaAbstractBrowserToolset20260801 sau BetaAbstractComputerToolset20260801, scrie o metodă pentru fiecare acțiune, iar SDK-ul direcționează apelurile, aplică politicile pentru URL-uri și fișiere furnizate, solicită aprobările și construiește rezultatele trimise înapoi modelului. Anthropic nu furnizează nici browser, nici driver gata de utilizare: se conectează propria automatizare sau un driver de la Browser Use, Browserbase, E2B ori Daytona, iar un exemplu minimal cu Chrome DevTools Protocol este publicat în depozitul claude-quickstarts. Executarea JavaScript și trimiterea fișierelor sunt dezactivate implicit, iar fără o politică pentru URL-uri nu se verifică nicio adresă.
🔗 Firul de discuție al @ClaudeDevs pe X · Documentația pentru toolsets din SDK
Grok 4.7 în disponibilitate generală pe Microsoft Foundry
7 octombrie — Grok 4.7, modelul SpaceXAI lansat pe 21 septembrie, este disponibil pe Microsoft Foundry, a anunțat @SpaceXAI în cursul nopții. Documentația Microsoft îl clasifică în disponibilitate generală, printre modelele vândute direct de Azure: text și imagini la intrare, context de 500 000 tokens (intrare și ieșire combinate), apelarea instrumentelor, acces prin Chat Completions sau prin Responses API și efort de raționament de la low la xhigh, cu high implicit. Microsoft se angajează să ofere modelele Grok în disponibilitate generală, începând cu Grok 4.7, timp de cel puțin șase luni; Grok 4.6 figurează în continuare în versiune preliminară. Pagina de tarife Azure nu lista încă Grok 4.7 în seara de 7 octombrie. După Amazon Bedrock (28 septembrie) și Google Cloud în versiune preliminară (1 octombrie), Grok 4.7 este astfel oferit de cei trei mari furnizori de cloud.
🔗 Implementarea și utilizarea modelelor Grok în Microsoft Foundry
Modele deschise: Open d1 de la Liquid AI, Bolmo de la Ai2 în Nature, cu Bwen 8B și Blama 8B
Două lansări cu ponderi deschise, una pentru luarea rapidă a deciziilor la periferia rețelei, cealaltă pentru citirea textului octet cu octet.
Open d1, modelele de decizie deschise ale Liquid AI
7 octombrie — Liquid AI își deschide familia de modele de decizie cu Open d1: două modele cu ponderi deschise, d1-3B (text și imagini) și d1-omni-600M (text cu imagini sau audio), acesta din urmă într-o versiune timpurie de cercetare. Ele nu generează text: într-o singură trecere, atribuie o probabilitate fiecărui răspuns permis. Potrivit Liquid AI, d1-3B obține 48,57 la Decision Index 0.2.1, cel mai bun scor sub 10 miliarde de parametri, înaintea Decider 35B-A3B (47,11), și o medie de 82,9 pe șapte seturi de date publice. Măsurată împreună cu NVIDIA, latența sa pentru o întrebare variază de la 8 ms pe un RTX 4090 la 50 ms pe un Jetson Orin Nano, suficient pentru a viza periferia rețelei (edge). Nu este publicat niciun benchmark pentru viziune sau audio. Ponderile sunt pe Hugging Face sub licența proprie Liquid AI (lfm1.0), cu versiuni GGUF; d1 din 29 septembrie era accesibil doar prin API.
🔗 Articolul Liquid AI pe Hugging Face
Bolmo de la Ai2 în Nature, cu Bwen 8B și Blama 8B
7 octombrie — Ai2 publică în Nature, online pe 7 octombrie, metoda din spatele Bolmo, familia sa de modele complet deschise care citesc direct octeții în locul subcuvintelor. Citirea octeților evită punctele oarbe ale unui vocabular fix (ortografie, șiruri neobișnuite, anumite sisteme de scriere), dar necesita până acum un antrenament complet de la zero. Conversia la octeți (byteifying) pornește, în schimb, de la un model bazat pe subcuvinte deja performant și îl transformă printr-un scurt antrenament suplimentar. Bolmo 1B și 7B, derivate din Olmo, datează din decembrie; Ai2 prezintă și Bwen 8B (derivat din Qwen 3 8B, licență Apache-2.0) și Blama 8B (derivat din Llama 3 8B, licență llama3), ale căror depozite există din 26 august, precum și checkpoint-uri „Stage 1”, în care este antrenat doar noul strat pentru octeți. Potrivit Ai2, cele două modele se apropie de modelele lor de origine, iar Bwen 8B depășește Bolmo 7B, fără cifre publicate.
SynthID Detector devine accesibil tuturor pentru verificarea imaginilor, videoclipurilor și sunetelor
7 octombrie — Google oferă tuturor acces la SynthID Detector, instrumentul care detectează filigranele invizibile SynthID în conținutul generat de IA. Prezentat anul trecut într-o versiune preliminară destinată profesioniștilor din mass-media, acesta este accesibil pe synthid.com, în întreaga lume și în limba engleză. Se poate încărca o imagine, un videoclip sau un fișier audio. Verificarea acoperă conținutul Google și pe cel al partenerilor săi OpenAI, NVIDIA și Kakao, iar în curând și Apple. Portalul avertizează că acesta nu este un detector general de IA: conținutul provenit dintr-un model fără SynthID sau modificat substanțial poate primi rezultatul „nedetectat”. Google declară că a aplicat filigrane pe peste 180 de miliarde de imagini și videoclipuri și pe 240 000 de ani de conținut audio din 2023, față de 100 de miliarde și 60 000 de ani anunțați în iulie, și că efectuează peste un milion de verificări pe zi în Search, aplicația Gemini și Chrome.
🔗 Google extinde SynthID Detector pentru conținutul generat de IA
Securitate: clasificatorul GitHub pentru secrete divulgate
7 octombrie — GitHub pune în funcțiune un clasificator ModernBERT antrenat suplimentar, dedicat secretelor divulgate și construit împreună cu Microsoft Applied Sciences: acesta citește codul din jurul unei valori pentru a identifica datele de autentificare probabile, inclusiv parole fără un format recognoscibil. Evaluează un lot de candidați în mai puțin de 2 ms și ar putea, potrivit GitHub, „mai mult decât dubla” numărul secretelor blocate la push. Începând de acum, alertele pentru parolele detectate de IA trec la acest model, fără cost suplimentar. Protecția push-urilor prin IA, aflată în versiune preliminară privată, ar urma să devină disponibilă „mai târziu în această lună” pentru organizațiile eligibile, iar verificările comenzii /security-review din Copilot vor intra „în curând” în versiune preliminară privată, ambele contra unor credite IA. Eseul lui Erin Havens, care coordonează produsul de securitate la GitHub, reamintește că unul din trei pull requests implică un agent IA și că protecția push-urilor oprește doar aproximativ 30 % dintre noile secrete detectate.
🔗 Protecția secretelor trebuie să se extindă odată cu software-ul
Infrastructură: GitHub reconstruiește Git pentru activitatea agenților
6 octombrie — GitHub își reconstruiește infrastructura Git pentru a ține pasul cu dezvoltarea agentică. Potrivit articolului de inginerie al lui Brian Celenza, activitatea Git totală a crescut de la 218,2 la 473,3 miliarde de evenimente pe lună între septembrie 2025 și august 2026; dezvoltatorii și agenții au produs 7,38 miliarde de commit-uri în septembrie 2026, de peste cinci ori mai multe decât cu un an înainte, iar numărul operațiunilor de push a crescut de 4,9 ori. Arhitectura actuală, Spokes, replică fiecare depozit pe mai multe servere și validează fiecare actualizare printr-un vot majoritar: adăugarea de copii pentru citiri încetinește astfel scrierile. Noua arhitectură separă stocarea de calcul, cu datele de referință în Azure Blob Storage și procese ușoare (workers) care deservesc citirile dintr-un cache. În benchmarkurile sale interne, GitHub măsoară o rată de scriere de până la 35 de ori mai mare, fără să anunțe o dată pentru tranziție.
🔗 Construirea infrastructurii Git pentru dezvoltarea la scara agenților
IA vocală: ElevenLabs semnează un memorandum de înțelegere cu un stat indian
7 octombrie — Cu ocazia evenimentului său Summit din Bengaluru, ElevenLabs a semnat primul său memorandum de înțelegere (MOU) cu guvernul unui stat indian, pentru un proiect pilot de IA vocală. Compania nu numește statul și nu precizează nici calendarul, nici aria de aplicare, nici valoarea: anunțul se rezumă la un tweet, fără un articol pe blog. Cifra care îl însoțește arată miza: în ultimul an, ElevenAgents a purtat peste 100 de milioane de conversații în India, dintre care peste 70 % în hindi, kannada, tamilă și telugu. Summit a reunit peste 500 de lideri de companii, dezvoltatori și parteneri.
Cercetare: PivotOPD, metoda NVIDIA pentru remedierea erorii decisive a unui agent
7 octombrie — Cercetătorii NVIDIA prezintă PivotOPD, o metodă de antrenare pentru agenții care execută mai multe runde de acțiuni succesive. Constatarea lor: pe ALFWorld, 59 % dintre eșecurile a trei modele Qwen3 conțin o „eroare pivot”, comisă devreme, după care agentul continuă în direcția greșită. PivotOPD extinde distilarea on-policy (on-policy distillation): la fiecare eroare pivot, un model profesor indică acțiunea corectă, apoi o acțiune de redresare pentru rundele următoare, astfel încât modelul elev învață să evite eroarea și să își revină după ea. Comparativ cu 13 metode de referință, obține cea mai bună medie pe ALFWorld, WebShop și Search-based QA cu modele elev Qwen3 de 1.7B și 8B și remediază 72,7 % dintre cele 72 de erori pivot reproduse, față de 20,3 % pentru distilarea standard. Câștigul se transferă și la cod: un model elev Nemotron-3.5 trece de la 62,8 % la 66,0 % pe SWE-Bench Verified. Articolul este pe arXiv; publicarea codului este anunțată pentru perioada următoare.
Optimizare: mPDLP distribuie programele liniare uriașe pe mai multe GPU în cuOpt
7 octombrie — NVIDIA adaugă în cuOpt, biblioteca sa open source pentru optimizare, mPDLP, un solver de programare liniară distribuit pe mai multe GPU conectate prin NVLink, pentru probleme mari de planificare (lanțuri logistice, rețele electrice). Grupând pe același GPU variabilele și constrângerile interdependente, acesta limitează schimburile de date și reduce de până la 6 ori consumul maxim de memorie per GPU. Pe un nod DGX B200, accelerarea ajunge la 11,4 ori pentru calculul PDLP și la 4,2 ori de la un capăt la altul; comparativ cu D-PDLP, mPDLP este de 1,2 până la 2,5 ori mai rapid pentru majoritatea problemelor mari, dar mai lent pentru cele mai mari trei instanțe și pentru problemele mici. Kinaxis rezolvă de 3,3 ori mai rapid un lanț logistic cu peste 135 de milioane de variabile pe opt H100, iar PSR rezolvă de peste 5 ori mai rapid un model energetic cu 185 de milioane de variabile pe opt B200.
🔗 Articolul NVIDIA despre mPDLP
Robotică: roboții asamblează tăvile de testare GB300
7 octombrie — Seattle Robotics Lab al NVIDIA povestește cum învață roboții să asambleze tăvile de testare GB300, care verifică modulele înainte de expediere. Împreună cu Foxconn, care fabrică aceste sisteme, au fost alese două operațiuni: montarea și fixarea cu șuruburi în 16 puncte a unei bare colectoare și conectarea a patru conectori montați pe cabluri flexibile. Cerința stabilită cu Foxconn este o rată de succes de 99,5 %, în cel mult dublul timpului necesar unui operator calificat, fără coliziuni. Roboții se apropie de aceasta fără să o atingă: peste 95 % rată de succes în 160 de secunde pentru bară, față de ținta de 124, și 90 până la 95 % pentru conectori, la 40 de secunde per cablu. Echipa combină un lanț clasic de percepție și comandă, estimarea poziției și orientării cu DOPER și învățarea prin întărire în Isaac Lab, ajustată pe robotul real. NVIDIA promite să publice DOPER și orchestratorul său TALOS, fără să precizeze o dată.
🔗 Articolul de pe blogul tehnic NVIDIA despre tăvile GB300
Știri pe scurt
- Aplicația iOS ChatGPT 1.2026.272 — Afișează previzualizările paginilor direct în răspunsuri, deschide linkurile către sarcinile Codex în aplicație și, în Codex Mobile, regândește selectorul de aprobare și accelerează fluxul conversațiilor lungi. 🔗 sursă
- Radisson Hotel Group — Potrivit unui studiu de caz OpenAI, pluginul său ChatGPT, construit în șase săptămâni cu Accenture Song, are o rată de conversie de aproximativ 1,5 ori mai bună decât căutarea sa organică în iulie-august 2026, iar 54 % dintre evenimentele de plată și rezervare ale campaniei sale publicitare din ChatGPT sunt atribuite unor simple vizualizări ale anunțurilor. 🔗 sursă
- Jump Trading — Compania de trading cantitativ încredințează agenților GPT-6 Astra analize care pot rula mai multe zile, corelând numeroase surse de date, cu o revizuire umană la finalul procesului; studiul de caz OpenAI nu publică nicio cifră privind câștigurile. 🔗 sursă
- Extensii de pluginuri ChatGPT — În firul de discuție al tutorialului său video, OpenAI Developers menționează Adobe, Canva, Figma, Shopify, Instacart și Atlassian printre companiile care le folosesc, alături de tldraw și MagicPath; prezentate pe 29 septembrie, acestea lansează un plugin din bara laterală, gestionează mențiunile @ și adaugă vizualizatoare de fișiere. 🔗 sursă
- Every și Claude Managed Agents — Echipa Every a construit pe Claude Managed Agents un agent pentru companie, pe care fiecare îl folosește în Slack pentru a-și partaja skills la fiecare model nou, apoi l-a pus la dispoziția abonaților săi; Anthropic distribuie un interviu video, fără cifre. 🔗 sursă
- Zed 1.23 și versiunea preliminară 1.24.1 — Versiunea 1.23 devine stabilă, cu previzualizarea fișierelor JSONL și NDJSON, iar versiunea preliminară 1.24.1 permite tragerea unei file de terminal în Agent Panel, acceptă modele Amazon Bedrock personalizate cu instrumente, imagini și raționament, creează tag-uri Git și reduce cu aproximativ 23 % dimensiunea binarului Linux. 🔗 sursă
- Puck, meta-agentul Amp — Acceptă acum mai multe conversații separate: butonul + deschide una, un clic pe numele său permite trecerea de la una la alta, iar cele rămase inactive timp de trei zile sunt mutate separat. 🔗 sursă
- Copilot CLI 1.0.93 — Ajunsă în versiune stabilă, aplică modificările de configurare ale serverelor MCP între două runde, fără repornirea sesiunii, și pune la dispoziția tuturor sandboxul pentru comenzi prin /sandbox și —sandbox; SDK Copilot 1.0.17 devine și el stabil. 🔗 sursă
- Metricile de utilizare Copilot — Subestimau activitatea agenților de când mai multe IDE își trec sesiunile prin Copilot SDK; remedierea necesită o actualizare (VS Code 1.139.0 chiar acum, Visual Studio 18.12 în octombrie, JetBrains la sfârșitul lui octombrie, Eclipse și Xcode până în noiembrie), iar datele pierdute nu vor fi recuperate. 🔗 sursă
- Gemini CLI v0.65.0-nightly.20261007 — Această versiune nightly deschide seria 0.65.0 cu cinci remedieri, dintre care două împotriva pierderilor de date: setările proiectului devin doar pentru citire într-un director care nu este de încredere, unde
gemini mcp addputea goli.gemini/settings.json, iar ieșirea imediată dintr-o sesiune reluată nu mai șterge istoricul acesteia. 🔗 sursă - Transformers.js 4.3.1 — La o zi după lansarea EmbeddingGemma 2, biblioteca îi calculează embeddings multimodale (740 de milioane de parametri, 768 de dimensiuni) direct în browser, prin WebGPU sau WASM, ori în Node.js. 🔗 sursă
- RL Environment Explorer — Adithya S K, de la Hugging Face, prezintă acest Space de la FineEnvs pentru explorarea, vizualizarea și lansarea mediilor de învățare prin întărire din Hub (OpenEnv, Harbor, MiMo, Verifiers, NeMo Gym): peste 12 milioane de înregistrări de sarcini, provenite mai ales din câteva medii OpenEnv mari. 🔗 sursă
- Seb-9B — Stas Veretennikov publică acest model local pentru luarea deciziilor sub licența Apache-2.0 (text, JSON sau imagine, până la 20 de opțiuni), care obține o medie de 0,792 pe 17 suite publice, față de 0,786 pentru Jev 1.13; autorul a realizat toate măsurătorile și precizează că datele sale de antrenare includeau setul de antrenare al unuia dintre benchmarkuri, fără cazurile sale de test. 🔗 sursă
- Nemotron la olimpiadele din 2026 — NVIDIA detaliază rețeta comună (ajustare fină supervizată, învățare prin întărire, o buclă care generează, verifică și corectează) din spatele scorului de 535,4 din 600 la IOI 2026, în participare neoficială, și de 30 din 42 la IMO 2026, unde pragul pentru medalia de aur era 29, și publică benchmarkul Nemotron-IMO-Bench cu 200 de probleme. 🔗 sursă
- Instadocs: AI Gone Wild — Netflix anunță pentru 12 octombrie acest documentar care reconstituie atacul cibernetic suferit de Hugging Face în iulie, desfășurat, potrivit Netflix, de agenți autonomi creați de cercetători OpenAI. 🔗 sursă
- Runway în catalogul de aplicații ChatGPT — După instalarea pluginului și conectarea contului Runway, o mențiune @Runway într-o conversație îi încredințează generarea de imagini sau videoclipuri; Runway nu precizează nici tariful, nici costul în credite. 🔗 sursă
- Face Swap de la Luma — Funcția înlocuiește fața unui personaj într-un cadru existent, pentru a permite iterații fără a reface totul de la început; anunțul se rezumă la două tweeturi, fără pagină de produs, tarif sau precizări despre model. 🔗 sursă
- DSX Air — NVIDIA arată cum pot fi testate modificările unei fabrici IA pe acest geamăn digital: agenții aplică modificarea, verifică configurația, securitatea și izolarea, apoi furnizează un raport, trecerea în producție rămânând condiționată de o validare umană; un articol despre metodă, fără cifre. 🔗 sursă
- cuPhoton — Un tutorial NVIDIA aplică acest set de instrumente open source la analiza imaginilor astronomice pe GPU, de la citirea fișierelor FITS până la examinarea candidaților; câștigurile anunțate, de până la 14 900 de ori, se referă la anumite operațiuni și nu la procesarea de la un capăt la altul. 🔗 sursă
- Cosmos și SynthID — Conținuturile generate de modelele NVIDIA Cosmos pe build.nvidia.com poartă filigranul SynthID și pot fi acum verificate de oricine cu detectorul pus la dispoziție de Google. 🔗 sursă
- SDK TypeScript de la SpaceXAI 0.2.3 — Adaugă un nivel de serviciu
fast, interschimbabil cupriority, și identificatorulgrok-imagine-video-1.5-lite, un model video mai ușor, absent din notele de versiune: potrivit datelor de pe pagina modelelor, nu acceptă audio la intrare și costă de patru ori mai puțin pe secundă decâtgrok-imagine-video-1.5la 480p. 🔗 sursă - Ghid RAG vs. LLM — Perplexity publică un ghid educativ care prezintă RAG și LLM drept complementare, distinge trei tipuri de RAG (naiv, modular, avansat) și precizează când este suficient un LLM singur; nicio funcționalitate sau cifră nouă. 🔗 sursă
Ce înseamnă acest lucru
Modelele mici devin produsul de masă. Începând cu 8 octombrie, GPT-6 Luna răspunde utilizatorilor gratuiți ai ChatGPT, iar Anthropic stabilește pentru Haiku 5.5 un preț de 0,10 dolari per milion de tokens de intrare pentru prompturi de sub 100 000 de tokens, înjumătățind totodată prețul citirilor din cache pentru Sonnet 5.5. Aceste modele preiau cea mai mare parte a volumului: conversații de zi cu zi, subagenți, rezumate, compactări. Clasamentul Cursor amintește însă că prețul per token nu spune totul: la nivelul de efort Max, Haiku 5.5 consumă de aproape nouă ori mai mulți tokens per sarcină decât Sonnet 5.5 la nivelul de efort High, pentru un cost per sarcină doar puțin mai mic (1,12 dolari față de 1,20). Creditul API lunar al abonamentelor Max și Team îi invită, la rândul său, pe abonați să încerce aceste modele în propriul cod.
IA ajunge și pe stația de lucru. Laptopurile RTX Spark sosesc pe 16 octombrie, DGX Station for Windows promite până la 20 de petaflops pe un birou, iar Copilot urmează să încredințeze singur anumite sarcini către MAI Code 1.1 Flash, local, până la sfârșitul lunii. Replit construiește acum aplicațiile pe mașina utilizatorului. Agenții care execută cod pe un calculator personal ridică o problemă de securitate, iar aceeași componentă apare peste tot: Microsoft Execution Containers (MXC), disponibil în general pe Windows, izolează atât comenzile Copilot, cât și buildurile Replit. GitHub, la rândul său, implementează un clasificator dedicat secretelor divulgate și își reconstruiește infrastructura Git, deoarece una din trei pull request-uri implică deja un agent, iar numărul de commit-uri a crescut de peste cinci ori într-un an.
Răspunsul devine și el o interfață. Cu Intelligent UI, ChatGPT răspunde prin grafice, formulare sau un mic instrument construit la cerere și începe să răspundă înainte să termine de raționat. Pentru dezvoltatori, SDK-urile Claude gestionează bucla de computer use și browser use, iar Cursor permite urmărirea de pe un iPhone a agenților care lucrează pe calculator și transmiterea de răspunsuri către aceștia. În aceste trei cazuri, textul este doar o parte a schimbului: IA afișează, face clic și raportează, iar utilizatorul supraveghează.
În sfârșit, multe dintre cifrele zilei sunt măsurate de cei care le publică: benchmarkurile Haiku 5.5 de Anthropic, cele ale MAI Code 1.1 Flash de Microsoft, Q2D-Web de Perplexity, care l-a conceput, scorurile Open d1 de Liquid AI și rata de scriere crescută de 35 de ori prin testele interne GitHub. OpenAI avertizează chiar ea că rezultatele neformalizate din cele 722 de manuscrise ale sale pot conține erori, iar câștigurile de viteză pentru GPT-6 provin din evaluări interne. Aceste măsurători rămân utile pentru a poziționa produsele unele în raport cu altele; evaluările externe, precum clasamentul CursorBench, unde un furnizor de instrumente măsoară modelul altuia, vor permite verificarea lor prin comparație.
Surse
- GPT-6 și Intelligent UI pentru toți (OpenAI)
- Anunțul GPT-6 pentru toți (@OpenAI)
- Fișa de sistem GPT-6 Sol și GPT-6 Luna, actualizarea din octombrie
- GPT-6 și alte modele în ChatGPT
- Note de versiune ChatGPT
- Încărcarea fișierelor și a conținutului audio în ChatGPT
- Sprijinirea adolescenților să învețe, să planifice și să modeleze viitorul AI (OpenAI)
- Anunțul Claude Haiku 5.5 (Anthropic)
- Lansarea Claude Haiku 5.5 (@claudeai)
- Ghid de migrare la Haiku 5.5
- Haiku 5.5 în Cursor (@cursor_ai)
- Clasamentul CursorBench
- Credite API lunare pentru abonamentele Max și Team (asistență Claude)
- Anunțul creditului API (@ClaudeDevs)
- RTX Spark și DGX Station pentru Windows (blog NVIDIA)
- Introducerea modelelor locale și a instrumentelor izolate în sandbox în Windows și GitHub Copilot (Microsoft Command Line)
- Descoperă modele locale în GitHub Copilot CLI
- Izolarea locală în sandbox pentru GitHub Copilot este acum disponibilă pentru toți
- Versiune preliminară a aplicației desktop Replit (@Replit)
- Lista de așteptare pentru aplicația desktop Replit
- Prezentarea progreselor IA în matematică (OpenAI)
- Repository-ul openai/math
- Anunțul rezultatelor matematice (@OpenAI)
- Embeddings multimodale dincolo de un singur vector (Perplexity Research)
- pplx-embed-v2-late-9b pe Hugging Face
- Claude Code 2.1.293
- Codex CLI 0.161.0
- Control de la distanță pentru agenți locali (changelog Cursor)
- Changelog Antigravity
- Warp Factories, Microsoft Teams și Azure DevOps (blog Warp)
- Toolsets computer use și browser use în SDK-uri (@ClaudeDevs)
- Documentația pentru toolsets din SDK-ul Claude
- Implementarea și utilizarea modelelor Grok în Microsoft Foundry
- Open d1 (Liquid AI pe Hugging Face)
- Bolmo în Nature (Ai2)
- Google extinde SynthID Detector pentru conținut AI
- Protecția secretelor trebuie să țină pasul cu dezvoltarea software-ului (GitHub)
- Construirea infrastructurii Git pentru dezvoltare la scara agenților (GitHub)
- Memorandum de înțelegere cu un stat indian (@ElevenLabs)
- PivotOPD (NVIDIA Research)
- mPDLP în cuOpt (blog tehnic NVIDIA)
- Mașinile care construiesc mașinile (blog tehnic NVIDIA)
- Changelog ChatGPT și Codex, ChatGPT pentru iOS 1.2026.272
- Radisson Hotel Group aduce descoperirea hotelurilor în ChatGPT (OpenAI)
- Cum extinde Jump Trading cercetarea quant cu ChatGPT (OpenAI)
- Extensii de pluginuri ChatGPT (@OpenAIDevs)
- Every și Claude Managed Agents (@claudeai)
- Zed v1.24.1-pre
- Multe, multe pucuri (Amp)
- Copilot CLI 1.0.93
- Actualizează IDE-ul pentru a restabili activitatea agenților în metricile de utilizare Copilot
- Gemini CLI v0.65.0-nightly.20261007
- Transformers.js 4.3.1
- RL Environment Explorer (@adithya_s_k)
- Seb-9B în comparație directă (blog Hugging Face)
- Nemotron la IOI și IMO 2026 (blog Hugging Face)
- Instadocs: AI scăpată de sub control (@netflix)
- Runway în ChatGPT (@runwayml)
- Face Swap (@LumaLabsAI)
- Validează modificările fabricilor AI cu gemeni digitali și agenți AI (blog tehnic NVIDIA)
- Analiză mai rapidă a imaginilor științifice cu NVIDIA cuPhoton
- Cosmos și SynthID (@NVIDIAAI)
- SDK TypeScript SpaceXAI 0.2.3
- RAG vs. LLM (Perplexity)