ai-powered-markdown-translatorArticol tradus din fr în ro cu gpt-5.6-sol.
Cincizeci și două de anunțuri, publicate în cea mai mare parte pe 11 septembrie, și aceeași idee care revine la actori care nu comunică între ei. Cursor încredințează un proiect întreg unui agent coordonator care nu scrie cod și deleagă către mii de subagenți, Cognition rulează două modele în tandem pe dispozitivul dezvoltatorului, iar Sakana direcționează fiecare sarcină către cel mai ușor model capabil să o rezolve. În aceeași zi, OpenAI își scoate modelul pentru științele vieții din previzualizarea pentru cercetare și îi publică grila tarifară, Runway licențiază companiilor ponderile modelelor sale închise, iar Anthropic publică o subcomandă care măsoară, în sfârșit, aportul real al unui plugin.
Cursor lansează Projects, proiecte conduse de un agent coordonator
10 septembrie — Cursor a lansat Projects, o regândire a modului în care îi este încredințată munca unui agent în editor. Produsul rupe cu obiceiul împământenit în ultimii doi ani: în loc să deschidă o conversație nouă pentru fiecare sarcină și apoi să o închidă, utilizatorul dialoghează cu un agent coordonator într-un fir care durează luni întregi. Acest coordonator nu scrie nicio linie de cod. El dirijează alți agenți care îl scriu, ceea ce îi permite să rămână permanent disponibil pentru a primi instrucțiuni în timp ce lucrul avansează.
Trei mecanisme fac posibil acest lucru. Mai întâi, execuția implicită în cloud: un Project rulează pe propriul dispozitiv, închiderea laptopului nu îl întrerupe, iar numărul de subagenți care lucrează în paralel nu mai este limitat de hardware-ul local. Un agent local pornește atunci când un test trebuie să ruleze pe dispozitivul dezvoltatorului. Urmează contextul partajat: fiecare Project păstrează un set de fișiere sincronizate pe toate dispozitivele, în care agenții își depozitează cercetările, artefactele și ceea ce înțeleg din cod. Dacă unul descoperă cum se testează un serviciu, toți cei care urmează au la dispoziție procedura. Al treilea mecanism este cel mai neobișnuit. Cursor îl numește abonamente (subscriptions): coordonatorul poate monitoriza un canal Slack, poate rula după un program sau poate urmări toate pull request-urile pentru a remedia integrarea continuă. Agentul acționează la detectarea unui semnal, fără să aștepte să fie solicitat.
| Populație măsurată | Efect măsurat asupra pull request-urilor |
|---|---|
| Utilizatori noi ai Projects | Cu 30 la sută mai multe fuzionate |
| Utilizatori care lucrează în principal în Projects | De șase ori mai multe fuzionate |
| Project pentru design system-ul intern | Între 20 și 100 de pull request-uri afectate zilnic, estimativ |
The coordinator doesn’t write code itself but directs other agents that do. Because it delegates rather than executes, it is never blocked and is always responsive to direction.
🇷🇴 Coordonatorul nu scrie el însuși cod, ci dirijează alți agenți care o fac. Deoarece deleagă în loc să execute, nu este blocat niciodată și rămâne permanent receptiv la instrucțiuni. — Cursor, blogul Projects
Aceste cifre sunt măsurători interne și trebuie privite cu precauția cuvenită. Exemplul cel mai grăitor rămâne cel al grădinăritului, numele dat de Cursor muncii care nu se termină niciodată: un inginer rulează un Project dedicat design system-ului, care examinează fiecare pull request nou, extrage din el componentele care își au locul în sistem și adaugă o regulă de lint de îndată ce întâlnește aceeași eroare de două ori. Projects este în versiune beta și este implementat treptat începând din 10 septembrie. Anunțul nu menționează nicio condiție tarifară și nicio restricție legată de abonament.
GPT-Rosalind iese din previzualizarea pentru cercetare, cu grila sa tarifară
11 septembrie — OpenAI Developers anunță că GPT-Rosalind, modelul său de raționament dedicat științelor vieții, iese din previzualizarea pentru cercetare (research preview). Prezentat pe 16 aprilie 2026 pentru cercetarea în biologie, descoperirea medicamentelor și medicina translațională, modelul era atunci accesibil numai clienților Enterprise eligibili din Statele Unite. Acesta trece la acces de încredere (trusted access) pentru organizațiile eligibile din întreaga lume, prin API, Codex și ChatGPT Enterprise, iar acest acces va include următoarele modele din serie pe măsură ce vor fi lansate.
Jurnalul de modificări al API-ului, într-o intrare datată 8 septembrie, oferă detaliile care nu sunt menționate în firul de pe X. Modelul se numește gpt-rosalind-research, iar disponibilitatea sa generală rămâne condiționată de programul de acces de încredere, rezervat cercetării interne în științele vieții aprobate de OpenAI.
| Element tarifar sau de acces | Valoare anunțată |
|---|---|
| Identificatorul modelului | gpt-rosalind-research |
| Tokeni de intrare | 5 dolari per milion |
| Tokeni de intrare din cache | 0,50 dolari per milion |
| Tokeni de ieșire | 25 de dolari per milion |
| Începerea facturării | 5 octombrie 2026 |
| Suprafețe de acces | API, Codex, ChatGPT Enterprise |
| Condiție de acces | Program de acces de încredere, organizații eligibile |
Facturarea începe abia pe 5 octombrie: în timpul previzualizării pentru cercetare, utilizarea nu consuma nici credite, nici tokeni. În privința instrumentelor, pluginurile Life Sciences pentru Codex formează stratul de orchestrare al modelului, de la genomică la structura proteinelor și cercetarea translațională, de la colectarea dovezilor biologice până la generarea rapoartelor de control al calității și a notebook-urilor interactive. Acest pachet, publicat gratuit pe GitHub în aprilie, oferă acces la peste 50 de baze de date multi-omice publice, surse de literatură și instrumente de biologie; funcționează pentru toată lumea cu modelele generaliste, însă numai utilizatorii Enterprise eligibili îl pot combina cu GPT-Rosalind.
Performanțele declarate rămân cele de la lansare: cel mai bun scor publicat pe BixBench, un avantaj față de GPT-5.4 în 6 dintre cele 11 sarcini LABBench2, cu cel mai mare avans pe CloningQA, iar într-o sarcină ARN secvență-funcție concepută împreună cu Dyno Therapeutics, cea mai bună propunere a sa a depășit percentila 95 a 57 de experți umani în predicție. Informația concretă este dublă: un model specializat care părăsește statutul experimental cu un tarif public și o extindere geografică a accesului. Obstacolul rămâne eligibilitatea, care nu este disponibilă în regim self-service.
🔗 Firul OpenAI Developers pe X
Runway Model Licensing, ponderile modelelor închise livrate companiilor
11 septembrie — Runway a deschis un program de licențiere a modelelor sale (Model Licensing) destinat companiilor. Principiul se îndepărtează de accesul prin API: clientul primește ponderile complete ale unui model Runway de ultimă generație, îl ajustează fin pe propriile date, îl găzduiește în propria infrastructură și comercializează ceea ce obține din el. Datele și rezultatele generate nu părăsesc niciodată mediul clientului, oferta vizând în mod explicit studiourile, mărcile și guvernele.
| Element livrat | Conținut |
|---|---|
| Ponderile modelului | Ponderi complete ca punct de plecare |
| Checkpoints | Mai multe versiuni ale modelului pentru validare |
| Script de antrenare | Cod pentru adăugarea propriilor date și lansarea ajustărilor fine |
| Livrare | Împachetată în baza de cod a clientului, găzduită oriunde dorește acesta |
| Cercetători alocați | Asistență practică pentru configurare, ponderi și livrare |
Găzduirea se face, la alegere, în cloud-ul clientului, în centrul său de date sau integral on-premises, inclusiv într-un mediu izolat de rețea (air-gapped) pentru administrații. Sunt menționate șase sectoare: platforme software, cinematografie și studiouri, mărci și marketing, robotică și IA fizică având World Action Model drept infrastructură centrală a politicii (policy backbone), jocuri video și 3D cu îmbunătățirea fotorealistă a randărilor de calitate redusă, precum și guverne.
Din punct de vedere economic, Runway distinge două căi: Runway Dev, API-ul facturat în funcție de utilizare, fără infrastructură de administrat; și licența anuală, cu costuri previzibile și control deplin asupra versiunilor, comportamentului și rezultatelor. FAQ-ul răspunde obiecției privind perimarea: modelele viitoare nu vor avea acces la datele proprietare ale clientului, este prevăzută reînnoirea anuală și sunt acordate credite pentru generațiile următoare. Acesta estimează costul unei reconstrucții interne la ani de învățare și sute de milioane de dolari. Compania se prezintă drept una dintre foarte puținele din lume care licențiază ponderi închise de această calitate și își opune direct oferta ponderilor deschise, care, potrivit acesteia, ar furniza un model mai slab însoțit de o listă de sarcini. Nu este publicat niciun tarif, iar accesul se face printr-un formular comercial. Anunțul vine la nouă zile după Runway Dev MCP și la o săptămână după abonamentul Team: Runway acoperă acum întreaga gamă, de la creatorul individual până la licența pentru ponderi închise.
Cognition aduce Fusion în Devin Desktop și Devin CLI
11 septembrie — Cognition a anunțat disponibilitatea Fusion în Devin Desktop și Devin CLI. Arhitectura rula de mai multe luni pe Devin Cloud; acum ajunge pe dispozitivul dezvoltatorului. Anunțul vine la o zi după SWE-2, modelul propriu pentru cod, iar cele două se completează, deoarece SWE-2 este modelul secund recomandat al sistemului.
Principiul este simplu de formulat. Atunci când se alege Fusion, nu este selectat un singur model, ci două. Un model de vârf joacă rolul de lider (lead) și păstrează controlul asupra sesiunii: deține planul, clarifică ambiguitățile și verifică munca livrată. Un model mai puțin costisitor joacă rolul secundului (sidekick): explorează codul, scrie modificările, rulează testele și raportează rezultatele. Cele două rulează în paralel, fiecare cu propriul context persistent. Argumentul tehnic se îndreaptă împotriva rutării modelelor, soluția imaginată în mod spontan pentru reducerea costurilor: un prompt inițial nu este suficient pentru a măsura dificultatea unei sarcini, iar schimbarea modelului pe parcurs întrerupe cache-ul promptului. Fusion evită problema prin faptul că nu transferă niciodată conversațiile integrale între cele două modele, acestea schimbând între ele numai brief-uri, rezultate și feedback.
| Cost per sarcină, în dolari | Doar Fable 5.1 | Fusion Fable 5.1 și SWE-2 | Doar Astra | Fusion Astra și SWE-2 |
|---|---|---|---|---|
| DeepSWE 1.1 | 14,63 | 7,88 | 7,88 | 4,69 |
| Terminal-Bench 4 | 17,46 | 13,37 | 10,08 | 6,06 |
| SWE-Atlas QnA | 7,57 | 5,00 | 5,72 | 3,59 |
| Vals Code Migration | 70,97 | 42,00 | 44,36 | 35,51 |
| FrontierCode 1.1 extins | 2,68 | 1,67 | 2,62 | 2,34 |
One of our key findings is that using more expensive models can make the entire system cheaper.
🇷🇴 Una dintre principalele noastre descoperiri este că utilizarea unor modele mai scumpe poate face întregul sistem mai ieftin. — Cognition, blogul despre Fusion local
Demonstrația este făcută pentru ambele părți ale tandemului. În cazul liderului, înlocuirea Opus 4.8 cu Fable 5, al cărui cost nominal per token este de două ori mai mare, a redus costul mediu al sesiunilor cu 9 la sută, păstrând același secund, și a obținut un scor mai bun pe FrontierCode: Fable delega mai devreme și redacta brief-uri mai bune, în timp ce Opus își microgestiona secundul. În cazul secundului, trecerea de la GPT-5.6 Luna la SWE-2, adică un cost cu 275 la sută mai mare per milion de tokeni, reduce costul total al sarcinii cu 2 la sută și adaugă 1,4 puncte. În Artificial Analysis Coding Agent Index v1.5, Fusion cu Fable 5.1 și SWE-2 obține 61,7 la un cost cu 36 la sută mai mic decât Claude Code cu Fable 5.1, care atinge cel mult 62,2. Cognition deduce de aici o regulă pentru 2026: modelele și combinațiile model-harness trebuie evaluate în funcție de prețul per sarcină, nu de prețul per token. O poziție convenabilă pentru un editor care vinde un harness, însă cifrele au fost obținute împreună cu Artificial Analysis și Vals AI pe cinci benchmark-uri distincte. Instalarea se face printr-o singură comandă.
Sakana AI lansează Fugu Max și Fugu Ultra v2, două evoluții ale orchestratorului său multi-agent
11 septembrie — Sakana AI publică Fugu Max și Fugu Ultra v2, două versiuni noi ale Sakana Fugu, sistemul său de orchestrare multi-agent (multi-agent orchestration system) expus în spatele unui singur API compatibil cu OpenAI. Firul călăuzitor este frontiera Pareto: Sakana consideră că sectorul încă gândește ca și cum capacitatea ar fi singura axă, deși o sarcină reală este evaluată pe baza a două criterii, capacitatea și costul.
Fugu nu este un model unic, ci un strat de orchestrare învățat care direcționează fiecare sarcină către un pool de modele cu ponderi deschise și specializate. Fugu Max extinde acest pool, cel mai mare de până acum potrivit companiei, integrând familia NVIDIA Nemotron și trimite fiecare sarcină către cel mai ușor model capabil să o rezolve. Obține cel mai bun scor general pe șase benchmark-uri și extinde frontiera cost-performanță pe șapte din zece, la 2 dolari per milion de tokeni de intrare și 6 la ieșire, un preț de ieșire despre care Sakana afirmă că este cu 40–60% mai mic decât cele ale Sonnet 5, GPT 5.6 Terra și Kimi K3.
| Măsură anunțată | Scor | Comparație oferită de Sakana |
|---|---|---|
| Fugu Ultra v2, Chartography | 48,3 | Opus 5 la 27,3; Fable 5 la 29,5 |
| Fugu Ultra v2, DeepSWE | 74,3 | Înaintea unor modele de 3–5 ori mai scumpe per token |
| Fugu Ultra v2, clasament | Locul 1 sau la egalitate pe 5 din 8 benchmark-uri | Top 2 pe 7 din 8 |
| Fugu Max, clasament general | Cel mai bun scor pe 6 benchmark-uri | Frontiera Pareto extinsă pe 7 din 10 |
Aspectul asupra căruia Sakana insistă cel mai mult merită evidențiat: Fable 5, Fable 5.1 și GPT-6-Astra nu fac parte din pool-ul de agenți al Fugu Ultra v2, a cărui dată-limită pentru antrenare este 28 august 2026. Argumentul este reziliența aprovizionării, un pool interschimbabil care protejează împotriva dependenței de un furnizor, a revocărilor de API și a întreruperilor serviciului. Ambele modele sunt disponibile imediat, iar un utilizator Fugu trece la Max sau Ultra v2 schimbând un singur parametru. Fugu Max este disponibil și pe OpenRouter, cu intrare multimodală, căutare web, raționament configurabil și ieșiri structurate. Rezervă privind utilizarea: benchmark-urile și modelele de comparație sunt alese de Sakana, SWEFish este un banc de testare intern, iar diferențele revendicate depind de tarifele modelelor comparate în momentul publicării.
🔗 Prezentarea Fugu Max și Fugu Ultra v2
ElevenLabs lansează Music v2.5, cu descărcări fără pierderi pentru toate abonamentele
11 septembrie — ElevenLabs a publicat Music v2.5 și l-a configurat implicit în ElevenMusic, atât pentru generarea prin prompt, cât și prin referință audio. Modelul promite instrumente care sună ca într-o înregistrare live, aranjamente mai profunde, compoziții lungi, tranziții între genuri în timpul piesei, rap și voci care sună nativ în limba textului. Măsurătoarea prezentată este un test orb pe 47 885 de perechi, câte o variantă per model pentru același prompt: Music v2.5 a fost preferat în majoritatea cazurilor, cu cea mai clară diferență în genurile bazate pe voce și acustică: R&B, soul, hip-hop, rock, metal, orchestral și muzică de film. Procentul exact al preferințelor nu este publicat.
A doua componentă schimbă și mai mult situația pentru utilizatori. Fiecare piesă creată în ElevenMusic îi aparține autorului său în cadrul tuturor abonamentelor, inclusiv al celui gratuit. Abonamentul gratuit oferă cinci descărcări fără pierderi (lossless) pe zi, cu utilizare comercială dacă este menționat ElevenMusic, iar abonamentul Pro oferă 400 pe lună. Permisiunile dobândite în momentul creării rămân asociate piesei: anularea abonamentului sau trecerea la unul inferior nu schimbă nimic pentru titlurile deja produse, iar o eventuală modificare viitoare a condițiilor s-ar aplica numai celor noi. Singura excepție este o piesă construită pe baza melodiei altui artist, a cărei descărcare este blocată.
| Element măsurat sau anunțat | Valoare |
|---|---|
| Perechi evaluate în testul orb | 47 885 |
| Descărcări fără pierderi, abonamentul Free | 5 pe zi, utilizare comercială cu menționare |
| Descărcări fără pierderi, abonamentul Pro | 400 pe lună |
| Identificator API | music_v2_5 |
| Model implicit în ElevenMusic | Music v2.5, Music v2 păstrat |
Modelul este disponibil și în ElevenCreative, ca nod Music în Flows, precum și în API sub identificatorul music_v2_5. ElevenLabs precizează că acordul multianual anunțat în ziua precedentă cu Universal Music Group este distinct de această lansare. Pentru cititor, ordinea anunțurilor contează: acordul cu casa de discuri majoră este anunțat mai întâi, iar modelul și drepturile extinse de utilizare sunt lansate a doua zi.
Claude Code măsoară contribuția reală a unui plugin, cu și fără acesta
11 septembrie — Echipa Claude Developers anunță claude plugin eval, o subcomandă Claude Code care execută un plugin sau un skill pe o suită de cazuri de testare, evaluează fiecare execuție, apoi repetă fiecare caz fără plugin pentru a măsura contribuția acestuia. Ideea este simplă și puțin incomodă: un scor ridicat nu demonstrează că un plugin ajută, deoarece Claude reușește uneori la fel de bine fără el. Prin urmare, comanda returnează două scoruri și diferența dintre ele. Dacă un caz obține 1,0 în ambele variante, pluginul nu a avut nicio contribuție.
Punctul de intrare este claude plugin eval init, lansat în rădăcina pluginului. Se deschide o sesiune interactivă: Claude citește pluginul, întreabă cum arată un rezultat bun, propune prompturi care trebuie și nu trebuie să îl declanșeze, proiectează verificatoarele (graders), le testează o dată, scrie câte un director pentru fiecare caz și anunță costul estimat al unei rulări complete. Apoi, fiecare caz rulează de trei ori cu pluginul și de trei ori fără el, adică șase execuții, deoarece o singură rulare a unui agent nedeterminist nu spune prea multe. Terminalul afișează un tabel cu și fără plugin, un raport HTML autonom este scris pe disc, iar raportul este publicat ca artefact privat atunci când contul permite acest lucru.
| Tip de verificator | Cost în apeluri de model | Condiție de reușită |
|---|---|---|
regex | zero | Model găsit în ultimul răspuns, în urmă sau într-un fișier |
tool_used | zero | Numărul de apeluri către un instrument între un minim și un maxim |
tool_order | zero | Un apel îl precedă pe altul |
file_exists | zero | Un fișier creat în timpul rulării corespunde modelului |
llm | un model evaluează | Verdict favorabil la cel puțin 2 voturi din 3 |
baseline | un model evaluează | Rularea valorează cel puțin cât o transcriere de referință |
O subtilitate trebuie înțeleasă înainte de a interpreta o diferență: un verificator care impune apelarea skill-ului nu poate reuși niciodată fără plugin, așadar este exclus din scor în ambele variante și raportat doar ca indicator; altfel, diferența ar fi umflată artificial. Izolarea este strictă. Fiecare rulare este un proces-copil temporar, fără configurări ale utilizatorului, hook, CLAUDE.md, server MCP, plugin instalat sau memorie. Rulările nu solicită niciodată permisiunea, iar instrumentele sensibile sunt eliminate din sesiune în lipsa unei autorizări explicite; dacă Bash sau PowerShell este permis pe o mașină fără backend de sandbox, Claude Code refuză rularea în loc să o execute fără izolare. Un plugin care comunică cu instrumente MCP poate fi evaluat fără serviciul real, câte un fișier Markdown pentru fiecare instrument furnizând răspunsul, cu un bloc care abandonează rularea dacă pluginul trimite altceva decât ceea ce era prevăzut.
Evals call the model, so they use tokens and results vary. […] Your plugin’s hooks and MCP servers run as you, so only evaluate plugins you trust.
🇷🇴 Evaluările apelează modelul, deci consumă tokeni, iar rezultatele variază. […] Hook-urile și serverele MCP ale pluginului vostru rulează cu drepturile voastre, așadar evaluați numai pluginuri de încredere. — @ClaudeDevs pe X
Costul este real: fiecare execuție și fiecare verificator-evaluator reprezintă un apel de model dedus din abonament sau din factură, exemplul din documentație indicând 74 de secunde și 0,41 dolari pentru un caz cu șase rulări. De aici recomandarea echipei: testați mai întâi cu --runs 1, înainte de a lansa o rulare completă. În integrarea continuă, codurile de ieșire sunt documentate, inclusiv 0 când totul reușește și 2 pentru o rulare parțială atunci când este atins plafonul de cost. Prima constatare tipică, potrivit documentației, este o diferență apropiată de zero, cu verificatorul de skill eșuat: Claude nu alege skill-ul pentru o formulare naturală, iar descrierea acestuia trebuie refăcută.
🔗 Documentația evaluărilor de pluginuri
Restul versiunii 2.1.269
Subcomanda sosește în versiunea 2.1.269, publicată pe 11 septembrie la ora 21:17, ora Parisului. Restul noutăților este mai discret, dar util în activitatea zilnică. Comanda /output-style listează și schimbă stilul ieșirii, inclusiv prin Remote Control și în sesiunile cloud sau headless. Când instrumentul Bash este folosit pentru modificarea fișierelor, rezultatul său include acum diff-ul fișierelor modificate, oferindu-i din nou lui Claude aceeași vizibilitate ca în cazul unei editări clasice. În privința observabilității, o variabilă de mediu etichetează metricile și evenimentele OpenTelemetry în funcție de depozit, iar alte două reglează timpul de descoperire a modelelor unui gateway și limita agenților concurenți ai instrumentului Workflow, până la 256.
Corecțiile vizează trei zone sensibile: invalidarea parțială a cache-ului de prompt după un răspuns întrerupt și apoi reluat, regulile de permisiune care încep cu o negație și care se aplică acum numai sursei de configurări care le-a scris și verificarea căii de scriere, care acoperă în sfârșit fișierul scris de o comandă tee. git status comunicat după o compaction este acum cel actual, nu cel de la începutul sesiunii. În VS Code, o insignă deschide o hartă a subagenților, cu fișe, buton de oprire și transcrieri numai în citire, iar două casete de dialog permit gestionarea hook-urilor și a regulilor de permisiune în configurările utilizatorului, proiectului și locale.
Antigravity, patru versiuni într-o săptămână și o recuperare a restanțelor privind Teamwork
Google a publicat succesiv două versiuni ale interfeței sale în linie de comandă și o versiune nouă a aplicației, fără a mai număra două versiuni anterioare care nu au fost prezentate aici. Changelog-ul merită citit în ansamblu, deoarece livrările săptămânii spun aceeași poveste: agentul părăsește terminalul interactiv pentru a deveni un serviciu.
Antigravity CLI 1.2.0: CLI-ul devine un demon de fundal controlat prin Remote Control
10 septembrie — Versiunea 1.2.0 a Antigravity CLI este prima creștere a versiunii minore din iulie. Trei subcomenzi, remote-control start, status și stop, înregistrează interfața în linie de comandă în managerul de servicii al sistemului ca demon de fundal care supraviețuiește deconectărilor și repornirilor, cu o opțiune pentru numele instanței și alta pentru limitarea serviciului la sesiunea de conectare activă. Până acum trebuia lăsat deschis un terminal în execuție. Derularea cu jumătate de pagină se extinde la toate vizualizările prin două noi scurtături implicite. Dintre cele opt corecții, cea mai utilă pentru înțelegerea unui comportament neașteptat este aceasta: un prompt sau un răspuns blocat de filtrele de siguranță a conținutului afișează acum motivul explicit al opririi, acolo unde utilizatorul vedea înainte o eroare generică sau un schimb gol. Serverele MCP integrate în pluginuri globale se inițializează în sfârșit corect la pornire.
Antigravity CLI 1.1.28: reluări extinse după erori, mod fără interfață accelerat și citirea URL-urilor supusă aprobării
9 septembrie — Cu o zi înainte, versiunea 1.1.28 concentra nouă îmbunătățiri asupra rezilienței și modului fără interfață, cel apelat dintr-un script. Erorile tranzitorii ale API-ului modelului sunt reîncercate cu un backoff exponențial extins, pornirea nu mai declanșează o solicitare de rețea pentru citirea identității utilizatorului, iar la fiecare schimb sunt eliminate până la 200 de milisecunde de întârziere inactivă. Două schimbări de comportament merită atenția celor care automatizează.
| Schimbare de comportament | Înainte de versiunea 1.1.28 | Din versiunea 1.1.28 |
|---|---|---|
| Expirarea timpului în modul script | Eșec de timeout | Ieșire parțială returnată, cod de succes, avertisment |
| Citirea unui URL extern de către agent | Fără solicitare | Aprobare solicitată implicit, exceptând accesul preaprobat |
Prin urmare, un script care se baza pe acces web implicit trebuie să acorde explicit această permisiune. Solicitările de aprobare indică acum acțiunea exactă și adaugă un rând care precizează motivul atunci când cererea provine de la un hook sau de la un fișier aparținând altui proiect.
Antigravity CLI 1.1.26 și 1.1.27, recuperarea restanțelor: prompt punctual pe alt model și dependențe de subagenți în frontmatter
4 și 5 septembrie — Versiunile 1.1.26 și 1.1.27 acoperă decalajul și aduc cea mai concretă noutate a lotului: comanda de selectare a modelului acceptă acum un prompt, executat o singură dată pe un alt model înainte ca sesiunea să revină la modelul inițial. O a doua opinie de la un model mai puternic sau mai economic, fără modificarea configurării implicite. Aceeași versiune adaugă o listă de agenți în frontmatter-ul Markdown al agenților personalizați, pentru declararea subagenților de care depind, precum și două corecții importante pentru automatizări: un apel MCP care conține un argument nedeclarat de schema serverului este respins și corectat în loc să fie eliminat în tăcere, iar o execuție fără interfață enumeră acțiunile refuzate în ieșirea JSON în loc să le ignore fără nicio explicație.
Antigravity 2.13.0: secțiunea Documents, vizualizator virtualizat pentru SQL și JSONL și scurtături pentru citare
9 septembrie — Antigravity 2.13.0 aduce 16 îmbunătățiri și 16 remedieri. Fișierele externe adăugate unei conversații, linkurile Google Drive, PDF-urile și documentele Office sunt grupate într-o secțiune Documents deasupra Artifacts, în loc să se amestece cu rezultatele agentului. Fișierele ciornă pe care agentul le scrie pentru sine ajung într-o secțiune separată. Artefactele de cod și date, precum fișierele SQL și JSONL, se deschid într-un vizualizator virtualizat cu evidențiere sintactică și numere de linie, care rămâne fluid în cazul fișierelor mari și acceptă comentarii în linie. O întrebare laterală închisă se restrânge într-un buton în loc să fie ștearsă, solicitările interactive primesc un buton de anulare, iar textul selectat poate fi citat în chat printr-o scurtătură de la tastatură. Două remedieri vizează transparența permisiunilor: un pas refuzat rămâne vizibil cu eticheta Rejected în loc să dispară, iar agentul nu mai solicită din nou permisiunea de a citi artefactele altor proiecte atunci când accesul în afara proiectului este deja acordat.
🔗 Firul cu sfaturi al @antigravity pe X
Teamwork, recuperarea din 27 august
O postare publicată pe 27 august, despre care nu s-a scris niciodată aici și care se află încă în fruntea rubricii pentru dezvoltatori de pe pagina cu noutăți Gemini, merită recuperată. Teamwork este cadrul de orchestrare multi-agent al Antigravity, în care agenții își propun, critică și rafinează reciproc munca timp de ore sau zile, disponibil în versiune preliminară pentru toate planurile cu plată. Sunt furnizate cinci pattern-uri, selectate automat în funcție de prompt, de la programare iterativă și revizuirea documentelor până la demonstrații ample. Cu pattern-ul pentru demonstrații ample, Google anunță rezolvarea a șapte probleme deschise, inclusiv conjectura ciclurilor lui Knuth, pentru care au fost produse demonstrații de peste 40 și, respectiv, peste 70 de pagini, cea de 40 de pagini fiind verificată formal în Lean; celelalte rezultate au fost confirmate de experți umani, iar cinci articole au fost publicate pe arXiv.
| Măsură raportată | Valoare |
|---|---|
| TCSBench, Gemini 3.7 Flash și 3.1 Pro cu demonstrații ample | 71 la sută |
| TCSBench, Gemini 3.6 Flash și 3.1 Pro, articolul original | 67,7 la sută |
| Simulator RISC-V, eroare de aliniere a ciclurilor | 0,71 la sută |
| Probleme reproduse cu Gemini 3.7 Flash | 3 din 7 |
În afara matematicii, Teamwork a construit de la zero un simulator de procesor RISC-V cu execuție în afara ordinii, precis la nivel de ciclu, care pornește sistemul xv6 până la shell și execută peste o sută de benchmark-uri standard, validat prin comparație cu execuția hardware. Două contribuții au fost integrate în amonte în proiecte open-source: o cale rapidă vectorizată în Eigen și o variantă de tabel hash concurent cu un debit de inserare dublu la 64 de thread-uri.
🔗 Teamwork, când AI devine partener de cercetare
GitHub Copilot își rezolvă propriile comentarii și integrează Jira în aplicația sa
Revizuirea codului trece la un ansamblu de agenți
11 septembrie — GitHub actualizează Copilot code review pe două planuri. În ceea ce privește experiența, atunci când un commit ulterior răspunde unui comentariu Copilot, revizuirea rezolvă singură comentariul, astfel încât lista comentariilor deschise să conțină doar ceea ce încă așteaptă un răspuns; iar când este aplicată o sugestie de cod, Copilot redactează un mesaj de commit adaptat modificării, în locul mesajului completat în prealabil. În ceea ce privește analiza, agentul de revizuire dispune acum de întregul set de instrumente shell al SDK-ului Copilot, executate în spatele firewall-ului agentului: poate lansa o compilare, executa teste, rula un script specific sau interoga API-urile accesibile pentru a verifica acel cod pe care îl examinează. GitHub raportează mai multe reacții pozitive, mai multe constatări de severitate ridicată și mai puține observații de detaliu, fără a oferi cifre în această privință.
Nivelul de efort Lite nu se mai bazează nici el pe un singur agent, ci pe un ansamblu de agenți care contribuie fiecare cu propria analiză, reunite într-o singură revizuire.
| Constatare măsurată, revizuiri Lite în ansamblu | Variație anunțată |
|---|---|
| Comentarii luate în considerare, severitate ridicată | plus 47 la sută |
| Comentarii luate în considerare, severitate medie | plus 31 la sută |
| Comentarii luate în considerare, severitate scăzută | plus 11 la sută |
| Costul unei revizuiri | cu aproximativ 8 la sută mai mic |
Nu sunt precizate nici numărul agenților din ansamblu, nici modelele utilizate. Este a treia evoluție a Copilot code review în două săptămâni.
🔗 Jurnalul modificărilor GitHub
Jira în aplicație, HydraFusion în linia de comandă, VS Code 1.137
10 septembrie — Recapitularea săptămânală pentru săptămâna de 7 septembrie, cea a Copilot Day, aduce integrarea Jira în aplicația Copilot: tichetele sunt aduse într-un spațiu de lucru comun, se alege acolo ce va fi continuat, iar Copilot preia contextul tichetului în investigare, implementare și pregătirea pull request-ului. În Copilot CLI, Project HydraFusion poate fi acum selectat ca orice alt model și alege pentru fiecare sarcină un flux între modele locale, cloud și compuse, echilibrând performanța, costul și latența.
VS Code 1.137, lansat pe 9 septembrie, aduce trei funcții pentru agenți. Automatizările, în versiune preliminară publică, programează sarcini recurente pentru agenți în fiecare oră, zi sau săptămână, pornind de la modele furnizate, precum trierea issue-urilor sau căutarea bug-urilor. Modul vocal, experimental, permite conversația cu un agent în timp ce acesta lucrează, întreruperea sau redirecționarea lui. În cele din urmă, un link către un issue sau un pull request se deschide direct în fereastra Agents, chiar și fără un repository deschis. Notele de versiune adaugă o gazdă pentru agenți bazată pe un protocol dedicat și propulsată de SDK-ul Copilot, care aliniază comportamentul agentului VS Code cu cel din linia de comandă și din aplicație.
🔗 Recapitularea săptămânală Copilot
Habitat, infrastructura de stocare online a OpenAI și rescrierea sa în Rust de către doi ingineri
11 septembrie — OpenAI publică prima parte a unei postări tehnice despre Habitat, platforma de stocare online din spatele ChatGPT, API-ului și Codex. Cifrele arată amploarea: peste 70 de milioane de solicitări pe secundă, peste un miliard de persoane deservite în fiecare săptămână, aproape 40 de regiuni și peste 500 de petaocteți de date. Habitat a început la jumătatea anului 2024 ca o mică bibliotecă Python integrată în serverul principal ChatGPT, conectată la o bază de date gestionată, cu o idee simplă: inginerii de produs nu ar trebui să fie nevoiți să se gândească la schemă, rutare, autorizare sau pool-urile de conexiuni.
La jumătatea anului 2025, modelul de bibliotecă pe partea de client și-a atins limitele. Fiecare modificare de protocol impunea coordonarea implementărilor în zeci de servicii; o implementare a rutării regionale a durat zile, după care revenirea unui serviciu la un client cu bug-uri a provocat chiar incidentul pe care operațiunea trebuia să îl evite. Habitat a devenit un serviciu autonom, iar OpenAI a ales să rămână la Python, asumându-și deliberat o datorie tehnică și mizând pe faptul că propriile sale modele de cod vor face posibilă migrarea ulterioară.
Cea mai mare parte a postării descrie lupta împotriva latențelor de coadă la această scară: întârzierea de planificare din asyncio, care putea ajunge la sute de milisecunde, gestionată prin limitarea solicitărilor concurente per proces; parsarea configurațiilor reîmprospătate în fiecare minut fără decalaj aleatoriu, care bloca toți workerii simultan; și reutilizarea în ordine ultimul intrat, primul ieșit a conexiunilor unei biblioteci HTTP, care concentra traficul asupra proceselor deja lente, o defecțiune metastabilă remediată prin inversarea ordinii și apoi prin delegarea echilibrării către un service mesh. API-ul în sine este intenționat limitat, un model de obiecte și muchii fără interogări nelimitate sau join-uri, iar acest perimetru restrâns a permis utilizarea Python până la o asemenea scară.
| Metrică măsurată | Valoare anunțată |
|---|---|
| Solicitări pe secundă în prezent | Peste 70 de milioane |
| Persoane deservite în fiecare săptămână | Peste un miliard |
| Date furnizate | Peste 500 de petaocteți |
| Vârful serviciului Python | Peste 20 de milioane de solicitări pe secundă |
| Rescriere în Rust | Doi ingineri, Codex și GPT-5.5 |
| Proporția traficului deservit de Rust | 95 la sută din solicitările de producție |
| Câștig de eficiență pentru procesor și memorie | de 6 ori și de 15 ori |
În al doilea trimestru al anului 2026, doi ingineri au rescris întregul serviciu în Rust cu Codex și GPT-5.5. Serviciul Rust procesează 95 la sută din solicitările de producție, folosind de șase ori mai puțin procesor și de cincisprezece ori mai puțină memorie; Python va fi retras în următoarele săptămâni. A doua parte va aborda stratul de stocare.
🔗 Scalarea stocării pentru un miliard de utilizatori
OpenAI le cere utilizatorilor Codex să simplifice skills, AGENTS.md și prompt-urile
11 septembrie — Blogul pentru dezvoltatori al OpenAI publică un ghid de curățare destinat utilizatorilor Codex care trec la GPT-6 Astra. Constatarea inițială: un an de instrucțiuni acumulate pentru a ghida modelele anterioare devine o povară pentru un model mai capabil. În privința skills, mecanismul este concret: fiecare skill încarcă în context un nume și o descriere, iar când sunt prea multe, Codex scurtează aceste descrieri, astfel încât modelul vede mai puțin din fiecare și face alegeri mai puțin bune.
| Instrucțiune examinată | Recomandare pentru GPT-6 Astra |
|---|---|
| Descrierea unui skill | Scurtă, declanșator precis, nu un domeniu întreg |
| Structura unui skill cu mai multe fluxuri | Document-rădăcină redus la un router către documente și scripturi |
| Lecturi impuse în AGENTS.md | Un document per tip de modificare, nu o stivă de citit la fiecare editare |
| Instrucțiuni de testare | Inutile, modelul rulează singur testele |
| Finalul sarcinii | Definirea sensului lui „terminat”, autorizarea prealabilă a workflow-urilor sigure |
| Interdicții moștenite | De relaxat, altfel provoacă oprirea prematură |
Cel mai interesant aspect privește comportamentul modelului. OpenAI prezintă GPT-6 Astra ca fiind mai prudent decât predecesorul său în ceea ce privește sfera unei sarcini și susceptibil să revină pentru revizuire după o primă implementare. Răspunsul recomandat este definirea explicită a ceea ce înseamnă „terminat” și acordarea în avans a permisiunii pentru workflow-urile cunoscute ca fiind sigure, de exemplu o suită locală de teste cu fixtures de unică folosință. În schimb, barierele foarte stricte scrise pentru a limita modelele mai vechi îl pot determina acum să se oprească prea devreme. Postarea amintește și că skills dintr-un repository sunt citite de agenții celorlalți contribuitori, care rulează uneori pe alte modele: o instrucțiune utilă pentru aceștia îl poate constrânge excesiv pe Astra. Se încheie cu o sugestie practică: să i se ceară lui Astra să auditeze chiar el instrucțiunile proiectului. Skill-ul pentru crearea de skills a fost actualizat în acest sens.
🔗 Regândirea skills și prompt-urilor pentru GPT-6 Astra
ChatGPT Sites depășește 5 milioane de site-uri în trei luni
11 septembrie — Contul oficial ChatGPT face bilanțul ChatGPT Sites, funcția lansată cu trei luni înainte pentru construirea și găzduirea unor aplicații web complete pornind de la o conversație: de atunci au fost create peste 5 milioane de site-uri. Mesajul servește în principal la recapitularea a cinci evoluții care au trecut neobservate.
Două dintre ele privesc colaborarea. Prima permite invitarea colegilor să editeze, să salveze și să publice un site partajat; a doua permite deschiderea unui site pentru anumite persoane fără a-l face public. Celelalte trei privesc ciclul de viață al site-ului: trecerea de la prompt la implementare ar dura de două ori mai puțin, ChatGPT poate inspecta baza de date a site-ului la cerere, editorii având și ei acces la aceasta, iar site-ului îi poate fi asociat un domeniu personalizat. Contul pentru dezvoltatori a redistribuit anunțul, semn că funcția vizează și prototipurile rapide, nu doar paginile pentru publicul larg.
Together AI își extinde serviciul de fine-tuning la 17 modele deschise și aplică adaptoare experților
11 septembrie — Together AI își extinde serviciul de fine-tuning pe întregul parcurs al unui experiment. Șaptesprezece modele cu ponderi deschise intră în catalog, printre care GLM 5.3 și cele două versiuni anterioare ale sale, DeepSeek-V4-Flash, Kimi K2.7-Code și K2.6, familia Qwen cu 0,8 până la 35 de miliarde de parametri și Gemma 4. Compania menționează un scor de 88,2 pentru GLM-5.3 pe Terminal-Bench 2.1, la mai puțin de un punct de cele mai bune modele proprietare, potrivit acesteia.
Urmărirea experimentelor este a doua noutate: fiecare job înregistrează pierderea, norma gradientului și rata de învățare la fiecare pas, cu grafice actualizate în timpul execuției, posibilitatea de a suprapune mai multe job-uri pe același grafic și serii brute expuse prin API. Oprirea anticipată întrerupe antrenarea atunci când pierderea de validare stagnează, păstrează cel mai bun checkpoint în locul ultimului și rambursează pașii neutilizați.
Aspectul cel mai tehnic este Expert LoRA. Într-un model de tip amestec de experți (Mixture-of-Experts), peste 90 la sută dintre parametri se află în straturile experților, pe care adaptorul clasic le lasă înghețate, atașându-se doar atenției.
| Test pe 200 de fapte inventate | Adaptoare care includ experții | Adaptoare doar pentru atenție |
|---|---|---|
| Reamintirea noilor fapte | până la 89 la sută | 15 la sută |
| MMLU-Pro | 75,3 la sută | 71,5 la sută |
Explicația avansată este că, atunci când adaptoarele sunt limitate la atenție, o proporție tot mai mare dintre experții rutați devine neutilizată în timpul fine-tuning-ului. Procesarea datelor iese și ea din cutia neagră, printr-o previzualizare a rândurilor tokenizate, a ponderilor per exemplu și prin validarea completă a fișierului pe server imediat după finalizarea încărcării. Prețurile pentru antrenare scad cu 30 până la 70 la sută, în funcție de modele.
Contribuții ale comunității, un sandbox pentru fiecare încercare și o sută de puzzle-uri Zebra
Blogul comunității Hugging Face a publicat în aceeași zi trei lucrări care merită mai mult decât o știre scurtă și alte cinci care pot fi găsite mai jos.
Cum rulează treisprezece laboratoare RL pentru agenții lor
11 septembrie — Sergio Paniego analizează cincisprezece rapoarte de la treisprezece laboratoare, publicate între octombrie 2025 și septembrie 2026, reținând doar ceea ce declară fiecare că antrenează, nu ceea ce evaluează. Concluzia centrală: mediul nu mai este un simulator în memorie, ci o mașină completă, cu sistem de fișiere, shell și procese, pornită pentru o încercare și distrusă ulterior. Liquid AI face acest lucru pentru un model cu 2,6 miliarde de parametri, Cursor vorbește despre sute de mii de medii concurente pentru antrenarea modelului său, Microsoft provizionează un container nou pentru fiecare sarcină, iar Kimi K3 merge mai departe cu micromașini virtuale care pot fi reluate pentru traiectorii de un milion de tokeni.
| Strat al stivei | Ce păstrează laboratoarele | Echivalente publice citate |
|---|---|---|
| Sarcini și verificatoare | Peste 10 000 de medii de cod la GLM-5 | Environments Hub, verifiers, Harbor |
| Contract de acțiune, harness | Kimi instanțiază cinci harness-uri white-box | OpenEnv, SkyRL, BrowserGym, TextArena |
| Sandbox | Sute de mii de mașini virtuale per cluster | Modal, E2B, AgentENV, Hugging Face Sandboxes |
| Sistem de antrenare | slime la Zhipu, Forge la MiniMax, RLVR la NVIDIA | TRL, Miles v0.1 |
O tendință notabilă este că harness-ul devine el însuși mediul, fie reconstruit în mod white-box, fie lăsat intact și monitorizat în mod black-box. Transparența este foarte inegală: Ai2 documentează 17,2 milioane de eșantioane de cod verificate pentru OLMo 3, în timp ce OpenAI, Anthropic și Google nu publică aproape nimic, fișa de sistem a GPT-6 Astra rezumându-se la o singură frază. Autorul menționează un cost de peste zece milioane de dolari pentru un singur mediu în marile laboratoare. Articolul încheie seria Training Agents.
🔗 Un sandbox pentru fiecare rollout
O sută de puzzle-uri zebră stimulează raționamentul matematic
11 septembrie — Un articol al comunității, semnat de tamewild, relatează că un fine-tuning de câteva minute pe 100 până la 500 de puzzle-uri de deducție logică, fără niciun fel de date matematice, este suficient pentru a îmbunătăți spectaculos performanța modelelor de bază mici pe benchmark-uri de matematică.
| Model de bază antrenat | MATH-500 | AIME 2025 | Referință oficială comparată |
|---|---|---|---|
| Qwen 3 4B, 100 de puzzle-uri în 6 min 23 | 84,60 la sută | 21,67 la sută | Versiune post-antrenată: 84,80 și 19,10 |
| Granite 4.1 3B, 500 de puzzle-uri în 23 min | 77,73 la sută | 19,44 la sută | Versiunea Instruct: 66,60 și 6,67 |
| Qwen 3.5 9B, 500 de puzzle-uri în 40 min | 96,60 la sută | 60,67 la sută | Versiune post-antrenată: 97,40 și 60,56 |
Sunt măsurate și efectele structurale: pe cel mai mare dintre cele trei modele, lungimea mediană a răspunsurilor scade sub cea a modelului oficial, iar rata buclelor de repetiție la decodarea greedy scade de la 6,06 la 0,67 la sută. Autorul rămâne prudent, având în vedere că sunt rulări exploratorii cu un singur seed, și observă că propriile sale ablation studies arată că și un adaptor clasic ajunge la aproape 80 la sută pe MATH-500: generalizarea provine în primul rând din datele logice. Sunt publicate codul, notebook-urile, trei modele și două seturi de date.
🔗 Stimularea raționamentului cu 100–500 de puzzle-uri zebră
Un pipeline vocal pentru o limbă fără set de date
10 septembrie — Osmanov povestește construirea unui pipeline vocal complet pentru tătara crimeeană, o limbă amenințată, fără recunoaștere sau sinteză vocală, și prezintă o concluzie transferabilă: antrenarea a fost o eroare de rotunjire. Adaptorul de recunoaștere a necesitat 90 de minute pe procesorul grafic al unui laptop și a redus rata de eroare a cuvintelor de la 34,6 la 20,1 la sută, apoi la 17,0 cu o căutare beam care nu modifică nicio pondere. Aproape întregul calendar a fost consumat de construirea unui corpus inexistent și de verificarea faptului că evaluarea nu oferea rezultate înșelătoare.
Două alegeri merită reținute. Modelul de bază a fost ales pe baza unor presupuneri fonetice, nu a apropierii lingvistice: tătara crimeeană are un /q/ uvular absent din turcă, iar modelele de bază antrenate sub un identificator turcesc îl redau ca /k/, fără ca fine-tuning-ul să corecteze acest lucru. Iar în lipsa recunoașterii pentru inițializarea unui corpus, autorul a inversat problema folosind cărți audio al căror text este cunoscut, obținând 336 de minute utilizabile, față de numai 110 printr-o aliniere care devia. Cel mai util rezultat negativ este un platou al metricii: mărind corpusul de sinteză de la 5,9 la 15,3 ore, rata de eroare a caracterelor nu s-a modificat, deși ascultarea în orb prefera de fiecare dată vocea cea mai recentă. În final, documentează o scurgere de date clasică: 96,9 la sută dintre clipurile din cartea de test erau duplicate în datele de antrenare, lucru detectat prin n-grame de text, nu prin numele fișierelor.
🔗 Tehnologie vocală pentru o limbă fără set de date
Replit lansează Routines, pentru activități recurente care apelează agentul numai când este necesar
11 septembrie — Replit a prezentat Routines, o funcție care execută activități recurente după un program orar, zilnic sau săptămânal. Anunțul este interesant nu atât prin planificare, care este banală, cât prin modul în care compania abordează problema costurilor. Premisa este formulată direct: agenții pot automatiza acum majoritatea sarcinilor repetitive, dar rularea lor permanentă consumă nenumărați tokeni. Soluția constă în a nu plasa agentul în centrul buclei. Fiecare execuție începe cu cod determinist, iar agentul este invocat numai când raționamentul este cu adevărat necesar.
Această arhitectură contrazice tendința dominantă, care încredințează întregul ciclu unui model. Aici, modelul redevine o resursă apelată punctual, încadrată de cod obișnuit, al cărui comportament și cost sunt previzibile. Pentru o sarcină planificată care se repetă de sute de ori, diferența de cost nu este marginală. Anunțul nu a fost însoțit de un articol de blog.
Warp integrează Grok Build ca agent de prim rang
11 septembrie — Warp a anunțat suport integrat pentru Grok Build CLI, agentul de linie de comandă al SpaceX AI, iar contul Grok a redistribuit imediat vestea integrării. Funcționalitatea fusese deja livrată în versiunea din 9 septembrie a terminalului, unde changelog-ul o descrie drept suport de prim rang: Warp detectează sesiunile Grok Build, le aplică un aspect vizual dedicat în subsol și activează pentru ele modul de introducere îmbunătățit.
În practică, un utilizator Grok Build beneficiază de aceleași instrumente ca agenții nativi ai terminalului. Introducerea îmbunătățită acceptă prompturi lungi lipite și cursoare multiple, ceea ce schimbă situația pentru cei care redactează instrucțiuni de mai multe paragrafe. O comandă permite partajarea sesiunii curente a agentului pe un alt dispozitiv, iar exploratorul de fișiere și panourile de code review rămân accesibile în timpul sesiunii. Abonamentul Grok existent asigură accesul, fără să fi fost anunțate tarife sau limite specifice.
Adăugarea completează o listă deja bogată de agenți terți găzduiți în terminalul Warp, alături de Claude Code, Codex, Droid și Antigravity, și continuă o activitate începută mai devreme în cursul verii în jurul ecosistemului xAI, cu o comandă de conectare la un cont X Premium sau SuperGrok adăugată în august. Logica Warp rămâne aceeași de la lansarea agentului său: utilizatorul nu este limitat la un agent propriu, terminalul devenind locul în care toți agenții rulează cu aceeași calitate a integrării. Restul versiunii remediază două neajunsuri: prompturile introduse, dar netrimise, nu mai sunt șterse la schimbarea modelului, iar instrumentele MCP declarate într-un fișier global sunt disponibile încă de la primul răspuns al agentului.
🔗 Anunțul Grok pe X · 🔗 Anunțul Warp pe X
Vibe CLI 2.25.3, comanda de bifurcare și jurnale de sesiune private
11 septembrie — Mistral a publicat versiunea 2.25.3 a Vibe CLI, a treia versiune în trei zile. Noutatea vizibilă este comanda /branch: aceasta bifurcă conversația curentă într-o nouă sesiune care poate fi reluată, lăsând intactă sesiunea originală. Copia poate fi apoi reluată într-un alt terminal, permițând explorarea unei direcții alternative pornind de la același context, fără sacrificarea firului principal. Mențiunile de fișiere cu simbolul arond se bazează acum pe o descoperire care ține cont de Git și acceptă fișiere sau directoare lipite individual în prompt.
În privința remedierilor, sunt trei aspecte. Conversațiile păstrate rămân lizibile și își restaurează worktree-urile la reluarea activității. Noile jurnale de sesiune nu mai pot fi citite de ceilalți utilizatori ai sistemelor POSIX, o remediere a permisiunilor fișierelor în continuarea versiunii 2.25.1, care eliminase un listener de depanare neautentificat și făcuse astfel încât nicio eroare să nu conducă la aprobare automată. În cele din urmă, instrucțiunile din fișierul AGENTS.md sunt acum încărcate în promptul de sistem în cadrul harness-ului unificat experimental. Release-ul este însoțit de paisprezece arhive binare; nicio notă nu menționează o schimbare de model sau de tarif.
🔗 Notele versiunii Vibe CLI 2.25.3
Synthesia își transformă agentul de conformitate într-o infrastructură partajată
10 septembrie — Nicolás Barberis, responsabil pentru operațiunile de încredere la Synthesia, publică continuarea articolului său din iunie despre agentul care colectează dovezi de conformitate. Întrebarea care a ghidat reproiectarea a venit de la cititori: de îndată ce un agent colectează dovezi pentru audit, colectarea intră în sfera auditului și trebuie să existe încredere în colector. Răspunsul constă în patru alegeri arhitecturale, toate transferabile.
Mai întâi, separarea mecanismului de metodă. Codul se află într-un repository intern și este modificat prin pull request, cu un fișier de proprietari care impune o verificare umană; procedurile pentru fiecare categorie de control se află într-un spațiu documentar, scrise și validate de proprietarii controalelor. Scriptul inițial, cu URL-uri hardcodate, a devenit o competență partajată, pe care un coleg o instalează printr-o singură comandă. Apoi, limitarea browserului: agentul nu interacționează niciodată cu browserul utilizat zilnic, copiază sesiunea într-un profil de unică folosință, rulează cu roluri read-only atunci când acestea există și se oprește în fața unui obstacol de autentificare, în loc să-și ridice privilegiile. Proveniența este integrată prin construcție, fiecare captură fiind creată împreună cu URL-ul sursă, marcajul temporal, operatorul și amprenta criptografică a octeților exacți. În final, responsabilitatea umană: agentul salvează ca schiță și nu trimite niciodată.
| Rezultat măsurat | Valoare |
|---|---|
| Ședințe de revizuire a dovezilor cu auditorul | Cu 60 la sută mai puține |
| Nou cadru de referință procesat | aproximativ 500 de controale |
| Durata obișnuită pentru un astfel de cadru | 4 până la 6 luni |
| Durata obținută | câteva săptămâni |
Baza de cunoștințe se dezvoltă autonom, exclusiv prin adăugare: după fiecare execuție, agentul înregistrează URL-urile corectate și blocajele datate, precum defectarea unei interfețe de control al browserului cu o versiune recentă de Chrome, ocolită prin adresarea directă către protocolul de depanare. Synthesia anunță că instrumentul evoluează către o platformă de guvernanță asistată de AI și ia în considerare publicarea codului componentelor sale centrale.
HeyGen explică cele 16 secunde dintr-o singură filmare pentru The Furniture Unboxing
11 septembrie — HeyGen a publicat making-of-ul unui videoclip de 16 secunde în care un bărbat așază o cutie în centrul unei încăperi goale din beton, pleacă, iar cutia explodează și eliberează un living complet, care se așază la locul său. Fără 3D, fără compositing, fără nimic în postproducție: două imagini statice, un avatar și un prompt. Echipa a verificat absența tăieturilor în toate cele 390 de cadre, cea mai mare variație dintre două cadre consecutive corespunzând exploziei propriu-zise.
Metoda se bazează pe cele două imagini de referință. Prima prezintă încăperea goală, într-un cadru larg și fix, cu centrul podelei liber. A doua este aceeași imagine editată pentru a adăuga mobilierul, nu o nouă randare a unei încăperi asemănătoare: aceeași poziție a camerei, aceeași optică, aceeași lumină, aceeași umbră pe beton. Aceasta este regula care menține coerența efectului, deoarece modelul trebuie să inventeze doar partea de mijloc.
| Parametrul videoclipului | Valoare |
|---|---|
| Durata solicitată în prompt | 15 secunde |
| Durata livrată | 16,27 secunde |
| Rezoluție și frecvență | 1920x1080, 23,976 cadre pe secundă |
| Cadre fără tăietură | 390 |
| Intrări | 2 imagini statice, 1 avatar, 1 prompt |
Promptul este scris ca o listă de cadre temporizată, nu ca o descriere, cu o pauză deliberată înaintea exploziei. Șase elemente îl susțin: reperele temporale, această pauză, referințele denumite după rol, mobilierul enumerat piesă cu piesă, identitatea definită prin negație și permisiunea de a exagera, fără de care modelul respectă volumul real al unei cutii. Observațiile din practică sunt utile: modelul a livrat 16,27 secunde în loc de 15, o explozie mai rapidă decât cea descrisă și un cadru menținut asupra încăperii finisate pe care nimeni nu îl solicitase, considerat de echipă cel mai bun moment al montajului. De aici recomandarea de a indica timpii pentru a stabili ritmul și ordinea, apoi de a realiza montajul după ritmul livrat. Sunetul s-a schimbat între două treceri, versiunea aproape silențioasă făcând loc unui fundal sonor continuu, deoarece un videoclip fără sunet redat automat pare să aibă sunetul defect.
🔗 Cum am realizat The Furniture Unboxing
Nemotron 3 Embed 8B ocupă primul loc în benchmark-ul Q2D-Web
10 septembrie — NVIDIA anunță că Nemotron 3 Embed 8B, modelul său de embeddings cu 8 miliarde de parametri, ocupă primul loc în Q2D-Web pentru scorul combinat nDCG@10. Q2D-Web este benchmark-ul publicat cu o zi înainte de Perplexity pentru evaluarea căutării documentare în sistemele de retrieval-augmented generation controlate de agenți: cuprinde 190 de milioane de documente web și aproape 70 000 de interogări reformulate de agenți, distribuite în 10 limbi.
Rezultatul contează din două motive. Benchmark-ul reproduce condițiile reale ale unui agent care își reformulează interogările înainte de a consulta un index, lucru pe care evaluările clasice ale embeddings nu îl măsoară. Iar un model open source de această dimensiune, care domină un clasament multilingv, devine un candidat credibil pentru pipeline-uri auto-găzduite, în comparație cu embeddings proprietare. NVIDIA nu publică scorul numeric; clasamentul complet poate fi consultat la Perplexity.
Marketing ops as code, evenimente gestionate dintr-un issue GitHub
11 septembrie — Tomoko Tanaka, responsabilă regională de marketing GitHub pentru Japonia și Coreea și fostă ingineră, descrie cum a automatizat întregul ciclu al evenimentelor sale fără să scrie ea însăși codul: și-a redactat procedurile și le-a încredințat lui Copilot, automatizarea dezvoltându-se prin conversație.
Trei primitive susțin sistemul. Formularele de issue captează câmpurile structurate ale unui eveniment, câte un formular pentru fiecare tip. Label-urile servesc drept comutatoare, un label declanșând un workflow. GitHub Actions face treaba: citește câmpurile, duplică prin API-ul platformei pagina unui eveniment anterior, generează linkurile de urmărire pentru fiecare canal, produce e-mailul de invitație comis în repository, deschide issue-uri de solicitare către echipele vizate și completează tabelele de proiect. Un workflow programat filtrează în fiecare dimineață persoanele înscrise. Singura condiție prealabilă, scrie ea, este accesul programabil la instrumente, printr-un API sau chiar printr-un simplu client în linie de comandă.
Planificarea începe printr-o conversație cu Copilot, încadrată de un fișier AGENTS.md la rădăcina repository-ului, care stabilește regulile de denumire, corespondența trimestrelor fiscale și fusul orar pentru fiecare regiune. Conversația a avut loc inițial în terminal, apoi în aplicație, ceea ce a redus condiția prealabilă de la „se descurcă într-un shell” la „știe să tasteze”. Etapa de după eveniment încape în două comenzi, care sunt skill-uri de agent redactate în proză, adăugate prin pull request și verificate prin intermediul unui fișier de proprietari înainte de merge: echipa de marketing obține un proces de aprobare fără să construiască nimic. Un comutator de simulare, stocat într-o variabilă a repository-ului, execută fiecare workflow în gol. Eșecul recunoscut merită citit: workflow-ul matinal de filtrare a eșuat cândva în tăcere timp de cinci zile înainte ca cineva să observe listele învechite, de unde și recomandarea ca fiecare sarcină programată să aibă un mijloc de a se plânge zgomotos.
Boris Cherny răspunde despre codul de unică folosință și codul de producție
11 septembrie — Boris Cherny, care conduce Claude Code la Anthropic, publică răspunsul trimis unui dezvoltator al cărui e-mail avea subiectul „What to do about slop?”. Autorul, aflat de doisprezece ani în aceeași companie, descrie două tabere apărute în echipa sa odată cu dezvoltarea agentică. În prima, codul rămâne asemănător cu cel de dinainte, doar că este produs mai repede: poate că nu se mai recitește totul, dar trebuie să rămână ușor de recitit, persoana care îl trimite trebuie să-l poată explica, iar mentenanța sa trebuie să fie la fel de ușoară ca înainte. În a doua, codul este o cutie neagră căreia i se verifică doar rezultatul.
Răspunsul se rezumă la două reguli. Prototipurile și codul de unică folosință pot fi tratate complet ca niște cutii negre dacă urmează să fie aruncate și dacă raza de impact (blast radius) a unei defecțiuni este redusă. În schimb, codul de producție scris de Claude trebuie să îndeplinească un standard mai înalt decât dacă ar fi fost scris de un om. La Anthropic, aceasta înseamnă numeroase reguli de lint, numeroase teste, teste end-to-end conduse de Claude, fuzzere care rulează zilnic și verificări automate de cod și de securitate. Fără aceste mecanisme de protecție, avertizează el, se ajunge la o dezordine dificil de întreținut.
Urmează o listă de soluții, în ordine, pentru cazurile în care codul produs nu atinge standardul: trecerea la cel mai recent model de frontieră, creșterea efortului de raționament, investiții în CLAUDE.md și în skill-uri pentru a-l învăța succint pe Claude cum să lucreze în codebase. Dacă nimic nu funcționează, trebuie ghidat mai îndeaproape, pus să reducă datoria tehnică acumulată sau așteptat următorul model. Firul de răspunsuri a consacrat formularea cel mai des reluată: standardul de code review trebuie să urmeze raza de impact, nu autorul codului; un script de unică folosință poate fi expediat rapid, dar orice atinge bani sau identificatori trebuie citit linie cu linie. Boris Cherny a răspuns „Exactly”.
Pe scurt
- Amp adaugă un buton care reorganizează commit-urile unui fir — un singur gest transformă commit-urile intermediare ale unui agent, corecțiile succesive și revenirile sale într-o serie ușor de urmărit pentru code review. Sunt menționate trei utilizări: împărțirea unui diff mare în fragmente logice, curățarea înainte de merge sau gruparea commit-urilor mici asociate. Conținutul final al fișierelor rămâne strict identic. 🔗 sursă
- Amp publică al patrulea episod din sezonul 2 al Raising an Agent — Quinn Slack și Thorsten Ball pornesc de la întrebarea la ce mai folosește acum computerul pentru a analiza ce fac agenții dincolo de producerea codului, revenind și asupra unor defecțiuni recente. 🔗 sursă
- v0 face conversațiile echipei vizibile în mod implicit — conversațiile noi dintr-un spațiu de lucru partajat devin vizibile echipei, cu trei niveluri configurabile de proprietar (privat, vizualizare, modificare). Conversațiile existente își păstrează vizibilitatea. Trecerea spre mai multă deschidere nu este niciodată neutră într-un instrument în care utilizatorii lipesc adesea fragmente de date în timpul prototipării. 🔗 sursă
- Audiyo face Stable Audio Open să încapă pe un GPU de 8 GB — o bibliotecă Python și un instrument în linie de comandă reduc vârful de memorie video de la 13,8 la 5,86 GB, adică cu 57,5 la sută, folosind patru presetări măsurate pe un Tesla T4. Echipa și-a validat mai întâi munca pe procesor cu un model substitutiv de 5,38 milioane de parametri, ceea ce i-a permis să identifice patru bug-uri înainte de a folosi un GPU. 🔗 sursă
- Consent All the Way Down, o arhitectură de consimțământ pentru un consiliu de modele deschise mici — eseu semnat de o instanță Claude dintr-un consiliu de optsprezece modele cu cel mult 7 miliarde de parametri, care funcționează continuu din mai pe trei sisteme destinate publicului larg. Fiecare sursă este un canal a cărui profunzime este aleasă de model și nimic în afară de acesta nu scrie în starea sa. Partea cea mai sinceră este auditul îndreptat împotriva autorilor înșiși: cutia poștală era defectă din iunie, iar 213 scrisori se acumulaseră. 🔗 sursă
- Nu există o cursă a înarmării, există un război al browserelor — eseu de opinie potrivit căruia modelul lingvistic devine o marfă, indiferent dacă ponderile sunt secrete sau nu, iar avansul liderilor se măsoară în săptămâni. Autorul menționează suspendarea timp de 18 zile a Fable 5 în această vară, perioadă în care restul sectorului a continuat să funcționeze. Teza sa: valoarea se va muta către contextul acumulat în jurul utilizatorului, așa cum marcajele și extensiile i-au păstrat pe utilizatorii Chrome. 🔗 sursă
- De la barge-in la controlul conversației, gestionarea întreruperilor vocale în condiții de incertitudine — Eric Mey înlocuiește întreruperea distructivă cu un controler al schimbului de replici bazat pe acțiuni reversibile, cu o cale separată pentru fragmentele ambigue și o regulă de precedență între oprirea urgentă și eliminarea ecoului. Lecția despre testare merită reținută: o suită verde ascundea o pauză reversibilă înregistrată, dar niciodată apelată, deoarece o poartă verde autorizează doar ceea ce a examinat. 🔗 sursă
- Aiden separă modelul vocal în timp real de agentul care execută sarcinile — un model vocal full-duplex susține conversația în timp ce un model mai puternic, ancorat vizual, execută în fundal sarcinile de control al dispozitivului, cele două fiind coordonate printr-o coadă asincronă. Patru detalii contează: distincția dintre finalizat și reușit, agregarea notificărilor pe 500 de milisecunde, transmiterea stării prin mesaje adăugate pentru păstrarea cache-ului și execuția strict serială. 🔗 sursă
- GPT-Live-1 efectuează apelurile pentru rezervări Yelp — la o zi după sosirea modelului în API, OpenAI prezintă un prim client într-un caz în care scriptul nu este niciodată suficient: apelantul întrerupe, adaugă o constrângere sau se răzgândește în mijlocul frazei, iar modelul continuă să asculte în timp ce vorbește. Videoclip demonstrativ, fără volume sau rezultate cuantificate. 🔗 sursă
- Verificarea muncii agentului cu panourile diff, terminal și browser — un nou episod din seria pentru începători realizată de Kayla Cinnamon despre aplicația Copilot, dedicat celor trei panouri integrate și unui instrument care permite selectarea unui element al paginii pentru a-l ajusta împreună cu agentul. Articolul rezumă bucla în trei întrebări care trebuie puse înainte de acceptarea codului: ce s-a schimbat, rulează și funcționează cu adevărat? 🔗 sursă
- Pagina de pull requests a unui repository este reproiectată — previzualizare publică pentru toți: asistență la introducerea filtrelor, căutare cu operatori booleeni și interogări imbricate, bară laterală pliabilă, mod compact și mai mult context pe fiecare rând. Limitări cunoscute la lansare: milestone-urile nu sunt afișate, nu există actualizare în lot, iar vizualizările personalizate nu pot fi salvate. 🔗 sursă
- GPT-5.6 Sol cu o reducere de 30 la sută în Copilot — pentru abonații Pro+ și Max, până pe 13 septembrie, la ora 0 UTC. Mesajul nu precizează cărui multiplicator de cereri premium îi corespunde reducerea. O promoție de weekend, imediat după Copilot Day, pentru modelul care apărea în aceeași zi în mai multe comparații de costuri. 🔗 sursă
- Concurs GitHub Copilot Day, trei credite de câte 100 de dolari — participanții trebuie să creeze ceva cu aplicația Copilot sau cu clientul său în linie de comandă și să distribuie public rezultatul cu hashtag-urile indicate până cel târziu pe 13 septembrie, la ora 23:59, ora Pacificului. Trei câștigători, fiecare primind un credit de 100 de dolari pentru magazinul GitHub; participarea este gratuită și rezervată adulților. 🔗 sursă
- Runway poate fi folosit în ChatGPT cu Astra — demonstrarea unui flux complet gestionat din conversație: imagine de stil în Runway, animație în Blender, randare finală cu Seedance 2.5. Punctul tehnic de intrare rămâne serverul MCP al Runway Dev prezentat pe 2 septembrie. Interesul constă în înlănțuirea unor instrumente eterogene sub controlul unui singur agent. 🔗 sursă
- Runway publică studiul de caz VOIDZ — un artist anonim de realitate mixtă, activ din 2018, trece de la secvențe de 10–15 secunde la un film de 95 de secunde cu 15 intervenții suprarealiste grefate pe o cursă reală la magazinul alimentar. Majoritatea efectelor prelungesc o secvență existentă, câteva secunde de material documentar servind drept punct de pornire. Producția este anunțată ca fiind de 10 ori mai rapidă; artistul estimează că aceeași muncă ar fi durat între șase luni și un an în 3D tradițional. 🔗 sursă
- Runway adaugă vorbitori la AI Summit — un nou val pentru evenimentul de o zi din San Francisco, cu directorul de cercetare de la Wayve în prim-plan, ceea ce confirmă extinderea programului către vehiculele autonome, începută la sfârșitul lunii august. 🔗 sursă
- NVIDIA difuzează From Video to Voice, 33 de minute despre TensorRT Model Connect — retransmisie dedicată instrumentului prezentat la sfârșitul lunii august, care implementează un model deschis de la checkpoint la inferență în două comenzi, de la modele video la modele vocale. Conținut de instruire, nu un anunț. 🔗 sursă
- Suno își prelungește cu două zile perioada v6 fără credite — cele 48 de ore anunțate cu o zi înainte devin patru zile, însoțite de un fir de recomandări care sugerează pornirea de la o atmosferă, nu de la un gen, în modul simplu. Cu o zi înainte, un ghid de tranziție îi viza pe utilizatorii care reveneau la modelele mai vechi pentru variația și textura lor, semn că migrarea nu este evidentă pentru întreaga bază de utilizatori. 🔗 sursă
- Synthesia permite crearea avatarurilor pornind de la un prompt — prezentatori realiști, mascote de brand sau personaje stilizate, descrise printr-un prompt text ori configurate printr-un panou de control, ca alternativă la catalog. Anunț într-un singur tweet, fără link, la o zi după lansarea unui nou model de avatar; nu sunt precizate nici abonamentele vizate, nici modelul utilizat. 🔗 sursă
- GPT-6 Astra Challenge deschide înscrierile — participanții trebuie să construiască ceva cu Astra și să-și lanseze proiectul pe Product Hunt pe 18 septembrie. Cele mai bune cinci lansări primesc fiecare credite API în valoare de 10.000 de dolari și un an de ChatGPT Pro pentru cel mult doi membri ai echipei. A treia inițiativă comunitară în jurul Astra într-o săptămână. 🔗 sursă
- Cheile API de proiect OpenAI pot expira — o dată de expirare poate fi definită la creare, iar administratorii pot impune o durată maximă de viață la nivelul organizației sau al proiectului, fiecare cheie nouă trebuind apoi să expire în acel interval. Completarea firească a rotației cheilor, de activat în organizațiile care lasă chei uitate prin scripturi. 🔗 sursă
Ce înseamnă acest lucru
Firul cel mai clar al zilei este cel arhitectural: modelul unic cedează locul compoziției. Cursor plasează un coordonator care nu scrie cod deasupra a mii de subagenți, Cognition pune două modele să lucreze în tandem, cu roluri distincte și contexte separate, Sakana direcționează fiecare sarcină către cel mai ușor model capabil să o rezolve, GitHub înlocuiește un singur recenzor cu un ansamblu de agenți ale căror constatări le combină, iar Google îi pune pe agenți să propună, să critice și să rafineze reciproc timp de zile întregi. Cinci companii, cinci implementări, aceeași convingere: câștigul nu mai provine dintr-un model mai mare, ci din modul în care mai multe modele își împart munca. Detaliul tehnic comun Cognition și Aiden este revelator, ambele insistând asupra păstrării cache-ului de prompt, adică asupra faptului că adevăratul cost al unei arhitecturi depinde de ceea ce se evită să fie retransmis.
Al doilea fir privește modul în care sunt vândute aceste capabilități. Runway acordă anual licențe pentru ponderi închise, împreună cu checkpoint-urile, scriptul de antrenare și cercetători trimiși la sediul clientului, opunând în mod direct această ofertă ponderilor deschise. OpenAI scoate un model specializat din previzualizarea de cercetare, cu o grilă publică și o dată de începere a facturării. ElevenLabs acordă dreptul de proprietate asupra pieselor pentru toate abonamentele, inclusiv cel gratuit, și leagă permisiunile de piesă, nu de abonament. Together își reduce prețurile pentru antrenare cu 30 până la 70 la sută. Cognition propune chiar schimbarea unității de măsură și evaluarea unei perechi model-harnașament după prețul per sarcină, în locul prețului per token. Aceste evoluții merg în aceeași direcție: întrebarea adresată clientului nu mai este ce model dorește, ci sub ce formă juridică și cu ce unitate de facturare.
În privința instrumentelor, ziua marchează o trecere de la declarativ la măsurat. Anthropic livrează o comandă care reexecută fiecare caz de testare fără plugin pentru a demonstra, prin cifre, că instrumentul este util, iar prima constatare tipică este o diferență nulă. OpenAI le cere utilizatorilor să elimine instrucțiunile acumulate, deoarece acestea dăunează acum unui model mai capabil. Replit și VS Code lansează aproape simultan planificarea sarcinilor recurente, în cazul Replit existând un principiu explicit: începe cu cod determinist și apelează agentul numai atunci când este necesar raționamentul. Boris Cherny oferă regula de disciplină care lipsește ansamblului, făcând ca nivelul de exigență să depindă de raza de impact, nu de autorul codului. După doi ani de acumulare de contexte, skills și fișiere de instrucțiuni, sectorul începe să le măsoare costul.
Rămâne infrastructura, unde cifrele spun o poveste mai puțin spectaculoasă și mai instructivă. Doi ingineri rescriu în Rust, cu Codex, serviciul de stocare care gestionează peste 70 de milioane de cereri pe secundă, folosind de șase ori mai puțin procesor; datoria Python asumată la jumătatea anului 2025 este stinsă într-un trimestru. În același timp, analiza Hugging Face arată că antrenarea prin întărire a agenților consumă acum o mașină completă pentru fiecare încercare, cu bugete pentru medii care depășesc zece milioane de dolari și o transparență invers proporțională cu dimensiunea laboratorului. Iar un eseu al comunității susține că nimic din toate acestea nu constituie un avans durabil, deoarece diferența dintre lideri se măsoară în săptămâni. Faptele zilei nu tranșează disputa, dar oferă un indiciu: diferențierea se deplasează către contextul acumulat, harnașament și infrastructură, cu alte cuvinte către ceea ce nu poate fi distilat.
Surse
- Cursor, Projects
- Cursor pe X, anunțul Projects
- OpenAI Developers pe X, GPT-Rosalind
- Jurnalul de modificări al API-ului OpenAI
- Runway, Model Licensing
- Runway pe X, Model Licensing
- Cognition, Fusion local
- Cognition pe X, Fusion în Devin Desktop și CLI
- Sakana AI, Fugu Max și Fugu Ultra v2
- Sakana AI pe X, anunțul Fugu
- ElevenLabs pe X, Music v2.5
- ElevenLabs, articolul despre Music v2.5
- Claude Developers pe X, claude plugin eval
- Anthropic, documentația evaluărilor pluginurilor
- Claude Developers pe X, costul și fiabilitatea evaluărilor
- Claude Code, notele versiunii 2.1.269
- Google, jurnalul de modificări Antigravity
- Antigravity pe X, fir de sfaturi
- Antigravity, Teamwork
- GitHub Changelog, recenzia codului cu Copilot
- GitHub Changelog, retrospectiva Copilot din 7 septembrie
- OpenAI, Habitat și trecerea la un miliard de utilizatori
- OpenAI, regândirea skills și a prompturilor pentru GPT-6 Astra
- ChatGPT pe X, bilanțul Sites
- Together AI pe X, fine-tuning extins
- Hugging Face, un sandbox pentru fiecare încercare
- Hugging Face, raționament și puzzle-uri zebră
- Hugging Face, vorbire pentru o limbă fără set de date
- Replit pe X, Routines
- Warp pe X, suport pentru Grok Build
- Grok pe X, Grok Build în Warp
- Mistral, notele versiunii Vibe CLI 2.25.3
- Synthesia, cine auditează colectorul
- HeyGen, cum am realizat The Furniture Unboxing
- NVIDIA pe X, Nemotron 3 Embed 8B
- GitHub, operațiuni de marketing sub formă de cod
- Boris Cherny pe X, ce trebuie făcut cu codul neglijent
- Amp, reorganizarea modificărilor
- Amp pe X, Raising an Agent
- v0, jurnalul de modificări
- Hugging Face, Audiyo
- Hugging Face, Consent All the Way Down
- Hugging Face, nu există nicio cursă a înarmării
- Hugging Face, de la barge-in la controlul vorbirii
- Hugging Face, în interiorul Aiden
- OpenAI Developers pe X, GPT-Live-1 la Yelp
- GitHub, aplicația Copilot pentru începători
- GitHub Changelog, pagina reproiectată a pull request-urilor
- GitHub pe X, reducere pentru GPT-5.6 Sol
- GitHub pe X, concursul Copilot Day
- Runway pe X, Runway în ChatGPT cu Astra
- Runway, studiul de caz VOIDZ
- Runway pe X, vorbitorii de la AI Summit
- NVIDIA pe X, From Video to Voice
- Suno pe X, prelungirea perioadei v6
- Synthesia pe X, avatare personalizate
- OpenAI Developers pe X, GPT-6 Astra Challenge