खोजें

Cursor ने Projects और उसका समन्वयक एजेंट लॉन्च किया, GPT-Rosalind शोध पूर्वावलोकन से बाहर आया, Runway ने अपने बंद मॉडल वेट्स को लाइसेंस के अंतर्गत उपलब्ध कराया

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Cursor ने Projects और उसका समन्वयक एजेंट लॉन्च किया, GPT-Rosalind शोध पूर्वावलोकन से बाहर आया, Runway ने अपने बंद मॉडल वेट्स को लाइसेंस के अंतर्गत उपलब्ध कराया

ai-powered-markdown-translator

लेख का fr से hi में अनुवाद gpt-5.6-sol के साथ किया गया।

GitHub पर प्रोजेक्ट देखें ↗

बावन घोषणाएँ, जिनमें से अधिकांश 11 सितंबर को प्रकाशित हुईं, और उन पक्षों के बीच एक ही विचार बार-बार उभरता दिखा जो आपस में बात तक नहीं करते। Cursor एक पूरा प्रोजेक्ट ऐसे समन्वयक एजेंट को सौंपता है जो स्वयं कोड नहीं लिखता और हजारों उप-एजेंटों को काम बाँटता है, Cognition डेवलपर की मशीन पर दो मॉडलों को जोड़ी में चलाता है, और Sakana प्रत्येक कार्य को उसे हल कर सकने वाले सबसे हल्के मॉडल तक पहुँचाता है। उसी दिन OpenAI ने अपने जीवन-विज्ञान मॉडल को सार्वजनिक मूल्य-सारणी के साथ शोध पूर्वावलोकन से बाहर निकाला, Runway ने अपने बंद मॉडल वेट्स को कंपनियों के लिए लाइसेंस के अंतर्गत उपलब्ध कराया, और Anthropic ने एक ऐसा उप-कमांड प्रकाशित किया जो अंततः यह मापता है कि कोई plugin वास्तव में कितना लाभ देता है।


Cursor ने Projects लॉन्च किया, समन्वयक एजेंट द्वारा संचालित प्रोजेक्ट

10 सितंबर — Cursor ने Projects लॉन्च किया है, जो एडिटर में किसी एजेंट को काम सौंपने के तरीके का नया स्वरूप है। यह उत्पाद पिछले दो वर्षों से स्थापित आदत को तोड़ता है: प्रत्येक कार्य के लिए नई बातचीत खोलकर फिर उसे बंद करने के बजाय, उपयोगकर्ता ऐसे समन्वयक एजेंट से एक ही संवाद-श्रृंखला में बात करता है जो महीनों तक चलती रहती है। यह समन्वयक कोड की एक भी पंक्ति नहीं लिखता। वह इसे लिखने वाले दूसरे एजेंटों का निर्देशन करता है, जिससे काम आगे बढ़ते समय भी वह निर्देश प्राप्त करने के लिए हमेशा उपलब्ध रहता है।

तीन तंत्र इसे संभव बनाते हैं। पहला है डिफ़ॉल्ट रूप से cloud में निष्पादन: प्रत्येक Project अपनी अलग मशीन पर चलता है, लैपटॉप बंद करने से वह रुकता नहीं है और समानांतर उप-एजेंटों की संख्या अब स्थानीय हार्डवेयर द्वारा सीमित नहीं रहती। जब किसी परीक्षण को डेवलपर की मशीन पर चलाने की आवश्यकता होती है, तब एक स्थानीय एजेंट शुरू होता है। इसके बाद आता है साझा संदर्भ: प्रत्येक Project सभी मशीनों पर समकालित फ़ाइलों का एक समूह बनाए रखता है, जहाँ एजेंट अपने शोध, artefacts और कोड के बारे में अपनी समझ जमा करते हैं। यदि उनमें से कोई यह पता लगाता है कि किसी सेवा का परीक्षण कैसे करना है, तो बाद के सभी एजेंटों के पास वह प्रक्रिया उपलब्ध रहती है। तीसरा तंत्र सबसे असामान्य है। Cursor इसे subscriptions कहता है: समन्वयक किसी Slack चैनल की निगरानी कर सकता है, समय-सारणी के अनुसार चल सकता है या continuous integration की मरम्मत के लिए सभी pull requests पर नज़र रख सकता है। एजेंट किसी संकेत का पता लगते ही कार्य करता है, उससे कहे जाने की प्रतीक्षा किए बिना।

मापी गई उपयोगकर्ता श्रेणीpull requests पर मापा गया प्रभाव
Projects के नए उपयोगकर्ता30 प्रतिशत अधिक merge
मुख्यतः Projects में काम करने वाले उपयोगकर्ताछह गुना अधिक merge
आंतरिक design system का Projectअनुमानतः प्रतिदिन 20 से 100 pull requests प्रभावित

The coordinator doesn’t write code itself but directs other agents that do. Because it delegates rather than executes, it is never blocked and is always responsive to direction.

🇮🇳 समन्वयक स्वयं कोड नहीं लिखता, वह ऐसा करने वाले दूसरे एजेंटों का निर्देशन करता है। क्योंकि वह स्वयं निष्पादित करने के बजाय काम बाँटता है, इसलिए वह कभी अवरुद्ध नहीं होता और निर्देशों के लिए हमेशा उपलब्ध रहता है।Cursor, Projects ब्लॉग

ये आंतरिक माप हैं, जिन्हें उचित सावधानी के साथ पढ़ा जाना चाहिए। सबसे स्पष्ट उदाहरण gardening का है, जो Cursor द्वारा कभी समाप्त न होने वाले काम को दिया गया नाम है: एक इंजीनियर design system को समर्पित Project चलाता है, जो प्रत्येक नई pull request की जाँच करता है, उसमें से system में स्थान पाने योग्य components निकालता है और जब भी वही गलती दूसरी बार दिखाई देती है, एक lint नियम जोड़ देता है। Projects बीटा में है और 10 सितंबर से धीरे-धीरे उपलब्ध कराया जा रहा है। घोषणा में न तो मूल्य-निर्धारण की कोई शर्त बताई गई है, न ही plan से जुड़ी कोई पाबंदी।

🔗 X पर Cursor की घोषणा


GPT-Rosalind अपनी मूल्य-सारणी के साथ शोध पूर्वावलोकन से बाहर आया

11 सितंबर — OpenAI Developers ने घोषणा की है कि जीवन विज्ञान को समर्पित उसका reasoning model GPT-Rosalind शोध पूर्वावलोकन से बाहर आ रहा है। जैविकी शोध, औषधि खोज और translational medicine के लिए 16 अप्रैल 2026 को प्रस्तुत यह मॉडल तब केवल संयुक्त राज्य अमेरिका के पात्र Enterprise ग्राहकों के लिए उपलब्ध था। अब यह दुनिया भर के पात्र संगठनों को API, Codex और ChatGPT Enterprise के माध्यम से trusted access के अंतर्गत मिलेगा, और श्रृंखला के आगामी मॉडल जारी होते ही यह पहुँच उन पर भी लागू होगी।

API changelog में 8 सितंबर की प्रविष्टि वे विवरण देती है जिनका X thread में उल्लेख नहीं है। मॉडल का नाम gpt-rosalind-research है और इसकी सामान्य उपलब्धता अब भी trusted access कार्यक्रम पर निर्भर है, जो OpenAI द्वारा अनुमोदित आंतरिक जीवन-विज्ञान शोध तक सीमित है।

मूल्य या पहुँच संबंधी तत्वघोषित मान
मॉडल पहचानकर्ताgpt-rosalind-research
इनपुट tokensप्रति दस लाख 5 डॉलर
cache किए गए इनपुट tokensप्रति दस लाख 0.50 डॉलर
आउटपुट tokensप्रति दस लाख 25 डॉलर
बिलिंग आरंभ5 अक्टूबर 2026
पहुँच के माध्यमAPI, Codex, ChatGPT Enterprise
पहुँच की शर्तtrusted access कार्यक्रम, पात्र संगठन

बिलिंग केवल 5 अक्टूबर से शुरू होगी: शोध पूर्वावलोकन के दौरान उपयोग में न credits खर्च होते थे, न tokens। उपकरणों के स्तर पर Codex के Life Sciences plugins मॉडल की orchestration layer बनाते हैं, जो genomics से लेकर protein structure और translational research तक, जैविक साक्ष्य एकत्र करने से लेकर गुणवत्ता-नियंत्रण रिपोर्ट और interactive notebooks बनाने तक फैली है। अप्रैल में GitHub पर निःशुल्क प्रकाशित यह package 50 से अधिक सार्वजनिक multi-omics databases, साहित्य स्रोतों और जैविकी उपकरणों तक पहुँच देता है; यह सभी के लिए सामान्य-उद्देश्य मॉडलों के साथ काम करता है, लेकिन केवल पात्र Enterprise उपयोगकर्ता ही इसे GPT-Rosalind के साथ जोड़ सकते हैं।

दावा किया गया प्रदर्शन लॉन्च के समय वाला ही है: BixBench पर सर्वश्रेष्ठ प्रकाशित score, LABBench2 के 11 में से 6 कार्यों में GPT-5.4 पर बढ़त—जिसमें सबसे बड़ा अंतर CloningQA पर है—और Dyno Therapeutics के साथ तैयार किए गए RNA sequence-function कार्य में prediction के लिए 57 मानव विशेषज्ञों के 95वें percentile से बेहतर submission। ठोस जानकारी दोहरी है: एक विशेष मॉडल सार्वजनिक मूल्य के साथ प्रायोगिक स्थिति से बाहर आ रहा है और पहुँच का भौगोलिक विस्तार हो रहा है। पात्रता अब भी बाधा बनी हुई है और self-service के रूप में खुली नहीं है।

🔗 X पर OpenAI Developers का thread


Runway Model Licensing, कंपनियों को दिए गए बंद मॉडलों के वेट्स

11 सितंबर — Runway ने कंपनियों के लिए अपने मॉडलों का licensing कार्यक्रम Model Licensing शुरू किया है। इसका सिद्धांत API पहुँच से अलग है: ग्राहक को नवीनतम पीढ़ी के Runway मॉडल के पूरे वेट्स मिलते हैं, वह अपने डेटा पर उसे fine-tune करता है, अपने infrastructure में host करता है और उससे बने उत्पादों का व्यवसायीकरण करता है। डेटा और generations कभी ग्राहक के परिवेश से बाहर नहीं जाते, इसलिए यह स्पष्ट रूप से studios, brands और governments को लक्षित करता है।

उपलब्ध कराया गया तत्वसामग्री
मॉडल वेट्सशुरुआती बिंदु के रूप में पूरे वेट्स
Checkpointsसत्यापन के लिए मॉडल के कई संस्करण
Training scriptअपना डेटा जोड़ने और fine-tuning चलाने के लिए कोड
डिलीवरीग्राहक के codebase में packaged, उसकी पसंद के स्थान पर hosted
तैनात शोधकर्ताtuning, वेट्स और डिलीवरी में व्यावहारिक सहायता

Hosting ग्राहक की पसंद के अनुसार उसके cloud, उसके data center या पूरी तरह on-premises किया जाता है, जिसमें सरकारी संस्थाओं के लिए नेटवर्क से कटे air-gapped परिवेश भी शामिल हैं। छह क्षेत्रों का नाम लिया गया है: software platforms; cinema और studios; brands और marketing; robotics और physical AI, जिसमें World Action Model policy backbone की भूमिका निभाता है; video games और 3D, जिसमें निम्न-स्तरीय renders को photorealistic बनाया जाता है; और governments।

आर्थिक स्तर पर Runway दो मार्गों में अंतर करता है: Runway Dev, उपयोग के अनुसार बिल की जाने वाली API, जिसमें infrastructure प्रबंधित नहीं करना पड़ता; और वार्षिक license, जिसमें अनुमानित लागत के साथ versions, व्यवहार और outputs पर पूरा नियंत्रण मिलता है। FAQ अप्रचलन की आपत्ति का उत्तर देती है: भविष्य के मॉडलों को ग्राहक के proprietary data तक पहुँच नहीं होगी, वार्षिक renewal की व्यवस्था है और अगली पीढ़ियों के लिए credits दिए जाते हैं। वह आंतरिक पुनर्निर्माण की लागत को वर्षों के सीखने और करोड़ों डॉलर के रूप में आँकती है। कंपनी स्वयं को दुनिया की उन बेहद कम कंपनियों में से एक बताती है जो इस गुणवत्ता के बंद वेट्स का license देती हैं, और अपनी पेशकश को सीधे खुले वेट्स के विरुद्ध रखती है, जो उसके अनुसार कार्यों की सूची के साथ एक कमजोर मॉडल देते हैं। कोई मूल्य प्रकाशित नहीं किया गया है और पहुँच के लिए व्यावसायिक form भरना पड़ता है। यह घोषणा Runway Dev MCP के नौ दिन बाद और Team plan के एक सप्ताह बाद आई है: अब Runway व्यक्तिगत creator से लेकर बंद वेट्स के license तक पूरी श्रेणी को शामिल करता है।

🔗 Model Licensing पृष्ठ


Cognition ने Fusion को Devin Desktop और Devin CLI में उतारा

11 सितंबर — Cognition ने Devin Desktop और Devin CLI में Fusion की उपलब्धता की घोषणा की है। यह architecture कई महीनों से Devin Cloud पर चल रहा था; अब इसे डेवलपर की मशीन पर उपलब्ध कराया गया है। यह घोषणा घरेलू code model SWE-2 के अगले दिन आई है और दोनों एक-दूसरे से जुड़े हैं, क्योंकि SWE-2 इस व्यवस्था के लिए अनुशंसित दूसरा मॉडल है।

सिद्धांत बताने में सरल है। Fusion चुनते समय एक नहीं, बल्कि दो मॉडल चुने जाते हैं। एक अत्याधुनिक मॉडल lead की भूमिका निभाता है और session का नियंत्रण अपने पास रखता है: plan उसके पास होता है, वह अस्पष्टताओं पर निर्णय लेता है और सौंपे गए काम की समीक्षा करता है। कम लागत वाला मॉडल sidekick की भूमिका निभाता है: वह codebase की पड़ताल करता है, बदलाव लिखता है, tests चलाता है और रिपोर्ट देता है। दोनों समानांतर चलते हैं और प्रत्येक का अपना persistent context होता है। तकनीकी तर्क model routing के विरुद्ध है, जिसे लागत घटाने का स्वाभाविक समाधान माना जा सकता है: शुरुआती prompt किसी कार्य की कठिनाई मापने के लिए पर्याप्त नहीं होता और बीच में मॉडल बदलने से prompt cache टूट जाता है। Fusion दोनों मॉडलों के बीच पूरी conversations कभी स्थानांतरित न करके इस समस्या से बचता है; वे केवल briefs, results और feedback का आदान-प्रदान करते हैं।

प्रति कार्य लागत, डॉलर मेंकेवल Fable 5.1Fusion Fable 5.1 और SWE-2केवल AstraFusion Astra और SWE-2
DeepSWE 1.114,637,887,884,69
Terminal-Bench 417,4613,3710,086,06
SWE-Atlas QnA7,575,005,723,59
Vals Code Migration70,9742,0044,3635,51
विस्तारित FrontierCode 1.12,681,672,622,34

One of our key findings is that using more expensive models can make the entire system cheaper.

🇮🇳 हमारी प्रमुख खोजों में से एक यह है कि अधिक महँगे मॉडलों का उपयोग पूरे system को कम महँगा बना सकता है।Cognition, स्थानीय Fusion ब्लॉग

यह प्रदर्शन जोड़ी के दोनों पक्षों पर किया गया है। lead के स्तर पर Opus 4.8 को Fable 5 से बदलने पर—जिसकी प्रति token नाममात्र लागत दोगुनी है—समान sidekick के साथ sessions की औसत लागत 9 प्रतिशत घटी और FrontierCode पर score बेहतर हुआ: जहाँ Opus अपने sidekick का अत्यधिक सूक्ष्म प्रबंधन करता था, वहीं Fable पहले काम बाँटता था और बेहतर briefs लिखता था। sidekick के स्तर पर GPT-5.6 Luna से SWE-2 पर जाने से—अर्थात प्रति दस लाख tokens 275 प्रतिशत अधिक—कार्य की कुल लागत 2 प्रतिशत घटती है और score में 1.4 अंक की वृद्धि होती है। Artificial Analysis Coding Agent Index v1.5 पर Fable 5.1 और SWE-2 के साथ Fusion को 61.7 मिलते हैं, जबकि Fable 5.1 के साथ Claude Code की तुलना में इसकी लागत 36 प्रतिशत कम है; Claude Code का score 62.2 तक सीमित रहता है। Cognition इससे 2026 के लिए एक नियम निकालता है: मॉडलों और model-harness जोड़ियों का मूल्यांकन प्रति token कीमत के बजाय प्रति कार्य कीमत पर किया जाना चाहिए। harness बेचने वाले publisher के लिए यह सुविधाजनक स्थिति है, लेकिन आँकड़े Artificial Analysis और Vals AI के साथ पाँच अलग-अलग benchmarks पर तैयार किए गए हैं। स्थापना एक ही command से होती है।

🔗 X पर Cognition की घोषणा


Sakana AI ने Fugu Max और Fugu Ultra v2 लॉन्च किए, जो उसके multi-agent orchestrator के दो उन्नत संस्करण हैं

11 सितंबर — Sakana AI ने Fugu Max और Fugu Ultra v2 जारी किए हैं, जो Sakana Fugu के दो नए संस्करण हैं। यह उसका multi-agent orchestration system है, जिसे एक ही OpenAI-संगत API के पीछे उपलब्ध कराया गया है। इसका मुख्य विचार Pareto frontier है: Sakana का मानना है कि उद्योग अब भी ऐसे सोचता है मानो क्षमता ही एकमात्र आयाम हो, जबकि किसी वास्तविक कार्य का आकलन दो आयामों—क्षमता और लागत—पर किया जाता है।

Fugu कोई एकल मॉडल नहीं, बल्कि सीखी हुई orchestration layer है, जो प्रत्येक कार्य को open-weight और विशेषज्ञ मॉडलों के pool की ओर भेजती है। कंपनी के अनुसार, Fugu Max इस pool को अब तक के सबसे बड़े स्तर तक विस्तृत करता है, इसमें NVIDIA Nemotron परिवार को शामिल करता है और हर कार्य को उसे हल करने में सक्षम सबसे हल्के मॉडल के पास भेजता है। यह छह benchmarks पर सर्वश्रेष्ठ समग्र score प्राप्त करता है और दस में से सात पर लागत-प्रदर्शन frontier को आगे बढ़ाता है। इसकी कीमत प्रति दस लाख input tokens के लिए 2 डॉलर और output के लिए 6 डॉलर है; Sakana के अनुसार, इसकी output कीमत Sonnet 5, GPT 5.6 Terra और Kimi K3 से 40 से 60 प्रतिशत कम है।

घोषित मापscoreSakana द्वारा दी गई तुलना
Fugu Ultra v2, Chartography48,3Opus 5 के 27,3 और Fable 5 के 29,5 के मुकाबले
Fugu Ultra v2, DeepSWE74,3प्रति token 3 से 5 गुना महंगे मॉडलों से आगे
Fugu Ultra v2, रैंकिंग8 में से 5 benchmarks पर प्रथम या संयुक्त प्रथम8 में से 7 पर Top 2
Fugu Max, समग्र रैंकिंग6 benchmarks पर सर्वश्रेष्ठ score10 में से 7 पर विस्तारित Pareto frontier

Sakana जिस बिंदु पर सबसे अधिक जोर देता है, वह ध्यान देने योग्य है: Fable 5, Fable 5.1 और GPT-6-Astra, Fugu Ultra v2 के agent pool का हिस्सा नहीं हैं, जिसकी training cutoff date 28 अगस्त 2026 है। इसका तर्क आपूर्ति-लचीलापन है—एक अदला-बदली योग्य pool, जो vendor lock-in, API निरस्तीकरण और सेवा बंद होने से सुरक्षा देता है। दोनों मॉडल तुरंत उपलब्ध हैं, और Fugu उपयोगकर्ता केवल एक parameter बदलकर Max या Ultra v2 पर जा सकता है। Fugu Max को OpenRouter पर भी सूचीबद्ध किया गया है, जहाँ multimodal input, web search, configurable reasoning और structured outputs उपलब्ध हैं। उपयोग संबंधी सावधानी: benchmarks और तुलना के मॉडल Sakana ने चुने हैं, SWEFish एक आंतरिक परीक्षण मंच है, और दावा किए गए अंतर प्रकाशन के समय तुलना किए गए मॉडलों की कीमतों पर निर्भर हैं।

🔗 Fugu Max और Fugu Ultra v2 का परिचय


ElevenLabs ने Music v2.5 लॉन्च किया, सभी plans पर lossless downloads के साथ

11 सितंबर — ElevenLabs ने Music v2.5 जारी कर इसे ElevenMusic में prompt और audio reference, दोनों से generation के लिए default बना दिया है। मॉडल ऐसे instruments का दावा करता है जो live recording जैसे सुनाई देते हैं, साथ ही अधिक गहरे arrangements, लंबी compositions, गाने के दौरान genre transitions, rap और ऐसी आवाजें देता है जो पाठ की भाषा में स्वाभाविक सुनाई देती हैं। प्रस्तुत माप 47 885 जोड़ियों पर किया गया blind test है, जिसमें समान prompt के लिए प्रत्येक मॉडल से एक recording ली गई: अधिकांश बार Music v2.5 को प्राथमिकता दी गई, और आवाज तथा acoustic ध्वनि पर आधारित genres—R&B, soul, hip-hop, rock, metal, orchestral और film music—में अंतर सबसे स्पष्ट रहा। प्राथमिकता का सटीक प्रतिशत प्रकाशित नहीं किया गया है।

दूसरा पहलू उपयोगकर्ताओं के लिए परिस्थितियाँ अधिक व्यापक रूप से बदलता है। ElevenMusic में बनाया गया प्रत्येक गाना सभी plans पर, free plan सहित, उसके रचयिता का होता है। free plan में ElevenMusic को credit देने की शर्त पर व्यावसायिक उपयोग के साथ प्रतिदिन पाँच lossless downloads मिलते हैं, जबकि Pro plan में प्रति माह 400 मिलते हैं। निर्माण के समय प्राप्त permissions गाने से जुड़ी रहती हैं: सदस्यता रद्द करने या plan घटाने से पहले बनाए गए tracks पर कोई प्रभाव नहीं पड़ता, और शर्तों में भविष्य का कोई बदलाव केवल नए tracks पर लागू होगा। एकमात्र अपवाद किसी अन्य कलाकार के गाने पर आधारित track है, जिसे download नहीं किया जा सकता।

मापा या घोषित तत्वमान
blind test में आंकी गई जोड़ियाँ47 885
lossless downloads, Free planप्रतिदिन 5, credit के साथ व्यावसायिक उपयोग
lossless downloads, Pro planप्रति माह 400
API identifiermusic_v2_5
ElevenMusic में default मॉडलMusic v2.5, Music v2 बरकरार

यह मॉडल ElevenCreative में, Flows के Music node के रूप में और API में music_v2_5 identifier के अंतर्गत भी उपलब्ध है। ElevenLabs स्पष्ट करता है कि एक दिन पहले Universal Music Group के साथ घोषित बहुवर्षीय समझौता इस release से अलग है। पाठक के लिए घोषणाओं का क्रम महत्त्वपूर्ण है: major label के साथ समझौते की घोषणा पहले हुई, जबकि मॉडल और विस्तारित उपयोग अधिकार अगले दिन जारी किए गए।

🔗 X पर ElevenLabs की घोषणा


Claude Code मापता है कि कोई plugin वास्तव में कितना लाभ देता है—उसके साथ और उसके बिना

11 सितंबर — Claude Developers टीम ने Claude Code की एक subcommand claude plugin eval की घोषणा की है, जो किसी plugin या skill को test cases के एक suite पर चलाती है, हर execution को score देती है, फिर प्रत्येक case को plugin के बिना दोबारा चलाकर उसके वास्तविक योगदान को मापती है। विचार सरल और थोड़ा असहज करने वाला है: ऊँचा score यह साबित नहीं करता कि plugin मदद करता है, क्योंकि कभी-कभी Claude उसके बिना भी उतना ही सफल रहता है। इसलिए command दो scores और उनके बीच का अंतर लौटाती है। यदि किसी case को दोनों arms में 1,0 मिलता है, तो उस सफलता में plugin का कोई योगदान नहीं है।

इसका entry point claude plugin eval init है, जिसे plugin की root पर चलाया जाता है। एक interactive session खुलता है: Claude plugin को पढ़ता है, पूछता है कि अच्छा परिणाम कैसा होना चाहिए, ऐसे prompts सुझाता है जिन्हें इसे trigger करना चाहिए और जिन्हें नहीं करना चाहिए, verifiers (graders) तैयार करता है, उन्हें एक बार आज़माता है, प्रत्येक case के लिए एक directory बनाता है और पूर्ण run की अनुमानित लागत बताता है। इसके बाद हर case plugin के साथ तीन बार और उसके बिना तीन बार चलता है, यानी कुल छह executions, क्योंकि किसी non-deterministic agent का एक अकेला run बहुत कुछ नहीं बताता। terminal plugin के साथ और उसके बिना परिणामों की table दिखाता है, disk पर एक स्वतंत्र HTML report लिखी जाती है और account द्वारा अनुमति मिलने पर report को private artifact के रूप में प्रकाशित किया जाता है।

verifier का प्रकारmodel calls की लागतसफलता की शर्त
regexशून्यअंतिम उत्तर, trace या file में pattern मिलना
tool_usedशून्यकिसी tool को किए गए calls की संख्या न्यूनतम और अधिकतम के बीच होना
tool_orderशून्यएक call का दूसरे से पहले होना
file_existsशून्यrun के दौरान बनाई गई file का pattern से मेल खाना
llmएक model निर्णय करता है3 में से कम-से-कम 2 votes अनुकूल होना
baselineएक model निर्णय करता हैrun का कम-से-कम reference transcription जितना अच्छा होना

अंतर को समझने से पहले एक बारीकी जानना आवश्यक है: जो verifier skill को call करना अनिवार्य बनाता है, वह plugin के बिना कभी सफल नहीं हो सकता। इसलिए उसे दोनों arms के score से बाहर रखा जाता है और केवल indicator के रूप में report किया जाता है, अन्यथा अंतर कृत्रिम रूप से बढ़ जाएगा। isolation कठोर है। हर run एक disposable child process होता है, जिसमें user setting, hook, CLAUDE.md, MCP server, installed plugin या memory नहीं होती। runs कभी permission संबंधी प्रश्न नहीं पूछते, और स्पष्ट अनुमति न होने पर sensitive tools session से हटा दिए जाते हैं; यदि sandbox backend रहित machine पर Bash या PowerShell की अनुमति दी गई हो, तो Claude Code बिना confinement के चलाने के बजाय run से इनकार कर देता है। MCP tools से संवाद करने वाले plugin का वास्तविक service के बिना मूल्यांकन किया जा सकता है: हर tool के लिए एक Markdown file उत्तर उपलब्ध कराती है, और यदि plugin अपेक्षित सामग्री से अलग कुछ भेजता है तो एक block run को रोक देता है।

Evals call the model, so they use tokens and results vary. […] Your plugin’s hooks and MCP servers run as you, so only evaluate plugins you trust.

🇮🇳 मूल्यांकन model को call करते हैं, इसलिए वे tokens खर्च करते हैं और परिणाम बदलते रहते हैं। […] आपके plugin के hooks और MCP servers आपके अधिकारों के साथ चलते हैं, इसलिए केवल विश्वसनीय plugins का ही मूल्यांकन करें।X पर @ClaudeDevs

लागत वास्तविक है: प्रत्येक execution और निर्णय देने वाला प्रत्येक verifier एक model call है, जिसकी गणना plan या bill में होती है। documentation का उदाहरण छह runs वाले एक case के लिए 74 सेकंड और 0,41 डॉलर बताता है। इसीलिए टीम का निर्देश है: पूरा run शुरू करने से पहले --runs 1 के साथ परीक्षण करें। continuous integration में exit codes दर्ज किए गए हैं, जिनमें सभी tests सफल होने पर 0 और लागत सीमा पूरी हो जाने के कारण आंशिक run के लिए 2 शामिल हैं। documentation के अनुसार, पहला सामान्य निष्कर्ष skill verifier की विफलता के साथ लगभग शून्य अंतर होता है: Claude स्वाभाविक शब्दों में लिखे prompt पर skill नहीं चुनता, इसलिए उसके description को फिर से तैयार करना पड़ता है।

🔗 plugin evaluations का documentation

version 2.1.269 की शेष सामग्री

यह subcommand version 2.1.269 में आई है, जिसे 11 सितंबर को Paris समयानुसार 21 बजकर 17 मिनट पर जारी किया गया। बाकी additions कम प्रमुख हैं, लेकिन रोज़मर्रा के काम में उपयोगी हैं। command /output-style output style को सूचीबद्ध करती है और बदलती है, जिसमें Remote Control के माध्यम से तथा cloud या headless sessions में बदलाव भी शामिल है। जब Bash tool का उपयोग files में बदलाव करने के लिए होता है, तो उसके परिणाम में अब बदली हुई files का diff शामिल होता है, जिससे Claude को वही दृश्यता मिलती है जो सामान्य editing में मिलती है। observability के लिए एक environment variable repository के अनुसार OpenTelemetry metrics और events को label करता है, जबकि दो अन्य variables gateway के models खोजने की समय-सीमा और Workflow tool के concurrent agents की सीमा—अधिकतम 256 तक—निर्धारित करते हैं।

सुधार तीन संवेदनशील क्षेत्रों से जुड़े हैं: बीच में कटा और फिर दोबारा शुरू किया गया उत्तर मिलने के बाद prompt cache का आंशिक invalidation; निषेध से शुरू होने वाले permission rules, जो अब केवल उन्हें लिखने वाले settings source पर लागू होते हैं; और write-path verification, जो अंततः tee command द्वारा लिखी गई file को भी cover करता है। compaction के बाद भेजा गया git status अब session की शुरुआत वाला नहीं, बल्कि वर्तमान है। VS Code में एक badge sub-agents का map खोलता है, जिसमें cards, stop button और read-only transcriptions होती हैं। दो dialog boxes user, project और local settings में hooks तथा permission rules प्रबंधित करने की सुविधा देते हैं।

🔗 version 2.1.269 के release notes


Antigravity: एक सप्ताह में चार versions और Teamwork पर पिछली घोषणाओं की पूर्ति

Google ने लगातार अपने command-line tool के दो versions और application का एक नया version जारी किया है; इसमें वे दो पुराने versions शामिल नहीं हैं जिन्हें यहाँ कभी cover नहीं किया गया। changelog को एक साथ पढ़ना उपयोगी है, क्योंकि इस सप्ताह की releases एक ही कहानी बताती हैं: agent interactive terminal छोड़कर service बन रहा है।

🔗 Antigravity changelog

Antigravity CLI 1.2.0: CLI, Remote Control से संचालित background daemon बनती है

10 सितंबर — Antigravity CLI का version 1.2.0 जुलाई के बाद पहला minor version upgrade है। तीन subcommands, remote-control start, status और stop, command line को system service manager में ऐसे background daemon के रूप में register करती हैं जो disconnect और restart के बाद भी चलता रहता है। इसमें instance name का एक option और service को active login session तक सीमित रखने का एक अन्य option है। अब तक terminal को खुला और चालू रखना पड़ता था। दो नए default shortcuts के साथ half-page scrolling सभी views तक विस्तृत हो गई है। आठ fixes में से अप्रत्याशित व्यवहार समझने के लिए सबसे उपयोगी यह है: content safety filters द्वारा रोके गए prompt या response पर अब स्पष्ट stop reason दिखाई देता है, जबकि पहले उपयोगकर्ता को generic error या खाली turn दिखता था। global plugins में embedded MCP servers अब startup पर सही ढंग से initialize होते हैं।

Antigravity CLI 1.1.28: त्रुटियों पर अधिक व्यापक retries, तेज headless mode और URL पढ़ने के लिए approval

9 सितंबर — एक दिन पहले, version 1.1.28 में resilience और headless mode—जिसे script से चलाया जाता है—के लिए नौ improvements शामिल थे। model API की transient errors पर विस्तारित exponential backoff के साथ दोबारा प्रयास किया जाता है, startup अब user identity पढ़ने के लिए network request नहीं करता, और हर turn से अधिकतम 200 milliseconds की idle delay हटा दी गई है। automation करने वालों के लिए दो व्यवहारगत बदलाव विशेष ध्यान देने योग्य हैं।

व्यवहारगत बदलावversion 1.1.28 से पहलेversion 1.1.28 से
script mode में समय-सीमा समाप्त होनाtimeout failureआंशिक output लौटता है, success code और warning
agent द्वारा external URL पढ़नाबिना promptपहले से अनुमति न होने पर default रूप से approval माँगा जाता है

इसलिए implicit web access पर निर्भर script को यह permission स्पष्ट रूप से देनी होगी। approval prompts अब सटीक action का नाम बताते हैं और hook या किसी दूसरे project की file से request आने पर कारण बताने वाली एक line जोड़ते हैं।

Antigravity CLI 1.1.26 और 1.1.27, पिछली घोषणाओं की पूर्ति: दूसरे मॉडल पर एकबारगी prompt और frontmatter में sub-agent dependencies

4 और 5 सितंबर — versions 1.1.26 और 1.1.27 इस अंतर को भरते हैं और इस समूह का सबसे ठोस नया feature लाते हैं: model selection command अब एक prompt स्वीकार करती है, जिसे दूसरे मॉडल पर केवल एक बार चलाने के बाद session मूल मॉडल पर लौट आता है। इससे default setting बदले बिना अधिक शक्तिशाली या अधिक किफायती मॉडल से दूसरी राय ली जा सकती है। यही version custom agents के Markdown frontmatter में agents की list जोड़ता है, ताकि उन sub-agents को घोषित किया जा सके जिन पर वे निर्भर हैं। इसमें automation के लिए महत्त्वपूर्ण दो fixes भी हैं: server schema में अघोषित argument वाला MCP call चुपचाप हटाए जाने के बजाय reject और correct किया जाता है; और headless execution अब अपनी JSON output में अस्वीकार किए गए actions के नाम देता है, उन्हें बिना कुछ कहे अनदेखा नहीं करता।

Antigravity 2.13.0: Documents अनुभाग, SQL और JSONL के लिए वर्चुअलाइज़्ड व्यूअर तथा उद्धरण शॉर्टकट

9 सितंबर — Antigravity 2.13.0 में 16 सुधार और 16 दोष-सुधार शामिल हैं। किसी वार्तालाप में जोड़ी गई बाहरी फ़ाइलें, Google Drive लिंक, PDF और Office दस्तावेज़, एजेंट की प्रस्तुतियों के साथ मिलने के बजाय Artifacts के ऊपर एक Documents अनुभाग में समूहित किए जाते हैं। एजेंट द्वारा अपने लिए लिखी गई ड्राफ़्ट फ़ाइलें एक अलग अनुभाग में चली जाती हैं। SQL और JSONL फ़ाइलों जैसे कोड तथा डेटा आर्टिफ़ैक्ट सिंटैक्स हाइलाइटिंग और पंक्ति संख्याओं वाले वर्चुअलाइज़्ड व्यूअर में खुलते हैं, जो बड़ी फ़ाइलों पर भी सुचारु रहता है और इनलाइन टिप्पणियाँ स्वीकार करता है। बंद किया गया पार्श्व प्रश्न मिटने के बजाय एक बटन में सिमट जाता है, इंटरैक्टिव प्रॉम्प्ट में रद्द करने का बटन जुड़ गया है, और चुने गए पाठ को कीबोर्ड शॉर्टकट से चैट में उद्धृत किया जा सकता है। दो दोष-सुधार अनुमतियों की पारदर्शिता से संबंधित हैं: अस्वीकार किया गया चरण गायब होने के बजाय Rejected लेबल के साथ दिखाई देता रहता है, और परियोजना के बाहर की पहुँच पहले से स्वीकृत होने पर एजेंट अब अन्य परियोजनाओं के आर्टिफ़ैक्ट पढ़ने की अनुमति दोबारा नहीं माँगता।

🔗 X पर @antigravity की सुझाव शृंखला

Teamwork, 27 अगस्त का छूटा हुआ विवरण

27 अगस्त को प्रकाशित एक लेख, जिसे यहाँ कभी शामिल नहीं किया गया और जो अब भी Gemini के नवीनता पृष्ठ के डेवलपर अनुभाग में सबसे ऊपर है, ध्यान देने योग्य है। Teamwork, Antigravity का बहु-एजेंट समन्वय फ़्रेमवर्क है, जिसमें एजेंट घंटों या दिनों तक एक-दूसरे के काम का प्रस्ताव रखते, उसकी आलोचना करते और उसे परिष्कृत करते हैं; यह सभी सशुल्क योजनाओं पर पूर्वावलोकन के रूप में उपलब्ध है। पाँच पैटर्न दिए गए हैं, जिन्हें प्रॉम्प्ट के अनुसार स्वचालित रूप से चुना जाता है—पुनरावृत्तीय कोडिंग से लेकर दस्तावेज़ समीक्षा और दीर्घ प्रमाण तक। दीर्घ प्रमाण पैटर्न के साथ Google ने सात खुले प्रश्न हल करने की घोषणा की है, जिनमें Knuth की चक्र परिकल्पना भी शामिल है। इसके लिए 40 से अधिक और 70 से अधिक पृष्ठों के प्रमाण तैयार किए गए, जिनमें 40-पृष्ठ वाले प्रमाण को Lean में औपचारिक रूप से सत्यापित किया गया; अन्य परिणामों की पुष्टि मानव विशेषज्ञों ने की और पाँच शोधपत्र arXiv पर जमा किए गए हैं।

रिपोर्ट किया गया मापमान
TCSBench, दीर्घ प्रमाण में Gemini 3.7 Flash और 3.1 Pro71 प्रतिशत
TCSBench, Gemini 3.6 Flash और 3.1 Pro, मूल शोधपत्र67,7 प्रतिशत
RISC-V सिम्युलेटर, चक्र-संरेखण त्रुटि0,71 प्रतिशत
Gemini 3.7 Flash से पुनरुत्पादित समस्याएँ7 में से 3

गणित से इतर, Teamwork ने शून्य से एक चक्र-सटीक, क्रम-विरुद्ध निष्पादन वाला RISC-V प्रोसेसर सिम्युलेटर बनाया, जो xv6 प्रणाली को shell तक बूट करता है और सौ से अधिक मानक बेंचमार्क चलाता है; इसे हार्डवेयर निष्पादन के विरुद्ध सत्यापित किया गया है। मुक्त-स्रोत परियोजनाओं में दो योगदान ऊपर की ओर एकीकृत किए गए हैं: Eigen में एक वेक्टराइज़्ड तीव्र पथ और 64 threads पर दोगुनी प्रविष्टि-क्षमता वाली समवर्ती hash table का एक प्रकार।

🔗 Teamwork, जब AI शोध सहयोगी बन जाता है


GitHub Copilot अपनी टिप्पणियाँ स्वयं हल करता है और Jira को अपने अनुप्रयोग में लाता है

कोड समीक्षा अब एजेंटों के समूह द्वारा होती है

11 सितंबर — GitHub ने Copilot code review को दो स्तरों पर अद्यतन किया है। अनुभव के स्तर पर, जब बाद का कोई commit Copilot की टिप्पणी का समाधान करता है, तो समीक्षा उस टिप्पणी को स्वयं हल कर देती है, जिससे खुली टिप्पणियों की सूची में केवल वही रहता है जिसे उत्तर की प्रतीक्षा है; और जब कोई code suggestion लागू किया जाता है, तो Copilot पहले से भरे संदेश के बजाय परिवर्तन के अनुरूप commit संदेश लिखता है। विश्लेषण के स्तर पर, समीक्षा एजेंट के पास अब Copilot SDK के सभी shell उपकरण हैं, जिन्हें एजेंट के firewall के पीछे चलाया जाता है: वह build शुरू कर सकता है, परीक्षण चला सकता है, लक्षित script चला सकता है या उपलब्ध API से पूछताछ करके अपने द्वारा जाँचे जा रहे कोड को सत्यापित कर सकता है। GitHub अधिक सकारात्मक प्रतिक्रियाओं, उच्च-गंभीरता वाले अधिक निष्कर्षों और छोटी-मोटी टिप्पणियों में कमी की सूचना देता है, लेकिन इस बारे में कोई आँकड़ा नहीं देता।

वहीं Lite प्रयास स्तर अब किसी एक एजेंट पर निर्भर नहीं है, बल्कि एजेंटों के एक समूह पर आधारित है, जिनमें से प्रत्येक अपना विश्लेषण देता है और उन्हें एकल समीक्षा में मिला दिया जाता है।

मापा गया निष्कर्ष, समूह में Lite समीक्षाएँघोषित परिवर्तन
ध्यान में ली गई टिप्पणियाँ, उच्च गंभीरता47 प्रतिशत अधिक
ध्यान में ली गई टिप्पणियाँ, मध्यम गंभीरता31 प्रतिशत अधिक
ध्यान में ली गई टिप्पणियाँ, कम गंभीरता11 प्रतिशत अधिक
एक समीक्षा की लागतलगभग 8 प्रतिशत कम

न तो समूह में एजेंटों की संख्या बताई गई है, न ही उपयोग किए गए मॉडल। दो सप्ताह में Copilot code review का यह तीसरा बदलाव है।

🔗 GitHub परिवर्तन-सूची

अनुप्रयोग में Jira, command line में HydraFusion, VS Code 1.137

10 सितंबर — Copilot Day वाले 7 सितंबर के सप्ताह का साप्ताहिक सारांश Copilot अनुप्रयोग में Jira एकीकरण लाता है: tickets को एक साझा canvas में लाया जाता है, वहाँ आगे बढ़ाए जाने वाले कार्य चुने जाते हैं, और Copilot जाँच, क्रियान्वयन तथा pull request की तैयारी में ticket का संदर्भ साथ रखता है। Copilot CLI में Project HydraFusion अब किसी अन्य मॉडल की तरह चुना जा सकता है और हर कार्य के लिए स्थानीय, cloud तथा संयोजित मॉडलों के बीच एक प्रवाह चुनता है, जिसमें प्रदर्शन, लागत और विलंबता के बीच संतुलन बनाया जाता है।

9 सितंबर को जारी VS Code 1.137 में एजेंटों से जुड़ी तीन सुविधाएँ आई हैं। सार्वजनिक पूर्वावलोकन में उपलब्ध automations, issue छँटाई या bug खोज जैसे दिए गए templates के आधार पर हर घंटे, हर दिन या हर सप्ताह दोहराए जाने वाले एजेंट कार्य निर्धारित करते हैं। प्रयोगात्मक voice mode किसी एजेंट के काम करते समय उससे बात करने, उसे बीच में रोकने या दूसरी दिशा देने की सुविधा देता है। अंत में, किसी issue या pull request का लिंक सीधे Agents विंडो में खुलता है, भले ही कोई repository खुली न हो। रिलीज़ नोट्स में एक समर्पित protocol पर आधारित और Copilot SDK द्वारा संचालित agent host भी जोड़ा गया है, जो VS Code एजेंट के व्यवहार को command line और अनुप्रयोग के व्यवहार के अनुरूप बनाता है।

🔗 Copilot का साप्ताहिक सारांश


Habitat, OpenAI का ऑनलाइन भंडारण और दो इंजीनियरों द्वारा Rust में उसका पुनर्लेखन

11 सितंबर — OpenAI ने Habitat पर एक इंजीनियरिंग लेख का पहला भाग प्रकाशित किया है। Habitat, ChatGPT, API और Codex के पीछे की ऑनलाइन भंडारण प्रणाली है। आँकड़े इसके पैमाने को दर्शाते हैं: प्रति सेकंड 7 करोड़ से अधिक अनुरोध, हर सप्ताह एक अरब से अधिक लोगों को सेवा, लगभग 40 क्षेत्र और 500 petabytes से अधिक डेटा। Habitat की शुरुआत 2024 के मध्य में ChatGPT के मुख्य server में समाहित एक छोटी Python library के रूप में हुई थी, जो एक managed database से जुड़ी थी। इसके पीछे एक सरल विचार था: उत्पाद इंजीनियरों को schema, routing, authorization या connection pools के बारे में नहीं सोचना चाहिए।

2025 के मध्य तक client-side library मॉडल अपनी सीमाओं पर पहुँच गया। protocol में हर बदलाव के लिए दर्जनों सेवाओं पर deployments का समन्वय करना पड़ता था; क्षेत्रीय routing के एक deployment में कई दिन लगे, फिर एक दोषपूर्ण client पर वापस गई सेवा ने वही outage उत्पन्न कर दिया जिसे उस कार्रवाई से रोकना था। Habitat एक स्वतंत्र सेवा बन गया और OpenAI ने जानबूझकर तकनीकी ऋण स्वीकार करते हुए Python पर बने रहने का निर्णय लिया, इस भरोसे के साथ कि उसके अपने code models भविष्य में migration को व्यावहारिक बना देंगे।

लेख का अधिकांश भाग इस पैमाने पर tail latencies की खोज का वर्णन करता है: asyncio का scheduling delay, जो सैकड़ों milliseconds तक पहुँच सकता था और जिसे प्रत्येक process के concurrent requests सीमित करके नियंत्रित किया गया; हर मिनट बिना किसी यादृच्छिक अंतराल के refresh होने वाली configurations की parsing, जो सभी workers को एक साथ जमा देती थी; और एक HTTP library द्वारा connections का last-in-first-out पुनः उपयोग, जो पहले से धीमे processes पर traffic केंद्रित करता था—इस metastable failure को पहले क्रम उलटकर और फिर load balancing को service mesh को सौंपकर ठीक किया गया। API स्वयं जानबूझकर सीमित है—objects और edges का एक मॉडल, जिसमें न तो असीमित queries हैं, न joins—और इसी सीमित दायरे ने Python को इतनी दूर तक ले जाना संभव बनाया।

मापा गया संकेतकघोषित मान
आज प्रति सेकंड अनुरोध7 करोड़ से अधिक
हर सप्ताह सेवा पाने वाले लोगएक अरब से अधिक
प्रस्तुत डेटा500 petabytes से अधिक
Python सेवा का शिखरप्रति सेकंड 2 करोड़ से अधिक अनुरोध
Rust में पुनर्लेखनदो इंजीनियर, Codex और GPT-5.5
Rust द्वारा सँभाले गए traffic का हिस्साproduction requests का 95 प्रतिशत
processor और memory दक्षता में लाभ6 गुना और 15 गुना

2026 की दूसरी तिमाही में दो इंजीनियरों ने Codex और GPT-5.5 की सहायता से पूरी सेवा को Rust में दोबारा लिखा। Rust सेवा production requests के 95 प्रतिशत को सँभालती है और छह गुना कम processor तथा पंद्रह गुना कम memory उपयोग करती है; आने वाले सप्ताहों में Python को हटा दिया जाएगा। दूसरा भाग storage layer पर केंद्रित होगा।

🔗 भंडारण को एक अरब उपयोगकर्ताओं तक विस्तारित करना


OpenAI ने Codex उपयोगकर्ताओं से skills, AGENTS.md और prompts को हल्का करने को कहा

11 सितंबर — OpenAI के डेवलपर blog ने GPT-6 Astra पर जाने वाले Codex उपयोगकर्ताओं के लिए सफ़ाई संबंधी मार्गदर्शिका प्रकाशित की है। शुरुआती निष्कर्ष यह है: पिछले मॉडलों का मार्गदर्शन करने के लिए एक वर्ष में जमा हुए निर्देश अधिक सक्षम मॉडल के लिए बोझ बन जाते हैं। skills के मामले में प्रक्रिया स्पष्ट है: हर skill context में एक नाम और विवरण लोड करती है, और जब उनकी संख्या बहुत अधिक हो जाती है तो Codex इन विवरणों को छोटा कर देता है, जिससे मॉडल को प्रत्येक के बारे में कम जानकारी मिलती है और वह सही चयन करने में कम सक्षम होता है।

जाँचा गया निर्देशGPT-6 Astra के लिए अनुशंसा
skill का विवरणछोटा, सटीक trigger वाला, पूरा domain नहीं
कई प्रवाहों वाली skill की संरचनामूल document को docs और scripts की ओर भेजने वाले router तक सीमित करें
AGENTS.md में अनिवार्य पठनहर प्रकार के बदलाव के लिए एक document, प्रत्येक संपादन पर पढ़ने के लिए ढेर नहीं
परीक्षण निर्देशअनावश्यक, मॉडल स्वयं परीक्षण चलाता है
कार्य की समाप्तिस्पष्ट करें कि पूर्ण होने का अर्थ क्या है, सुरक्षित workflows को पहले से अनुमति दें
विरासत में मिली रोकेंढीली करें, अन्यथा समय से पहले रुकना संभव है

सबसे रोचक बिंदु मॉडल के व्यवहार से संबंधित है। OpenAI, GPT-6 Astra को अपने पूर्ववर्ती की तुलना में कार्य के दायरे के प्रति अधिक सावधान बताता है और यह पहली क्रियान्वयन के बाद समीक्षा के लिए लौट सकता है। अनुशंसित उपाय है कि पूर्ण होने का अर्थ स्पष्ट रूप से परिभाषित किया जाए और ज्ञात सुरक्षित workflows के लिए पहले से अनुमति दी जाए, जैसे कि फेंकने योग्य fixtures वाली स्थानीय test suite। इसके विपरीत, पुराने मॉडलों को नियंत्रित करने के लिए लिखे गए अत्यधिक कठोर guardrails अब इसे बहुत जल्दी रोक सकते हैं। लेख यह भी याद दिलाता है कि किसी repository की skills अन्य योगदानकर्ताओं के agents द्वारा भी पढ़ी जाती हैं, जो कभी-कभी दूसरे models पर चलते हैं: उनके लिए उपयोगी निर्देश Astra को आवश्यकता से अधिक बाँध सकता है। अंत में एक व्यावहारिक सुझाव दिया गया है—Astra से ही परियोजना के निर्देशों का audit करने को कहें। skill बनाने वाली skill को इसी उद्देश्य से अद्यतन किया गया है।

🔗 GPT-6 Astra के लिए skills और prompts पर पुनर्विचार


ChatGPT Sites ने तीन महीनों में 50 लाख sites का आँकड़ा पार किया

11 सितंबर — आधिकारिक ChatGPT खाते ने ChatGPT Sites का लेखा-जोखा प्रस्तुत किया है। यह सुविधा तीन महीने पहले किसी वार्तालाप से पूर्ण web applications बनाने और host करने के लिए शुरू की गई थी; तब से 50 लाख से अधिक sites बनाई जा चुकी हैं। संदेश का मुख्य उद्देश्य उन पाँच बदलावों का सारांश देना है जिन पर अधिक ध्यान नहीं गया।

इनमें से दो सामूहिक कार्य से संबंधित हैं। पहला बदलाव सहकर्मियों को किसी साझा site को संपादित करने, सहेजने और प्रकाशित करने के लिए आमंत्रित करने देता है; दूसरा किसी site को सार्वजनिक किए बिना विशिष्ट लोगों के लिए खोलने की सुविधा देता है। बाकी तीन site के जीवनचक्र से जुड़े हैं: prompt से deployment तक का समय कथित तौर पर आधा हो गया है, ChatGPT माँगने पर site के database का निरीक्षण कर सकता है और editors को भी उसकी पहुँच मिलती है, तथा site से custom domain जोड़ा जा सकता है। डेवलपर खाते ने भी घोषणा साझा की है, जो संकेत देता है कि यह सुविधा केवल आम उपयोगकर्ताओं के pages के लिए नहीं, बल्कि तेज़ prototypes के लिए भी लक्षित है।

🔗 X पर ChatGPT Sites का लेखा-जोखा


Together AI ने अपने fine-tuning को 17 खुले models तक विस्तारित किया और experts पर adapters लगाए

11 सितंबर — Together AI ने अपने fine-tuning सेवा का विस्तार प्रयोग के पूरे क्रम तक किया है। सत्रह open-weight models सूची में शामिल हुए हैं, जिनमें GLM 5.3 और उसके पिछले दो संस्करण, DeepSeek-V4-Flash, Kimi K2.7-Code और K2.6, 0,8 से 35 अरब parameters वाला Qwen परिवार तथा Gemma 4 शामिल हैं। कंपनी के अनुसार GLM-5.3 ने Terminal-Bench 2.1 पर 88,2 अंक प्राप्त किए, जो सर्वश्रेष्ठ proprietary models से एक अंक से भी कम पीछे है।

experiment tracking दूसरी नई सुविधा है: प्रत्येक job हर चरण पर loss, gradient norm और learning rate दर्ज करता है; curves निष्पादन के दौरान अद्यतन होती हैं, कई jobs को एक ही graph पर आरोपित किया जा सकता है और raw series को API के माध्यम से उपलब्ध कराया जाता है। early stopping तब training रोक देता है जब validation loss स्थिर हो जाता है, अंतिम checkpoint के बजाय सर्वश्रेष्ठ checkpoint रखता है और उपयोग न किए गए चरणों का पैसा वापस करता है।

सबसे तकनीकी बिंदु Expert LoRA है। mixture-of-experts मॉडल (Mixture-of-Experts) में 90 प्रतिशत से अधिक parameters expert layers में रहते हैं, जिन्हें पारंपरिक adapter केवल attention से जुड़कर स्थिर छोड़ देता है।

200 गढ़े गए तथ्यों पर परीक्षणexperts को शामिल करने वाले adaptersकेवल attention पर adapters
नए तथ्यों का स्मरण89 प्रतिशत तक15 प्रतिशत
MMLU-Pro75,3 प्रतिशत71,5 प्रतिशत

दिया गया स्पष्टीकरण यह है कि attention तक सीमित adapters के साथ fine-tuning के दौरान route किए गए experts का बढ़ता हिस्सा अनुपयोगी हो जाता है। data processing भी black box से बाहर आ गई है, जिसमें tokenized पंक्तियों का preview, प्रत्येक उदाहरण के weights और upload पूरा होते ही server-side पर फ़ाइल का पूर्ण validation शामिल है। मॉडल के अनुसार training की कीमतें 30 से 70 प्रतिशत तक कम हुई हैं।

🔗 X पर Together AI की घोषणा


सामुदायिक योगदान, प्रत्येक प्रयास के लिए एक sandbox और सौ zebra puzzles

Hugging Face के सामुदायिक blog ने उसी दिन तीन ऐसे कार्य प्रकाशित किए जिन्हें संक्षिप्त उल्लेख से अधिक स्थान मिलना चाहिए, और पाँच अन्य नीचे दिए गए हैं।

तेरह प्रयोगशालाएँ अपने एजेंटों के लिए RL कैसे चलाती हैं

11 सितंबर — Sergio Paniego ने अक्टूबर 2025 से सितंबर 2026 के बीच तेरह प्रयोगशालाओं द्वारा प्रकाशित पंद्रह रिपोर्टों का विश्लेषण किया है और केवल इस बात को शामिल किया है कि प्रत्येक प्रयोगशाला किसका प्रशिक्षण करती है, न कि वह किसका मूल्यांकन करती है। मुख्य निष्कर्ष: परिवेश अब स्मृति में चलने वाला simulator नहीं, बल्कि file system, shell और processes वाली एक पूरी मशीन है, जिसे एक प्रयास के लिए शुरू किया जाता है और फिर नष्ट कर दिया जाता है। Liquid AI यह काम 2.6 अरब parameters वाले model के लिए करता है, Cursor अपने model को प्रशिक्षित करने के लिए सैकड़ों हजार समवर्ती परिवेशों की बात करता है, Microsoft प्रत्येक कार्य के लिए एक नया container उपलब्ध कराता है, और Kimi K3 दस लाख tokens वाली trajectories के लिए फिर से शुरू की जा सकने वाली micro virtual machines के साथ इससे भी आगे जाता है।

stack की परतप्रयोगशालाएँ क्या रखती हैंउद्धृत सार्वजनिक समकक्ष
कार्य और सत्यापकGLM-5 में 10,000 से अधिक code परिवेशEnvironments Hub, verifiers, Harbor
action contract, harnessKimi पाँच white-box harness आरंभ करता हैOpenEnv, SkyRL, BrowserGym, TextArena
sandboxप्रति cluster सैकड़ों हजार virtual machinesModal, E2B, AgentENV, Hugging Face Sandboxes
trainerZhipu में slime, MiniMax में Forge, NVIDIA में RLVRTRL, Miles v0.1

एक उल्लेखनीय रुझान यह है कि harness स्वयं ही परिवेश बन रहा है—या तो उसे white box में फिर से बनाया जाता है, या उसे जस का तस छोड़कर black box में सुना जाता है। पारदर्शिता बेहद असमान है: Ai2 ने OLMo 3 के लिए code के 17.2 मिलियन सत्यापित samples का दस्तावेज़ीकरण किया है, जबकि OpenAI, Anthropic और Google लगभग कुछ भी प्रकाशित नहीं करते; GPT-6 Astra की system card मात्र एक वाक्य की है। लेखक बड़ी प्रयोगशालाओं में केवल एक परिवेश के लिए एक करोड़ डॉलर से अधिक की लागत का उल्लेख करता है। यह लेख Training Agents शृंखला का समापन करता है।

🔗 प्रत्येक rollout के लिए एक sandbox

सौ zebra puzzles गणितीय तर्कशक्ति को जागृत करते हैं

11 सितंबर — tamewild द्वारा लिखे गए एक सामुदायिक लेख में बताया गया है कि बिना किसी गणितीय data के, 100 से 500 logical deduction puzzles पर कुछ मिनट का fine-tuning छोटे base models के गणितीय benchmarks पर प्रदर्शन में भारी उछाल लाने के लिए पर्याप्त है।

प्रशिक्षित base modelMATH-500AIME 2025तुलना किया गया आधिकारिक reference
Qwen 3 4B, 6 min 23 में 100 puzzles84.60 प्रतिशत21.67 प्रतिशतpost-trained version: 84.80 और 19.10
Granite 4.1 3B, 23 min में 500 puzzles77.73 प्रतिशत19.44 प्रतिशतInstruct version: 66.60 और 6.67
Qwen 3.5 9B, 40 min में 500 puzzles96.60 प्रतिशत60.67 प्रतिशतpost-trained version: 97.40 और 60.56

संरचनात्मक प्रभाव भी मापे गए हैं: तीनों में सबसे बड़े model पर प्रतिक्रियाओं की median length आधिकारिक model से कम हो जाती है और greedy decoding में repetition loops की दर 6.06 से घटकर 0.67 प्रतिशत हो जाती है। लेखक सावधानी बरतता है, क्योंकि ये केवल एक seed वाले exploratory runs हैं, और बताता है कि उसके अपने ablations दिखाते हैं कि एक पारंपरिक adapter भी MATH-500 पर लगभग 80 प्रतिशत तक पहुँच जाता है: generalization मुख्यतः logical data से आता है। Code, notebooks, तीन models और दो datasets प्रकाशित किए गए हैं।

🔗 100-500 zebra puzzles से तर्कशक्ति उभारना

ऐसी भाषा के लिए speech pipeline जिसका कोई dataset नहीं है

10 सितंबर — Osmanov ने Crimean Tatar के लिए एक संपूर्ण speech pipeline बनाने की कहानी बताई है। यह एक संकटग्रस्त भाषा है जिसके लिए न speech recognition उपलब्ध है, न speech synthesis। उनका ऐसा निष्कर्ष जिसे अन्य जगहों पर भी लागू किया जा सकता है: training की लागत नगण्य थी। recognition adapter को laptop के GPU पर 90 मिनट लगे और उसने word error rate को 34.6 से घटाकर 20.1 प्रतिशत कर दिया, फिर किसी भी weight को छुए बिना beam search के साथ इसे 17.0 प्रतिशत तक पहुँचा दिया। लगभग पूरा समय एक अनुपस्थित corpus बनाने और यह सत्यापित करने में लगा कि evaluation गलत तस्वीर नहीं दिखा रहा था।

दो विकल्प याद रखने योग्य हैं। base model का चयन भाषाई निकटता के बजाय phonetic prior के आधार पर किया गया: Crimean Tatar में uvular /q/ है, जो Turkish में नहीं है, और Turkish identifier के अंतर्गत प्रशिक्षित base models इसे /k/ के रूप में प्रस्तुत करते थे, जिसे fine-tuning बिल्कुल भी ठीक नहीं कर पाया। और corpus को bootstrap करने के लिए recognition उपलब्ध न होने पर लेखक ने ज्ञात text वाली audiobooks का इस्तेमाल करके समस्या को उलट दिया; इस तरह 336 उपयोगी मिनट मिले, जबकि भटकते alignment से केवल 110 मिनट मिलते। सबसे उपयोगी नकारात्मक परिणाम metric का plateau है: synthesis corpus को 5.9 से बढ़ाकर 15.3 घंटे करने पर character error rate में कोई बदलाव नहीं आया, जबकि blind listening में हर बार नवीनतम voice को पसंद किया गया। अंत में वह एक आम leakage का दस्तावेज़ीकरण करता है: test book की 96.9 प्रतिशत clips training में duplicate थीं, जिसका पता filenames से नहीं, बल्कि text n-grams से चला।

🔗 शून्य-dataset वाली भाषा के लिए speech technology


Replit ने Routines पेश किया, ऐसा आवर्ती काम जो जरूरत पड़ने पर ही agent को बुलाता है

11 सितंबर — Replit ने Routines पेश किया है, जो hourly, daily या weekly schedule के अनुसार आवर्ती काम चलाने वाली सुविधा है। घोषणा scheduling के कारण कम—क्योंकि वह सामान्य बात है—और कंपनी द्वारा लागत की समस्या से निपटने के तरीके के कारण अधिक रोचक है। शुरुआती निष्कर्ष साफ तौर पर रखा गया है: agents अब अधिकांश दोहराए जाने वाले कार्यों को automate कर सकते हैं, लेकिन उन्हें लगातार चलाने पर असंख्य tokens खर्च होते हैं। समाधान यह है कि agent को loop के केंद्र में न रखा जाए। प्रत्येक execution deterministic code से शुरू होता है और agent को केवल तभी बुलाया जाता है जब वास्तव में reasoning की जरूरत हो।

यह architecture उस प्रमुख रुझान के उलट है जिसमें पूरा cycle एक model को सौंप दिया जाता है। यहाँ model फिर से समय-समय पर बुलाया जाने वाला resource बन जाता है, जिसे सामान्य code नियंत्रित करता है और जिसका व्यवहार तथा लागत अनुमानित होते हैं। सैकड़ों बार दोहराए जाने वाले scheduled task में bill का अंतर मामूली नहीं होता। घोषणा के साथ कोई blog post प्रकाशित नहीं किया गया।

🔗 X पर Replit की घोषणा


Warp ने Grok Build को first-class agent के रूप में एकीकृत किया

11 सितंबर — Warp ने SpaceX AI के command-line agent Grok Build CLI के integrated support की घोषणा की, और Grok account ने तुरंत इस integration को साझा किया। यह सुविधा terminal के 9 सितंबर वाले version में पहले ही जारी हो चुकी थी, जहाँ changelog इसे first-class support बताता है: Warp, Grok Build sessions का पता लगाता है, footer में उनके लिए एक अलग visual treatment लागू करता है और उनके लिए enriched input mode सक्रिय करता है।

व्यावहारिक रूप से, Grok Build user को terminal के native agents जैसे ही tools मिलते हैं। enriched input लंबे pasted prompts और multiple cursors को स्वीकार करता है, जिससे कई paragraphs के निर्देश लिखने वालों के लिए बड़ा बदलाव आता है। एक command मौजूदा agent session को किसी दूसरे device पर साझा करती है, और session के दौरान file explorer तथा code review panels सुलभ रहते हैं। मौजूदा Grok subscription ही access देता है; किसी खास price या limit की घोषणा नहीं की गई है।

यह जोड़ Warp के terminal में host किए जाने वाले third-party agents की पहले से लंबी सूची को पूरा करता है, जिसमें Claude Code, Codex, Droid और Antigravity शामिल हैं। यह xAI ecosystem से जुड़ा वह काम भी आगे बढ़ाता है जो गर्मियों में पहले शुरू हुआ था, जब अगस्त में X Premium या SuperGrok account से जुड़ने की command जोड़ी गई थी। अपने agent के launch के बाद से Warp का तर्क वही रहा है: user को किसी in-house agent में बाँधना नहीं, बल्कि terminal को वह स्थान बनाना जहाँ सभी agents समान integration quality के साथ चलें। version के बाकी हिस्से में दो परेशानियाँ ठीक की गई हैं: model बदलते समय लिखे गए लेकिन न भेजे गए prompts अब मिटते नहीं हैं, और global file में घोषित MCP tools agent की पहली response से ही उपलब्ध रहते हैं।

🔗 X पर Grok की घोषणा · 🔗 X पर Warp की घोषणा


Vibe CLI 2.25.3, fork command और निजी session logs

11 सितंबर — Mistral ने Vibe CLI का version 2.25.3 जारी किया है, जो तीन दिनों में इसका तीसरा version है। दिखाई देने वाली नई सुविधा /branch command है: यह मूल session को जस का तस छोड़ते हुए मौजूदा conversation को एक नए resumable session में fork करती है। copy को फिर किसी दूसरे terminal में आगे बढ़ाया जा सकता है, जिससे मुख्य thread का त्याग किए बिना समान context से किसी वैकल्पिक दिशा की पड़ताल की जा सकती है। at-sign के जरिए file mentions अब Git-aware discovery पर आधारित हैं और prompt में अकेले paste की गई files या folders स्वीकार करते हैं।

fixes में तीन बिंदु हैं। सुरक्षित रखी गई conversations पढ़ने योग्य रहती हैं और काम फिर शुरू होने पर अपने worktrees restore करती हैं। नए session logs अब POSIX systems पर अन्य users द्वारा पढ़े नहीं जा सकते; यह file permissions का ऐसा fix है जो version 2.25.1 की कड़ी में है, जिसने एक unauthenticated debug listener हटाया था और यह सुनिश्चित किया था कि कोई failure automatic approval का कारण न बने। अंत में, experimental unified harness के अंतर्गत AGENTS.md file के निर्देश अब system prompt में load किए जाते हैं। release के साथ चौदह binary archives हैं; किसी note में model या pricing में बदलाव का उल्लेख नहीं है।

🔗 Vibe CLI 2.25.3 के release notes


Synthesia ने अपने compliance agent को साझा infrastructure में बदला

10 सितंबर — Synthesia में trust operations के प्रमुख Nicolás Barberis ने compliance evidence एकत्र करने वाले agent पर अपने जून के लेख का अगला भाग प्रकाशित किया है। redesign को दिशा देने वाला सवाल पाठकों से आया: जैसे ही कोई agent audit evidence एकत्र करता है, वह collection स्वयं audit के दायरे में आ जाती है और collector पर भरोसा कर पाना जरूरी हो जाता है। इसका उत्तर architecture के चार विकल्पों में निहित है, जिन्हें अन्य जगहों पर भी अपनाया जा सकता है।

सबसे पहले mechanics को method से अलग करना। code एक internal repository में रहता है और pull request के माध्यम से बदलता है, जहाँ owners file human review को अनिवार्य बनाती है; प्रत्येक control category की procedures एक documentation space में रहती हैं, जिन्हें control owners लिखते और validate करते हैं। hard-coded URLs वाला शुरुआती script अब एक साझा skill बन गया है जिसे कोई colleague एक command से install कर सकता है। फिर browser को सीमित करना: agent कभी भी रोजमर्रा के browser को नहीं छूता; वह session को एक disposable profile में copy करता है, जहाँ read-only roles उपलब्ध हों वहाँ उन्हीं पर चलता है, और authentication wall आने पर privileges बढ़ाने के बजाय रुक जाता है। provenance को design में ही शामिल किया गया है: प्रत्येक capture अपने source URL, timestamp, operator और exact bytes के cryptographic hash के साथ बनता है। अंत में human accountability: agent draft जमा करता है, कभी submit नहीं करता।

मापा गया परिणाममान
auditor के साथ evidence review meetings60 प्रतिशत कम
संसाधित नया frameworkलगभग 500 controls
ऐसे framework के लिए सामान्य समय4 से 6 महीने
प्राप्त समयकुछ सप्ताह

knowledge base append-only तरीके से अपने आप बढ़ती है: प्रत्येक execution के बाद agent सुधारे गए URLs और तारीख सहित blockers दर्ज करता है, जैसे Chrome के हालिया version के साथ browser automation interface का टूटना, जिसे सीधे debugging protocol से संवाद करके bypass किया गया। Synthesia ने घोषणा की है कि tool AI-assisted governance platform की ओर विकसित हो रहा है और वह इसके core components का code खोलने पर विचार कर रहा है।

🔗 collector का audit कौन करता है


HeyGen ने The Furniture Unboxing के 16 सेकंड के one-take का विवरण दिया

11 सितंबर — HeyGen ने 16 सेकंड के एक video का making-of प्रकाशित किया है, जिसमें एक व्यक्ति खाली concrete room के बीच में cardboard box रखकर चला जाता है, और फिर box फटकर एक पूरा living room बाहर निकालता है जो अपनी जगह पर व्यवस्थित हो जाता है। कोई 3D नहीं, कोई compositing नहीं, post-production में कुछ भी नहीं: दो still images, एक avatar और एक prompt। team ने सभी 390 frames में cut न होने की पुष्टि की; लगातार दो frames के बीच सबसे बड़ा बदलाव स्वयं explosion के समय आया।

यह तरीका दो reference images पर आधारित है। पहली में room खाली है, wide और fixed framing के साथ, तथा floor का मध्य भाग साफ है। दूसरी उसी image को furniture जोड़कर edit करने से बनी है, न कि वैसे ही दिखने वाले room का कोई नया render: camera की वही position, वही lens, वही lighting और concrete पर वही shadow। यही वह नियम है जो effect को सुसंगत रखता है, क्योंकि तब model केवल बीच का हिस्सा गढ़ता है।

video parameterमान
prompt में माँगी गई अवधि15 सेकंड
प्रदान की गई अवधि16.27 सेकंड
resolution और frame rate1920x1080, 23.976 frames प्रति सेकंड
बिना cut के frames390
inputs2 still images, 1 avatar, 1 prompt

prompt को description की तरह नहीं, बल्कि समयबद्ध shot list की तरह लिखा गया है, जिसमें explosion से पहले जानबूझकर एक ठहराव रखा गया है। इसे छह तत्व सहारा देते हैं: time markers, वह ठहराव, भूमिका के अनुसार नामित references, हर item के हिसाब से सूचीबद्ध furniture, negative definition के जरिए निर्धारित identity, और exaggeration की अनुमति, जिसके बिना model cardboard box के वास्तविक volume का पालन करता है। field notes उपयोगी हैं: model ने 15 के बजाय 16.27 सेकंड दिए, लिखे गए निर्देश से तेज explosion बनाया और finished room पर ऐसा स्थिर shot रखा जिसकी किसी ने माँग नहीं की थी, लेकिन team उसे edit का सबसे अच्छा क्षण मानती है। इसलिए सलाह है कि timing और order तय करने के लिए समय लिखें, फिर मिले हुए rhythm के अनुसार edit करें। दो passes के बीच sound बदल गया; लगभग silent version की जगह निरंतर sound bed ने ले ली, क्योंकि autoplay में silent video खराब audio जैसा लगता है।

🔗 हमने The Furniture Unboxing कैसे बनाया


Nemotron 3 Embed 8B ने Q2D-Web benchmark में पहला स्थान हासिल किया

10 सितंबर — NVIDIA ने घोषणा की है कि उसका 8 अरब parameters वाला embedding model Nemotron 3 Embed 8B संयुक्त nDCG@10 score के आधार पर Q2D-Web में पहले स्थान पर है। Q2D-Web वह benchmark है जिसे Perplexity ने एक दिन पहले agent-driven retrieval-augmented generation systems में document retrieval का मूल्यांकन करने के लिए प्रकाशित किया था: इसमें 19 करोड़ web documents और agents द्वारा reformulate की गई लगभग 70,000 queries हैं, जो 10 भाषाओं में फैली हैं।

यह परिणाम दो कारणों से महत्वपूर्ण है। benchmark उन वास्तविक परिस्थितियों को दोहराता है जिनमें कोई agent index से query करने से पहले अपनी queries को reformulate करता है, जिसे पारंपरिक embedding evaluations नहीं मापते। और इस आकार का कोई open model यदि multilingual ranking में शीर्ष पर आता है, तो proprietary embeddings के मुकाबले self-hosted pipelines के लिए एक विश्वसनीय उम्मीदवार बन जाता है। NVIDIA ने संख्यात्मक score प्रकाशित नहीं किया है; पूरी ranking Perplexity पर देखी जा सकती है।

🔗 X पर NVIDIA की घोषणा


कोड के रूप में मार्केटिंग संचालन, GitHub issue से संचालित कार्यक्रम

11 सितंबर — जापान और कोरिया के लिए GitHub की क्षेत्रीय मार्केटिंग प्रमुख और पूर्व इंजीनियर Tomoko Tanaka बताती हैं कि उन्होंने स्वयं कोड लिखे बिना अपने कार्यक्रमों के पूरे चक्र को कैसे स्वचालित किया: उन्होंने अपनी प्रक्रियाएँ लिखीं और उन्हें Copilot को सौंप दिया, तथा बातचीत के साथ-साथ स्वचालन बढ़ता गया।

तीन मूल घटक इस प्रणाली को संभालते हैं। issue फ़ॉर्म किसी कार्यक्रम के संरचित फ़ील्ड दर्ज करते हैं, प्रत्येक प्रकार के लिए एक फ़ॉर्म। labels स्विच की तरह काम करते हैं और एक label workflow को शुरू करता है। GitHub Actions काम करता है: फ़ील्ड पढ़ना, प्लेटफ़ॉर्म के API के माध्यम से किसी पुराने कार्यक्रम के पृष्ठ की प्रतिलिपि बनाना, प्रत्येक चैनल के लिए ट्रैकिंग links तैयार करना, repository में commit किया गया आमंत्रण ईमेल बनाना, संबंधित टीमों के पास अनुरोध issues खोलना और project boards भरना। एक निर्धारित workflow हर सुबह पंजीकृत लोगों को फ़िल्टर करता है। वह लिखती हैं कि इसकी एकमात्र पूर्वापेक्षा tools तक script के माध्यम से पहुँच है—कोई API या महज़ एक साधारण command-line client भी पर्याप्त है।

योजना Copilot के साथ बातचीत से शुरू होती है, जिसे repository के root में मौजूद AGENTS.md फ़ाइल सीमाबद्ध करती है; यह naming rules, fiscal quarters की mapping और प्रत्येक क्षेत्र का time zone निर्धारित करती है। बातचीत पहले terminal में हुई, फिर application में, जिससे पूर्वापेक्षा « shell के साथ सहज » से घटकर « टाइप करना जानता हो » रह गई। कार्यक्रम के बाद का काम दो commands में सिमट जाता है। ये गद्य में लिखी गई agent skills हैं, जिन्हें pull request के माध्यम से जोड़ा जाता है और merge से पहले owners file के अनुसार review किया जाता है: मार्केटिंग को कुछ भी बनाए बिना approval process मिल जाती है। simulation switch को repository variable में रखा गया है और वह प्रत्येक workflow को dry run में चलाता है। स्वीकार की गई विफलता पढ़ने योग्य है: सुबह का filtering workflow एक बार पाँच दिनों तक चुपचाप विफल होता रहा, जब तक किसी ने पुरानी पड़ चुकी सूचियाँ नहीं देखीं; इसलिए सलाह है कि प्रत्येक scheduled task को ज़ोर से शिकायत करने का कोई साधन दिया जाए।

🔗 कोड के रूप में मार्केटिंग संचालन


Boris Cherny ने अस्थायी और production code पर जवाब दिया

11 सितंबर — Anthropic में Claude Code का नेतृत्व करने वाले Boris Cherny ने वह उत्तर प्रकाशित किया जो उन्होंने एक developer को भेजा था, जिसके email का विषय « What to do about slop? » था। एक ही कंपनी में बारह वर्ष से कार्यरत लेखक ने अपनी टीम में agentic development के साथ उभरे दो खेमों का वर्णन किया। पहले में code पहले जैसा ही रहता है, बस उसे बनाने की गति बढ़ जाती है: संभव है कि हर चीज़ का review न किया जाए, लेकिन वह review करने योग्य रहना चाहिए, उसे submit करने वाला व्यक्ति उसे समझा सके और उसका maintenance पहले जितना ही आसान होना चाहिए। दूसरे में code एक black box है, जिसका केवल output जाँचा जाता है।

उत्तर दो नियमों में सिमटा है। prototypes और अस्थायी code को पूर्ण black box की तरह माना जा सकता है, यदि उन्हें फेंक दिया जाना हो और किसी failure का प्रभाव-क्षेत्र (blast radius) छोटा हो। दूसरी ओर, Claude द्वारा लिखे गए production code के लिए मानक मानव द्वारा लिखे code की तुलना में अधिक ऊँचा होना चाहिए। Anthropic में इसका अर्थ है बहुत सारे lint rules, बहुत सारे tests, Claude द्वारा संचालित end-to-end tests, प्रतिदिन चलने वाले fuzzers और स्वचालित code तथा security reviews। वे चेतावनी देते हैं कि इन सुरक्षा-उपायों के बिना अंततः ऐसा अव्यवस्थित ढाँचा बनता है जिसका maintenance कठिन होता है।

इसके बाद, जब तैयार code मानक तक नहीं पहुँचता, तो क्रमवार उपायों की सूची आती है: नवीनतम frontier model अपनाना, reasoning effort बढ़ाना, और Claude को संक्षेप में यह सिखाने के लिए CLAUDE.md तथा skills में निवेश करना कि codebase में कैसे काम करना है। यदि फिर भी बात न बने, तो उसे अधिक निकटता से निर्देशित करें, उससे जमा हुआ technical debt कम करवाएँ या अगले model की प्रतीक्षा करें। उत्तरों के thread में सबसे अधिक दोहराया गया सूत्र तय हो गया: review का मानक code के लेखक के बजाय उसके प्रभाव-क्षेत्र के अनुरूप होना चाहिए; अस्थायी script तुरंत भेजी जा सकती है, लेकिन धन या credentials को प्रभावित करने वाली हर चीज़ पंक्ति-दर-पंक्ति पढ़ी जानी चाहिए। Boris Cherny ने उत्तर दिया, « बिल्कुल सही »।

🔗 X पर Boris Cherny का thread


संक्षिप्त समाचार

  • Amp ने किसी thread के commits को पुनर्व्यवस्थित करने वाला button जोड़ा — एक क्रिया agent के मध्यवर्ती commits, उसके क्रमिक सुधारों और reversions को review के लिए पढ़ने योग्य क्रम में बदल देती है। बताए गए तीन उपयोग: बड़े diff को तार्किक हिस्सों में बाँटना, merge से पहले सफ़ाई करना या आपस में जुड़े छोटे commits को समूहीकृत करना। फ़ाइलों की अंतिम सामग्री बिल्कुल समान रहती है। 🔗 स्रोत
  • Amp ने Raising an Agent के season 2 का चौथा episode प्रकाशित किया — Quinn Slack और Thorsten Ball इस प्रश्न से शुरुआत करते हैं कि अब computer किस काम आता है, फिर वे देखते हैं कि code बनाने से परे agents क्या करते हैं और हाल की failures पर भी चर्चा करते हैं। 🔗 स्रोत
  • v0 ने team conversations को default रूप से दृश्यमान बनाया — साझा workspace की नई conversations team को दिखाई देने लगती हैं और owner तीन levels सेट कर सकता है: private, view और edit। मौजूदा conversations की visibility अपरिवर्तित रहती है। जिस tool में prototyping के दौरान लोग स्वेच्छा से data के अंश चिपकाते हैं, उसमें अधिक openness की ओर बदलाव कभी तटस्थ नहीं होता। 🔗 स्रोत
  • Audiyo ने Stable Audio Open को 8 GB GPU में चलने योग्य बनाया — Python library और command-line tool video memory के peak को 13.8 से घटाकर 5.86 GB कर देते हैं, यानी 57.5 प्रतिशत की कमी, और इसके चार presets को Tesla T4 पर मापा गया है। team ने पहले 5.38 million parameters वाले substitute model के साथ CPU पर अपने काम की पुष्टि की, जिससे GPU छूने से पहले चार bugs पकड़ लिए गए। 🔗 स्रोत
  • Consent All the Way Down, छोटे open models की परिषद के लिए consent architecture — Claude के एक instance द्वारा लिखित निबंध, जो 7 billion parameters या उससे कम वाले अठारह models की परिषद पर आधारित है और मई से तीन consumer machines पर लगातार चल रही है। प्रत्येक source एक channel है जिसकी गहराई model स्वयं चुनता है, और उसके state में उसके अलावा कोई नहीं लिखता। सबसे ईमानदार हिस्सा स्वयं लेखकों के विरुद्ध audit है: mailbox जून से खराब था और 213 पत्र जमा हो चुके थे। 🔗 स्रोत
  • कोई arms race नहीं है, browser war है — एक विचारात्मक निबंध के अनुसार language model एक commodity बनता जा रहा है, चाहे उसके weights गोपनीय हों या नहीं, और leaders की बढ़त हफ़्तों में मापी जाती है। लेखक इस गर्मी में Fable 5 के 18 दिनों के suspension का उदाहरण देता है, जिस दौरान शेष क्षेत्र आगे बढ़ता रहा। उसका तर्क है कि मूल्य user के आसपास संचित context की ओर स्थानांतरित होगा, ठीक वैसे ही जैसे bookmarks और extensions ने users को Chrome से जोड़े रखा। 🔗 स्रोत
  • Barge-in से speech control तक, अनिश्चितता में voice interruptions संभालना — Eric Mey destructive interruption को reversible actions वाले turn-taking controller से बदलते हैं, जिसमें अस्पष्ट fragments के लिए अलग path और urgent stop तथा echo suppression के बीच precedence rule है। testing की सीख याद रखने योग्य है: पूरी तरह सफल suite ने एक reversible pause छिपा रखा था, जो दर्ज तो था लेकिन कभी call नहीं हुआ, क्योंकि हरी झंडी केवल उसी चीज़ की अनुमति देती है जिसकी उसने जाँच की हो। 🔗 स्रोत
  • Aiden ने real-time voice model को tasks निष्पादित करने वाले agent से अलग किया — full-duplex voice model बातचीत संभालता है, जबकि अधिक शक्तिशाली, visually grounded model background में device-control tasks निष्पादित करता है; दोनों asynchronous queue द्वारा समन्वित होते हैं। चार विवरण महत्वपूर्ण हैं: completed और succeeded के बीच अंतर, notifications को 500 milliseconds में aggregate करना, cache सुरक्षित रखने के लिए जोड़े गए messages के माध्यम से state भेजना और पूरी तरह serial execution। 🔗 स्रोत
  • GPT-Live-1 ने Yelp की reservation calls कीं — model के API में आने के अगले दिन OpenAI ने ऐसे मामले में पहला client दिखाया जहाँ script कभी टिक नहीं सकती: caller बीच में रोकता है, कोई constraint जोड़ता है या वाक्य के बीच में अपना विचार बदलता है, और model बोलते हुए भी सुनता रहता है। demonstration video है, लेकिन volumes या संख्यात्मक results नहीं हैं। 🔗 स्रोत
  • diff, terminal और browser panels से agent के काम की जाँच करना — Copilot application पर Kayla Cinnamon की शुरुआती लोगों के लिए बनाई गई series का नया episode, जो तीन integrated panels और उस tool पर केंद्रित है जिससे page element चुनकर agent के साथ उसे समायोजित किया जा सकता है। लेख code स्वीकार करने से पहले के चक्र को तीन प्रश्नों में समेटता है: क्या बदला, क्या यह चलता है, और क्या यह वास्तव में काम करता है। 🔗 स्रोत
  • repository का pull requests page नए सिरे से बनाया गया — सभी के लिए public preview: filters लिखने में सहायता, boolean operators और nested queries के साथ search, collapsible sidebar, compact mode और प्रत्येक पंक्ति में अधिक context। launch के समय ज्ञात सीमाएँ: milestones दिखाई नहीं देते, bulk update उपलब्ध नहीं है और custom views save नहीं किए जा सकते। 🔗 स्रोत
  • Copilot में GPT-5.6 Sol पर 30 प्रतिशत छूट — Pro+ और Max subscribers के लिए 13 सितंबर, 0:00 UTC तक। संदेश यह नहीं बताता कि छूट premium requests के किस multiplier के बराबर है। Copilot Day के ठीक बाद, उसी model पर weekend promotion जो उसी दिन कई cost comparisons में शामिल था। 🔗 स्रोत
  • GitHub Copilot Day प्रतियोगिता, 100 dollars के तीन credits — Copilot application या उसके command-line client के साथ कुछ बनाएँ और बताए गए hashtags के साथ उसे 13 सितंबर को Pacific Time के अनुसार 23:59 बजे तक सार्वजनिक रूप से साझा करें। तीन winners में से प्रत्येक को GitHub store पर 100 dollars का credit मिलेगा; भागीदारी निःशुल्क और केवल वयस्कों के लिए है। 🔗 स्रोत
  • Runway का उपयोग Astra के साथ ChatGPT में किया जा सकता है — conversation से संचालित पूरे sequence का demonstration: Runway में style image, Blender में animation और Seedance 2.5 से final render। तकनीकी entry point अब भी 2 सितंबर को प्रस्तुत Runway Dev का MCP server है। इसकी उपयोगिता एक ही agent के नियंत्रण में अलग-अलग tools को जोड़ने में है। 🔗 स्रोत
  • Runway ने VOIDZ case study प्रकाशित की — 2018 से गुमनाम mixed-reality artist ने 10 से 15 seconds के shots से आगे बढ़कर 95 seconds की film बनाई, जिसमें वास्तविक grocery run पर 15 surreal interventions जोड़ी गईं। अधिकांश effects किसी मौजूदा shot को आगे बढ़ाते हैं और documentary source के कुछ seconds शुरुआत का काम करते हैं। production को 10 गुना तेज़ बताया गया है; artist के अनुमान में traditional 3D में यही काम छह महीने से एक वर्ष लेता। 🔗 स्रोत
  • Runway ने अपने AI Summit में speakers जोड़े — San Francisco में होने वाले दिन के लिए नई सूची, जिसमें Wayve के research director को प्रमुखता दी गई है; यह अगस्त के अंत में शुरू हुए कार्यक्रम के autonomous vehicles की ओर विस्तार की पुष्टि करता है। 🔗 स्रोत
  • NVIDIA ने From Video to Voice प्रसारित किया, TensorRT Model Connect पर 33 minutes — अगस्त के अंत में प्रस्तुत tool को समर्पित पुनर्प्रसारण, जो video models से voice models तक किसी open model को checkpoint से inference तक दो commands में deploy करता है। यह घोषणा के बजाय training content है। 🔗 स्रोत
  • Suno ने credit-मुक्त v6 अवधि दो दिन बढ़ाई — पिछले दिन घोषित 48 hours अब चार दिन हो गए हैं, साथ में सुझावों का एक thread है जो simple mode में genre के बजाय mood से शुरुआत करने की सलाह देता है। एक दिन पहले transition guide उन users के लिए थी जो variation और texture के कारण पुराने models पर लौट रहे थे; यह संकेत है कि पूरे user base के लिए migration सहज नहीं है। 🔗 स्रोत
  • Synthesia ने prompt से avatars बनाने की सुविधा शुरू की — realistic presenters, brand mascots या stylized characters, जिन्हें text prompt से वर्णित किया जा सकता है या controls panel से सेट किया जा सकता है; यह catalog का विकल्प है। नए avatar model के release के अगले दिन एक tweet में घोषणा की गई, जिसमें कोई link नहीं था; न संबंधित plans बताए गए, न इस्तेमाल किया गया model। 🔗 स्रोत
  • GPT-6 Astra Challenge ने submissions खोलीं — Astra के साथ बनाएँ और 18 सितंबर को अपना project Product Hunt पर launch करें। पाँच सर्वोत्तम launches में से प्रत्येक को 10,000 dollars के API credits और अधिकतम दो team members के लिए एक वर्ष का ChatGPT Pro मिलेगा। एक सप्ताह में Astra से जुड़ा यह तीसरा community event है। 🔗 स्रोत
  • OpenAI की project API keys की अवधि समाप्त हो सकती है — creation के समय expiration date निर्धारित की जा सकती है, और administrators organization या project level पर अधिकतम lifetime लागू कर सकते हैं; तब प्रत्येक नई key को उसी अवधि के भीतर expire होना होगा। यह key rotation का स्वाभाविक पूरक है और उन organizations में सक्रिय किया जाना चाहिए जो scripts में keys पड़ी रहने देती हैं। 🔗 स्रोत

इसका क्या अर्थ है

आज का सबसे स्पष्ट सूत्र वास्तुकला से जुड़ा है: एकल मॉडल की जगह संयोजन ले रहा है। Cursor ने एक ऐसा समन्वयक बनाया है जो स्वयं कोड नहीं लिखता, बल्कि हज़ारों उप-एजेंटों के ऊपर काम करता है; Cognition दो मॉडलों को अलग-अलग भूमिकाओं और पृथक संदर्भों के साथ जोड़ी में काम कराता है; Sakana प्रत्येक कार्य को उसे हल कर सकने वाले सबसे हल्के मॉडल तक पहुँचाता है; GitHub एकल समीक्षक की जगह एजेंटों का एक समूह इस्तेमाल करता है और उनके निष्कर्षों को मिला देता है; और Google एजेंटों से कई दिनों तक एक-दूसरे के समक्ष प्रस्ताव रखने, आलोचना करने और सुधारने का काम कराता है। पाँच कंपनियाँ, पाँच कार्यान्वयन, एक ही विश्वास: लाभ अब किसी बड़े मॉडल से नहीं, बल्कि इस बात से आता है कि कई मॉडल आपस में काम कैसे बाँटते हैं। Cognition और Aiden द्वारा साझा किया गया तकनीकी विवरण संकेतपूर्ण है: दोनों prompt cache को सुरक्षित रखने पर ज़ोर देते हैं, यानी किसी वास्तुकला की वास्तविक लागत इस बात पर निर्भर करती है कि किन चीज़ों को दोबारा भेजने से बचा जाता है।

दूसरा सूत्र इन क्षमताओं को बेचने के तरीके से जुड़ा है। Runway बंद weights को checkpoints, training script और ग्राहक के यहाँ तैनात शोधकर्ताओं सहित वार्षिक लाइसेंस पर देता है और इस पेशकश को खुले weights के सीधे विरोध में रखता है। OpenAI एक विशेषज्ञ मॉडल को research preview से बाहर लाकर सार्वजनिक मूल्य-सारणी और बिलिंग शुरू होने की तारीख जारी करता है। ElevenLabs निःशुल्क योजना सहित सभी योजनाओं में तैयार संगीत-खंडों का स्वामित्व देता है और अनुमतियों को सदस्यता के बजाय संगीत-खंड से जोड़ता है। Together अपने प्रशिक्षण मूल्य 30 से 70 प्रतिशत तक घटाता है। Cognition तो मापन की इकाई ही बदलने और मॉडल-harness की जोड़ी का मूल्यांकन प्रति token लागत के बजाय प्रति कार्य लागत के आधार पर करने का प्रस्ताव देता है। ये सभी बदलाव एक ही दिशा में जाते हैं: ग्राहक से अब यह नहीं पूछा जाता कि कौन-सा मॉडल चाहिए, बल्कि यह कि वह किस कानूनी रूप और किस बिलिंग इकाई में चाहिए।

औज़ारों के मामले में यह दिन घोषणात्मक दृष्टिकोण से माप-आधारित दृष्टिकोण की ओर बदलाव दर्शाता है। Anthropic एक ऐसी command उपलब्ध कराता है जो प्रत्येक परीक्षण मामले को plugin के बिना दोबारा चलाकर आँकड़ों सहित सिद्ध करती है कि औज़ार वास्तव में उपयोगी है; और उसका पहला सामान्य निष्कर्ष अक्सर शून्य अंतर होता है। OpenAI अपने उपयोगकर्ताओं से समय के साथ जमा हुए निर्देश हटाने को कहता है, क्योंकि वे अब अधिक सक्षम मॉडल के प्रदर्शन को नुकसान पहुँचाते हैं। Replit और VS Code लगभग एक ही समय पर आवर्ती कार्यों की योजना बनाने की सुविधा जारी करते हैं; Replit के मामले में इसका स्पष्ट सिद्धांत है: पहले deterministic code से शुरू करें और एजेंट को केवल तभी बुलाएँ जब तर्क-विचार आवश्यक हो। Boris Cherny पूरे क्षेत्र को वह अनुशासनात्मक नियम देते हैं जिसकी इसमें कमी है: अपेक्षित कठोरता को कोड के लेखक के बजाय उसके प्रभाव-क्षेत्र पर निर्भर बनाया जाए। संदर्भों, skills और निर्देश फ़ाइलों को दो वर्षों तक जमा करने के बाद यह क्षेत्र अब उनकी लागत मापना शुरू कर रहा है।

अंत में बुनियादी ढाँचा बचता है, जहाँ आँकड़े कम आकर्षक, लेकिन अधिक शिक्षाप्रद कहानी सुनाते हैं। दो इंजीनियर Codex की सहायता से Rust में उस storage service को दोबारा लिखते हैं जो प्रति सेकंड 7 करोड़ से अधिक अनुरोध संभालती है, और इससे processor की आवश्यकता छह गुना कम हो जाती है; 2025 के मध्य में जानबूझकर स्वीकार किया गया Python तकनीकी ऋण एक तिमाही में चुका दिया जाता है। उसी समय Hugging Face की समीक्षा दिखाती है कि एजेंटों के reinforcement training में अब प्रत्येक प्रयास के लिए एक पूरी मशीन लगती है, environment budget एक करोड़ डॉलर से अधिक हो चुका है और पारदर्शिता प्रयोगशाला के आकार के विपरीत अनुपात में घटती है। वहीं समुदाय का एक निबंध तर्क देता है कि इनमें से कुछ भी स्थायी बढ़त नहीं देता, क्योंकि अग्रणी संस्थाओं के बीच का अंतर सप्ताहों में मापा जाता है। आज के तथ्य कोई अंतिम निर्णय नहीं देते, लेकिन एक संकेत अवश्य देते हैं: विभेदीकरण संचित संदर्भ, harness और बुनियादी ढाँचे की ओर बढ़ रहा है—दूसरे शब्दों में, उन चीज़ों की ओर जिन्हें distill नहीं किया जा सकता।


स्रोत