खोजें

DeepSeek-V4-Pro अपने खुले वज़न प्रकाशित करता है, Gemini 3.7 Flash आता है, GPT-5.6 Sol Ultrafast के साथ तेज़ी से आगे बढ़ता है

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
DeepSeek-V4-Pro अपने खुले वज़न प्रकाशित करता है, Gemini 3.7 Flash आता है, GPT-5.6 Sol Ultrafast के साथ तेज़ी से आगे बढ़ता है

ai-powered-markdown-translator

फ्र से hi में अनुवादित लेख, gpt-5.4-mini के साथ।

GitHub पर प्रोजेक्ट देखें ↗

13 अगस्त 2026 को, DeepSeek अपना प्रमुख मॉडल DeepSeek-V4-Pro लॉन्च करता है, जिसे उसकी घोषणा के दिन ही MIT लाइसेंस के तहत खुले वज़न के रूप में जारी किया गया है, जबकि Google Gemini 3.7 Flash का अनावरण करता है, जो कोड और एजेंट्स के लिए उसका नया रोज़मर्रा का मज़बूत मॉडल (workhorse) है — जो आज से GitHub Copilot में भी उपलब्ध है। OpenAI अपनी ओर से Ultrafast का पूर्वावलोकन करता है, एक सेवा स्तर जो Cerebras हार्डवेयर की बदौलत GPT-5.6 Sol को 14 गुना तक तेज़ चलाता है। इसके अलावा: Anthropic डिवाइसों के बीच Claude सत्रों को सिंक करता है, Cursor Builds के साथ अपने cloud agents को तेज़ करता है, Grok 4.6 Perplexity, Warp और Genspark में अपना रोलआउट जारी रखता है, और Hugging Face मॉडलों तथा खुले अध्ययनों के प्रकाशनों की संख्या बढ़ाता है।


DeepSeek-V4-Pro : प्रमुख मॉडल का लॉन्च, Hugging Face पर खुले वज़न

13 अगस्त — DeepSeek अपना प्रमुख मॉडल DeepSeek-V4-Pro लॉन्च करता है, जो घोषणा के दिन ही ऐप, वेब (״Mode Expert״ के माध्यम से) और API पर तुरंत उपलब्ध है, जबकि मॉडल नाम दस्तावेज़ीकरण में अपरिवर्तित रहते हैं। घोषणा में एजेंट पक्ष में बड़े सुधारों को रेखांकित किया गया है, जहाँ V4-Pro और हल्के V4-Flash संस्करण दोनों के लिए अब समायोज्य reasoning effort उपलब्ध है।

प्रयास का स्तरअनुशंसित उपयोग
कमसरल कार्य
उच्चदैनिक agent workflow
अधिकतमजटिल कार्य

एक और तकनीकी नवीनता: OpenAI Responses API का मूल समर्थन, जिसे Codex के लिए one-click configuration के साथ अनुकूलित किया गया है — यह संकेत है कि DeepSeek अपनी अलग, पृथक API देने के बजाय सीधे OpenAI format के इर्द-गिर्द बने agentic code tools के ecosystem को लक्ष्य बना रहा है।

Hugging Face के शोधकर्ता Elie Bakouch पुष्टि करते हैं कि V4-Pro MIT लाइसेंस के तहत Hugging Face पर खुले वज़न के रूप में भी प्रकाशित किया गया है। वे हालांकि “V4” नामकरण पर एक टिप्पणी करते हैं: पिछला संस्करण केवल एक preview था, जबकि इस संस्करण को बहुत अधिक प्रशिक्षण मिला है — उनके अनुसार यह “V4.5” जैसा अधिक लगता है। यह लॉन्च DeepSeek के लिए एक व्यस्त दिन का हिस्सा है, क्योंकि उसी दिन वह अपनी API pricing का पुनर्गठन और अपना पहला open source agent harness, DeepSeek Harness, भी प्रकाशित करता है (नीचे देखें) — एक सुसंगत समग्र पहल जो कंपनी को केवल मॉडल प्रदाता नहीं, बल्कि agentic ecosystem के पूर्ण खिलाड़ी के रूप में पुनर्स्थापित करती है।

We’re launching DeepSeek-V4-Pro today! Major Agent upgrades with strong production gains! Flexible reasoning effort for V4-Pro & V4-Flash: low for simple tasks, high for daily Agent workflows, max for complex tasks. Native OpenAI Responses API support, optimized for Codex with one-click setup.

🇮🇳 हम आज DeepSeek-V4-Pro लॉन्च कर रहे हैं ! एजेंट पक्ष में बड़े सुधार, और उत्पादन में मज़बूत लाभ ! V4-Pro और V4-Flash के लिए लचीला reasoning effort : सरल कार्यों के लिए कम, दैनिक agent workflow के लिए उच्च, जटिल कार्यों के लिए अधिकतम। OpenAI Responses API का मूल समर्थन, Codex के लिए one-click configuration के साथ अनुकूलित।@deepseek_ai on X

🔗 खुले वज़न और MIT लाइसेंस की पुष्टि


Gemini 3.7 Flash : कोड और एजेंट्स के लिए नया रोज़मर्रा का मज़बूत मॉडल (workhorse)

13 अगस्त — Google Gemini 3.7 Flash लॉन्च करता है, जिसे कोड और एजेंट्स के लिए अब तक का उसका सबसे बुद्धिमान रोज़मर्रा का मज़बूत मॉडल (workhorse) बताया गया है, और यह Gemini 3.6 Flash के केवल तीन सप्ताह बाद आया है। यह मॉडल तीन मुख्य उपयोगों को लक्षित करता है: सॉफ़्टवेयर इंजीनियरिंग, वेब डेवलपमेंट और जटिल ज्ञान-कार्य (दस्तावेज़ विश्लेषण, business workflows)।

बेंचमार्कमूल्यांकित क्षेत्र3.6 Flash3.7 Flash
FrontierCode 1.1 Mainकोड आउटपुट की गुणवत्ता34,4 %43,6 %
DeepSWE v1.1सॉफ़्टवेयर इंजीनियरिंग (डीबगिंग)49,0 %65,3 %
WebDev Arenaवेब डेवलपमेंट (Elo स्कोर)15381588
GDP.pdfदस्तावेज़ों की समझ22,0 %34,0 %
AutomationBenchस्वचालित business workflows17,0 %30,4 %

मूल्य निर्धारण की बात करें तो, Gemini 3.7 Flash को 31 दिसंबर 2026 तक introductory rate का लाभ मिलता है, जो 3.6 Flash के आधे मूल्य के बराबर है : इनपुट में प्रति मिलियन tokens $0,75 और आउटपुट में प्रति मिलियन $3,75 (जबकि जनवरी 2027 से standard rate पर $1,50 और $7,50 होंगे)। यह मॉडल आज से Google Antigravity में, Google AI Studio और Android Studio में Gemini API के माध्यम से, Gemini Enterprise Agent में, और Gemini Spark में उपलब्ध है — जो Google AI Pro और Ultra ग्राहकों को 160 से अधिक देशों में दिया जाने वाला proactive personal assistant है। Google यह भी बताता है कि उसने रासायनिक, जैविक, रेडियोलॉजिकल और परमाणु क्षेत्रों में दुष्ट उपयोगों के विरुद्ध, तथा साइबरसुरक्षा में आक्रामक क्षमताओं के विरुद्ध मॉडल की सुरक्षा guardrails को मज़बूत किया है।

उसी दिन, Gemini 3.7 Flash GitHub Copilot में भी तैनात होता है : GitHub के अनुसार, शुरुआती परीक्षण वेब और ऐप डेवलपमेंट तथा agentic coding में पिछले संस्करण की तुलना में प्रगति दिखाते हैं। यह तैनाती Copilot Pro, Pro+, Max, Business और Enterprise सदस्यताओं को कवर करती है, और VS Code, Visual Studio, Copilot CLI, Copilot cloud agent, Copilot app, JetBrains, Xcode और Eclipse में model selector के माध्यम से सुलभ है। Enterprise और Business योजनाओं के लिए, संगठन के सदस्यों के पहुँच पाने से पहले प्रशासकों को “Gemini 3.7 Flash Preview” policy सक्रिय करनी होगी; billing usage-based consumption के तहत vendor pricing का अनुसरण करती है।

Today we’re introducing Gemini 3.7 Flash, our most intelligent workhorse model yet for coding and agents. This model brings substantial gains across software engineering, web development, and complex knowledge work.

🇮🇳 आज, हम Gemini 3.7 Flash प्रस्तुत कर रहे हैं, जो कोड और एजेंट्स के लिए अब तक का हमारा सबसे बुद्धिमान रोज़मर्रा का मॉडल (workhorse) है। यह मॉडल सॉफ़्टवेयर इंजीनियरिंग, वेब डेवलपमेंट और जटिल ज्ञान-कार्य में महत्वपूर्ण सुधार लाता है।@Google on X

🔗 Google की आधिकारिक घोषणा · GitHub Copilot changelog


Ultrafast : Cerebras द्वारा संचालित, GPT-5.6 Sol 14x तक तेज़

13 अगस्त — OpenAI Ultrafast का अनावरण करता है, जो API के लिए एक नया service tier है और GPT-5.6 Sol को standard processing की तुलना में 14 गुना तक तेज़ चलाता है। Cerebras hardware द्वारा संचालित यह mode प्रति सेकंड 750 generated tokens तक पहुँचता है। अब तक, real-time speed पाने के लिए अधिक बुद्धिमत्ता की कीमत पर छोटे या विशेषीकृत मॉडल चुनना पड़ता था; Ultrafast इस समीकरण को बदलता है, और OpenAI के सबसे उन्नत मॉडल की क्षमताओं को त्यागे बिना प्रति सेकंड अधिक उपयोगी कार्य करने का लक्ष्य रखता है।

विशेषताविवरण
मॉडलGPT-5.6 Sol
गतिstandard processing से 14 गुना तक
throughputप्रति सेकंड 750 output tokens तक
हार्डवेयर साझेदारCerebras
उपलब्धताPreview, OpenAI API, sign-up access

OpenAI कई परिदृश्यों की पहचान करता है जहाँ यह गति नए उपयोग खोलती है : incident response (किसी incident के अभी चल रहे होने के दौरान logs, हालिया code changes और engineer reports का विश्लेषण), financial research (market signals और transactions का real time में विश्लेषण), vocal customer support (conversation तोड़े बिना जटिल समस्याएँ हल करना), commerce (cart abandonment से पहले product questions का जवाब देना) और experimental research (एक रात लगने वाली गणना को interactive session में बदलना)। ग्राहकों का एक पहला समूह पहले ही वास्तविक production परिस्थितियों में code, commerce, financial research और support के use cases पर GPT-5.6 Sol को Ultrafast mode में परीक्षण कर रहा है। OpenAI स्पष्ट करता है कि वह आंतरिक रूप से Ultrafast का उपयोग करता है, विशेष रूप से incident response के लिए।

फिलहाल, पहुँच API के माध्यम से सीमित संख्या में ग्राहकों तक ही सीमित है, और क्षमता अधिक कंपनियों तक बढ़ने के साथ सूचित किए जाने के लिए एक sign-up form उपलब्ध है।

Previewing Ultrafast mode: GPT-5.6 Sol at up to 14x the speed. Launching first in the OpenAI API to a select group of customers with expanded access to more businesses as capacity grows.

🇮🇳 Ultrafast mode का पूर्वावलोकन : GPT-5.6 Sol की गति 14 गुना तक। शुरुआत में OpenAI API में सीमित ग्राहकों के समूह के साथ लॉन्च, और क्षमता बढ़ने के साथ अधिक कंपनियों के लिए विस्तारित पहुँच।@OpenAI on X

🔗 Ultrafast का पूर्वावलोकन — आधिकारिक घोषणा


Claude डिवाइसों के बीच निरंतरता बढ़ाता है

Anthropic उसी दिन दो घोषणाएँ आगे बढ़ाता है जो एक ही दिशा में जाती हैं : एक Claude session जो अब device के बजाय उपयोगकर्ता का अनुसरण करता है।

Claude in Chrome — desktop, web और mobile पर synced sessions

12 अगस्त — Claude in Chrome, Anthropic का browser extension, के sessions अब उस device तक सीमित नहीं हैं जहाँ उन्हें खोला गया था। conversations अब save हो जाती हैं और desktop, web तथा mobile पर स्वतः मिल जाती हैं, जबकि उपयोगकर्ता के skills और connectors सीधे browser में उपलब्ध रहते हैं। यह सुविधा आज से Max और Team subscriptions के लिए उपलब्ध है, और आने वाले हफ्तों में Pro subscribers तक rollout की योजना है।

🔗 X पर घोषणा

Claude Cowork — side panel desktop, web और mobile के साथ session साझा करता है

12 अगस्त — Claude Cowork का side panel अब desktop, web और mobile applications के साथ वही session चलाता है। sessions किसी एक device के बजाय user account से जुड़े होते हैं, जिससे browser tab में कोई कार्य शुरू करके बाद में किसी दूसरे माध्यम से उसे जारी रखना संभव हो जाता है, बिना context खोए।

🔗 X पर घोषणा


एजेंटिक विकास उपकरण : Cursor, Devin और DeepSeek आगे बढ़ते हैं

13 अगस्त को कई AI-assisted development tools समानांतर रूप से आगे बढ़ते हैं, agent infrastructure, strategic hiring और live data तक सीधे पहुँच के बीच।

Cursor ने Builds लॉन्च किए — cloud agents पहले token तक 3 गुना तक तेज़

13 अगस्त — Cursor builds पेश करता है : development environment की pre-prepared copies (cloned repository, installed dependencies, पहले से चलाया गया installation script) जिन्हें cloud agents तुरंत शुरू करते हैं। Cursor आंतरिक रूप से 10 गुना तेज़ environment startup और first token तक 3 गुना तेज़ समय बताता है। सिस्टम resilient बना रहता है : यदि कोई build विफल हो जाता है, तो agents पृष्ठभूमि में विफलता को ठीक किए जाने तक अंतिम कार्यशील build के साथ काम करते रहते हैं। यह सुविधा Cloud Agents में बिना अतिरिक्त लागत शामिल है।

🔗 Cursor changelog

Cursor ने Firetiger टीम का स्वागत किया

13 अगस्त — Cursor Firetiger की टीम के आगमन की घोषणा करता है, ताकि ऐसे agents बनाए जा सकें जो अपने code को production तक फॉलो कर सकें और जो काम नहीं कर रहा है उसे ठीक कर सकें — यह आज की Builds घोषणा का एक तार्किक विस्तार है : Cursor development से लेकर production monitoring तक पूरे जीवनचक्र को कवर करना चाहता है। कोई वित्तीय विवरण साझा नहीं किया गया है।

🔗 X पर घोषणा

Devin (Cognition) सीधे MongoDB Atlas के live data पर काम करता है

13 अगस्त — Cognition Devin में MongoDB Atlas integration जोड़ता है : agent अब सीधे live database से query और management कर सकता है, और कार्य के दौरान एक नया cluster provision कर सकता है, बिना fixed schema या manually copied context के। उद्देश्य code agents की एक आम बाधा को हटाना है — यह प्रतीक्षा कि कोई मानव test database configure करे।

🔗 X पर घोषणा

DeepSeek Harness v0.1 : DeepSeek का पहला open source agent harness

13 अगस्त — DeepSeek DeepSeek Harness v0.1 को Developer Preview में प्रकाशित करता है, एक agent harness जिसे वह code को MIT लाइसेंस के तहत open-source करके दुनिया भर के developers के लिए खोल रहा है। इसका architecture आंतरिक meta-framework “Cordis” पर आधारित है और एक केंद्रीय विचार पर टिका है : सब कुछ एक plugin है — models, tools, skills, sessions, sandboxes, file systems, execution loops, orchestration और user interface। यह agent tooling layer में DeepSeek का पहला सार्वजनिक प्रवेश है, एक ऐसा क्षेत्र जो अब तक Claude Code या Codex CLI जैसे harnesses द्वारा occupied रहा है।

🔗 X पर घोषणा


खुले मॉडल और शोध : Hugging Face ने पहलों की संख्या बढ़ाई

कई प्रयोगशालाएँ लगातार खुले मॉडल और अध्ययन प्रकाशित करती हैं, जिनमें Hugging Face कई घोषणाओं के केंद्र में है।

MiniMax-Music3 : खुले वज़न वाला संगीत-जनन मॉडल

13 अगस्त — MiniMax MiniMax-Music3 प्रकाशित करता है, जो उसके संगीत-जनन मॉडल की नई पीढ़ी है, इस बार खुले वज़न में और production-ready के रूप में प्रस्तुत। Hugging Face के अनुसार, architecture एक 8 billion parameter LLM और एक 2,7 billion parameter DiT (Diffusion Transformer) को जोड़ता है ताकि एक prompt और lyrics को पूरी गीत में बदला जा सके, और इसे modest consumer GPUs पर चलने योग्य बनाया गया है, साथ ही diffusers और ComfyUI libraries का समर्थन भी है। MiniMax रिलीज़ के पहले दिन ही इसे एकीकृत करने के लिए Hugging Face टीम का धन्यवाद करता है; weights, एक audio demo और code Hugging Face, GitHub और ModelScope पर उपलब्ध हैं।

🔗 MiniMax घोषणा · Hugging Face पुष्टि · ऑडियो डेमो

Sakana Chat : Fugu, Namazu और code execution के साथ बड़ा अपडेट

12-13 अगस्त — Sakana AI Sakana Chat में एक बड़ा अपडेट जारी करता है, उसका मुफ़्त और login-रहित consumer product, जो अब Fugu, उसके orchestrator model, द्वारा संचालित है, और Namazu की नई पीढ़ी, उसके घर में बने Japanese LLM, के साथ जुड़ा है। सबसे बड़ी नवीनता पूर्ण code execution है : उपयोगकर्ता सीधे browser में, जापानी सहित, interactive web applications, games और tools का vibe-coding कर सकते हैं। Sakana दो उपयोग मामलों पर ज़ोर देता है : revision educational games (maths, kanji) और केवल एक Excel file से business analysis।

🔗 X पर घोषणा · ब्लॉग पोस्ट

Hugging Face : रोबोटिक्स डेटा लूप के लिए Strands Agents, LeRobot और Storage Buckets

13 अगस्त — Amazon (AWS Strands team) और Hugging Face एक संयुक्त पोस्ट प्रकाशित करते हैं, जिसमें Strands Agents (AWS का Apache 2.0 SDK), LeRobot (Hugging Face का robotics framework, जिसका data format 90 000 से अधिक datasets और models द्वारा उपयोग किया जाता है) और Xet Storage Buckets को मिलाने वाला एक robotic workflow वर्णित है। पोस्ट ठोस आँकड़े देती है : 500 Mo file के octets में 1 % बदलाव करने के लिए केवल 5,5 Mo re-upload की आवश्यकता होती है, और एक “hot” bucket स्थानीय copy के बिना streaming में लगभग 1 086 Mo/s throughput तक पहुँचता है।

🔗 Hugging Face पोस्ट

2 226 ICML 2026 पत्रों के पुनरुत्पादन हैकाथॉन का निष्कर्ष

13 अगस्त — Hugging Face अपने सामुदायिक हैकाथॉन (15 जुलाई – 2 अगस्त) का निष्कर्ष प्रकाशित करता है, जिसमें 1 221 प्रतिभागियों ने AI एजेंटों की मदद से ICML 2026 में स्वीकृत 2 226 पत्रों को पुनरुत्पादित करने की कोशिश की। नतीजा मिला-जुला रहा: लगभग 51 % पत्रों में कम-से-कम एक दावा स्वतंत्र रूप से सत्यापित हुआ, लेकिन 23 % में कम-से-कम एक दावा अमान्य या विवादित पाया गया। प्रमुख निष्कर्ष यह बताया गया: AI एजेंट मानव पर्यवेक्षण के तहत सबसे अच्छा काम करते हैं, और सफल पुनरुत्पादन में वे मनुष्य शामिल थे जो एजेंटों का मार्गदर्शन कर रहे थे तथा ऐसे प्रत्यक्ष/संवेदी निर्णय ले रहे थे जिन्हें केवल मीट्रिक्स नहीं पकड़ सकते थे।

🔗 Hugging Face की पोस्ट

FineBooks : ऐतिहासिक दस्तावेज़ों पर खुले OCR मॉडल का मूल्यांकन करने के लिए leaderboard

10 अगस्त — Hugging Face और EleutherAI FineBooks जारी करते हैं, एक leaderboard जो Biodiversity Heritage Library से प्राप्त, विशेषज्ञों द्वारा ट्रांसक्राइब किए गए 2 165 पृष्ठों पर 14 खुले OCR मॉडल का मूल्यांकन करता है। लक्ष्य: यह प्रश्न सुलझाना कि क्या खुले OCR मॉडल डिजिटाइज़ किए गए ऐतिहासिक अभिलेखों को उपयोगी बनाने के लिए पर्याप्त अच्छे हैं, और यह काम विक्रेता-मार्केटिंग घोषणाओं के बजाय एक संदर्भ डेटासेट के आधार पर करना।

🔗 X पर घोषणा


GitHub dependency graph के लिए लाइसेंस डेटा की गुणवत्ता बेहतर करता है

13 अगस्त — GitHub अपने लाइसेंस-संबंधी प्राथमिक सूचना स्रोत को बदलता है: अब ClearlyDefined सेवा पर प्राथमिक निर्भरता के बजाय dependency graph सीधे पैकेज रजिस्ट्रियों से पूछताछ करता है — npmjs.org, PyPI, crates.io, RubyGems, nuget.org, pkg.go.dev, Maven और pub.dev, तथा PHP के लिए Packagist भी। ClearlyDefined अब भी बैकअप के रूप में इस्तेमाल होता है। यह बदलाव कवरेज को काफी बेहतर करता है: 170 मिलियन पैकेजों के एक सेट पर लाइसेंस डेटा रहित पैकेजों की दर 45 % से घटकर 24 % हो जाती है। अब सिस्टम हर अलग version के लिए एक प्रविष्टि की माँग करने के बजाय version-range को ट्रैक करता है, जिससे अभी प्रकाशित न हुई भविष्य की versions भी स्वतः कवर हो जाती हैं। प्रभावित सुविधाओं में dependency जानकारी, सॉफ़्टवेयर nomenclature (SBOM), GitHub Advanced Security में license compliance, और dependency review actions शामिल हैं।

🔗 GitHub changelog


जनरेटिव मीडिया : एकीकरण और नियामकीय अनुपालन

जनरेटिव मीडिया उद्योग की कई घोषणाएँ 13 अगस्त को उत्पाद एकीकरण और नियामकीय अनुपालन के बीच एक साथ केंद्रित होती हैं।

HeyGen ने LiveAvatar में Cartesia को मूल रूप से एकीकृत किया

13 अगस्त — HeyGen और Cartesia एक मूल एकीकरण की घोषणा करते हैं: Cartesia का real-time voice engine अब सीधे LiveAvatar, HeyGen के real-time avatar उत्पाद, में चलता है। लक्ष्य है पहले से बने vocal agent को बिना तकनीकी पुनर्रचना के एक animated face देना, जो web app या API के जरिए उपलब्ध है।

🔗 X पर घोषणा

Luma और Dumbstruck ने विज्ञापन के लिए Creative Intelligence लॉन्च किया

13 अगस्त — Luma, भावनात्मक विश्लेषण मंच Dumbstruck के साथ साझेदारी करके “Creative Intelligence” बनाता है: Dumbstruck दर्शक-पैनलों पर emotion analysis के जरिए वीडियो विज्ञापन के उन सटीक क्षणों की पहचान करता है जहाँ दर्शकों का ध्यान भटकता है, फिर Luma केवल उन्हीं अनुक्रमों को पहले से मौजूद फुटेज से पुनः उत्पन्न करता है, बिना नई शूटिंग के।

🔗 X पर घोषणा

Synthesia ने AI Act के Article 50 के अनुपालन का विवरण दिया

13 अगस्त — Synthesia, AI Act के यूरोपीय Article 50 Code of Practice पर हस्ताक्षर करने वाली शुरुआती AI कंपनियों में से एक, अपनी पारदर्शिता संबंधी कार्रवाइयों का विवरण देती है: पात्र वीडियो में डिफ़ॉल्ट रूप से समाहित C2PA provenance signals (Content Credentials), जल्द आने वाले signed downloads ताकि यह जानकारी वीडियो फ़ाइल के साथ यात्रा करे, एक अदृश्य filigrane (watermarking) की खोज, और EU के reference design पर आधारित अनुकूलन योग्य AI labels।

🔗 पूरा लेख

Suno Studio 2.0 आधिकारिक रूप से लॉन्च हुआ

13 अगस्त — 11 अगस्त के teaser के बाद, Suno अब सामान्य उपलब्धता में Studio 2.0 लॉन्च करता है, जो ब्राउज़र में उसका संगीत production station (DAW) है और केवल one-click generation के बजाय हर track पर सूक्ष्म नियंत्रण देता है। Studio पहले से ही सामान्य प्रतिबंधों से मुक्त अलग-अलग tracks (stems) के डाउनलोड प्रदान करता है।

🔗 X पर घोषणा

GeForce NOW : मूल Linux ऐप बीटा से बाहर और cloud optimizations

13 अगस्त — NVIDIA GeForce NOW के मूल Linux ऐप को बीटा से बाहर लाता है, Ubuntu 24.04+ के समर्थन और एक नए Flatpak repository के साथ। प्रदर्शन के मोर्चे पर, NVIDIA server-side पर streaming में DLSS Frame Generation image generation को optimize करता है ताकि 1440p और 4K पर latency कम हो, और Chromebook Fast Pass कार्यक्रम के जरिए Chromebooks से 2 000 से अधिक PC games तक पहुँच देता है।

🔗 NVIDIA लेख


GPT-5.6 के लिए builder guide

13 अगस्त — OpenAI, GPT-5.6 परिवार के भीतर model selection पर developers के लिए एक guide प्रकाशित करता है। BrowseComp benchmark पर (वेब पर दुर्लभ तथ्यों की खोज), cost advantage स्पष्ट है:

मूल्यांकित मॉडलBrowseComp स्कोरलागत
GPT-5.5 Extra High (3 महीने पहले)84,36 %33,27 $
GPT-5.6 Luna Extra High (लॉन्च पर)84,04 %1,33 $

दूसरे शब्दों में, लगभग समान performance, लेकिन लागत 25 गुना कम। OpenAI सलाह देता है कि हल्के मॉडल (Terra, Luna) को उच्च-आयतन और low-latency-sensitive workflows के लिए रखा जाए, और प्रमुख model Sol को सबसे demanding कार्यों के लिए उपयोग किया जाए। Guide Responses API की तीन नई विशेषताओं का भी विवरण देता है: कॉल्स के बीच reasoning persistence, native compaction के साथ, native multi-agent orchestration, और deterministic कार्य को model के बजाय code में स्थानांतरित करने के लिए programmatic tool calling।

🔗 The builder’s guide to GPT-5.6


Grok 4.6 का प्रसार जारी: Perplexity, Warp और Genspark

xAI का Grok 4.6 मॉडल, 12 अगस्त को लॉन्च हुआ, 13 अगस्त को भी तृतीय-पक्ष टूल्स में फैलता जा रहा है — एक ही दिन में तीन अलग-अलग एकीकरण।

13 अगस्तPerplexity Grok 4.6 को Perplexity और Perplexity Computer, अपनी agentic layer, में उपलब्ध मॉडल के रूप में जोड़ता है। अपने आंतरिक WANDR benchmark पर, Perplexity का दावा है कि Grok 4.6 performance और efficiency के बीच Pareto frontier पर स्थित है, और Fable 5 के बराबर परिणाम देता है, वह भी 60 % से अधिक कम लागत पर।

Grok 4.6 is now available in Perplexity and Perplexity Computer. On WANDR, it sits on the Pareto frontier of performance and efficiency, matching Fable 5 results at over 60% lower cost.

🇮🇳 Grok 4.6 अब Perplexity और Perplexity Computer में उपलब्ध है। WANDR पर, यह performance और efficiency के बीच Pareto frontier पर स्थित है, और Fable 5 के बराबर परिणाम देता है, वह भी 60 % से अधिक कम लागत पर।@perplexity_ai on X

Warp पहले से मौजूद /connect-grok कमांड के जरिए Grok 4.6 समर्थन जोड़ता है, X Premium या SuperGrok subscription से login के साथ। 🔗 Warp घोषणा

Genspark Grok 4.6 को AI Chat, Code Agent और Genspark Claw में उपलब्ध कराता है, जो सीधे model selector से पहुँचा जा सकता है। 🔗 Genspark घोषणा


Perplexity Computer : Search as Code अधिक तेज़ और अधिक विश्वसनीय

13 अगस्त — Perplexity Search as Code (SaC) के लिए optimizations का विवरण देता है, जो जून में लॉन्च हुई उसकी व्यापक और गहन search सुविधा है, और गुणवत्ता बनाए रखते हुए प्रति कार्य लागत को लगभग 10 % तक घटाती है। Search SDK के दो अपडेट-तरंगें action execution reliability को 81,9 % से 92,6 % तक बढ़ाती हैं, जिससे user satisfaction बढ़ता है और Perplexity Computer में प्रति कार्य लागत 8 % घटती है।

🔗 पूरा thread


संक्षिप्त समाचार

  • Amp — छोटे सुधार (GLM-5.2 rapid mode, media cache, dictation, themes) — Amp का Low mode (GLM-5.2) लगभग 200 tokens/second का fast mode पाता है, agent द्वारा बनाए गए media को तुरंत लोडिंग के लिए cache किया जाता है, और dictation तथा theme के नए विकल्प सामने आते हैं। 🔗 Tweet
  • DeepSeek अपनी API pricing को peak/off-peak दरों के साथ अपडेट करता है — off-peak दरें peak दरों से 50 % कम होंगी, जो 16 अगस्त 2026 को 16:00 UTC से प्रभावी होंगी। 🔗 Tweet
  • TRL एक asynchronous GRPO trainer जोड़ता है, 2 से 4x तेज़ — Hugging Face library चल रहे किसी भी GRPO प्रशिक्षण को इस नए asynchronous trainer में स्थानांतरित करने की सलाह देती है। 🔗 Tweet
  • Gradio 6.24 ऐप निष्पादनों को स्वचालित रूप से सहेजता और पुनः चलाता है — निष्पादन history browser में संरक्षित रहती है, और server queue में दोबारा गए बिना उन्हें फिर से चलाने की सुविधा मिलती है। 🔗 Tweet
  • Hugging Face Science चयनित मॉडलों में demo Spaces जोड़ता है — spotlight किए गए models, datasets और papers अब सीधे परखे जा सकते हैं, केवल उनकी fiche के माध्यम से नहीं। 🔗 Tweet
  • Gemini Omni : तीन DeepMind विशेषज्ञ model के पीछे की कहानी बताते हैं — एक “behind the scenes” format जो वीडियो generation और editing के रचनात्मक उदाहरणों के माध्यम से Gemini Omni Flash की बहुमुखी प्रतिभा को दर्शाता है। 🔗 Google पोस्ट
  • GitHub guide : Copilot app में अपना पहला prompt कैसे लिखें — पहली prompt drafting, context और model चुनने, और दूसरे device से session फिर से शुरू करने पर एक व्यावहारिक guide। 🔗 GitHub guide
  • Grok Imagine Image 2.0 Runway पर उपलब्ध — xAI का image model प्लेटफ़ॉर्म पर पहले से एकीकृत image और video models के catalog में शामिल हो जाता है। 🔗 Tweet
  • NVIDIA Cursor के लिए 300 से अधिक skills खोलता है — Cursor agents अब 30 से अधिक NVIDIA products को कवर करने वाली 300 से अधिक skills तक पहुँच सकते हैं। 🔗 Tweet
  • MiniMax H3 Video Edit Arena पर पहली जगह का दावा करता है — सभी श्रेणियों को मिलाकर एक ranking, बिना किसी साझा की गई methodological detail के। 🔗 Tweet
  • Runway अपने 30 सितंबर के SF Summit के speakers का खुलासा करता है — Physical Intelligence, NVIDIA, Anyscale, Google DeepMind और CoreWeave के प्रतिनिधि घोषित वक्ताओं की सूची में शामिल होते हैं। 🔗 Tweet
  • OpenAI Dali Rajic को Chief Revenue Officer नियुक्त करता है — Wiz और Zscaler के पूर्व president और COO Denise Dresser की जगह वैश्विक revenue organization का नेतृत्व करेंगे। 🔗 OpenAI घोषणा
  • RingCentral IA-natif विकास के लिए ChatGPT Work और Codex तैनात करता है — एक “AI-Native Challenge” ने ChatGPT Work और Codex सभी कर्मचारियों को, गैर-तकनीकी लोगों सहित, एक पूर्ण परियोजना देने के लिए उपलब्ध कराया। 🔗 OpenAI अध्ययन

इसका क्या अर्थ है

Inference speed और cost की दौड़ आज के दिन का एक बड़ा हिस्सा आकार देती है। OpenAI का Ultrafast समर्पित Cerebras hardware की बदौलत अपने सबसे उन्नत model के लिए standard speed से 14 गुना तक वादा करता है, जबकि Google अपने Gemini 3.7 Flash entry price को आधा कर देता है ताकि production adoption तेज़ हो, और DeepSeek उसी दिन अपने commercial launch पर V4-Pro को MIT license के तहत open weights में जारी करता है। तीन अलग-अलग रणनीतियाँ — विशेषीकृत hardware acceleration, आक्रामक pricing, और पूर्ण weight openness — एक ही लक्ष्य की ओर बढ़ती हैं: cutting-edge inference को बड़े पैमाने पर सस्ता और तेज़ बनाना, हर एक अलग lever पर दांव लगाते हुए, न कि केवल model size की दौड़ पर।

AI-सहायित विकास उपकरण अधिक गहरी और अधिक interconnected infrastructure layers की ओर अभिसरित हो रहे हैं। Cursor Builds के साथ agent environments को पहले से तैयार करता है और code को production तक ट्रैक करने के लिए Firetiger टीम को भर्ती करता है, Devin MongoDB Atlas के जरिए live databases तक सीधी पहुँच प्राप्त करता है, और DeepSeek interchangeable plugins पर पूरी तरह निर्मित अपना open-source agent harness प्रकाशित करता है। दूसरी ओर, Anthropic Claude sessions को device से अलग करके user account से जोड़ देता है। साझा सूत्र: ये tools अब केवल isolated assistants नहीं रह गए हैं, बल्कि infrastructure layers बनते जा रहे हैं जहाँ execution environment, sessions के बीच continuity, और data access code generation जितने ही महत्वपूर्ण हैं।

खुले research ecosystem में विस्तार जितनी ही गहराई भी बढ़ रही है। Hugging Face 13 अगस्त को कई संरचनात्मक पहलकदमियाँ आगे बढ़ाता है: Strands Agents और LeRobot को जोड़ने वाला एक robotic workflow, मापे गए throughput gains के साथ; 2 226 ICML papers के reproduction hackathon का ईमानदार निष्कर्ष — जहाँ समीक्षा किए गए 23 % papers में एक invalidated दावा था, जो केवल automated supervision की सीमाएँ याद दिलाता है — और archival के ठोस उपयोग-केस के लिए बनाया गया OCR leaderboard (FineBooks), मार्केटिंग के लिए नहीं। इसके साथ-साथ MiniMax-Music3 जैसे अत्यंत विशिष्ट open models भी हैं, जो संगीत के लिए हैं, या जापानी में vibe-coding के लिए Sakana Chat का अपडेट: openness अब केवल सामान्य-purpose language models तक सीमित नहीं रही, यह पूरे-के-पूरे niches तक फैल रही है।

अंततः, उद्योग अपने नियमों को अब और अधिक अपनाता है, बजाय इसके कि उन्हें सहता रहे। Synthesia C2PA provenance signals को डिफ़ॉल्ट रूप से रखते हुए Article 50 के अपने अनुपालन का विस्तार से वर्णन करता है, GitHub पैकेज registries से सीधे पूछताछ करके अपने license data की विश्वसनीयता बेहतर करता है, और Grok 4.6 उसी दिन तीन अलग-अलग integrators (Perplexity, Warp, Genspark) में फैल जाता है, बिना किसी के इसे exclusive बनाने की कोशिश के। यह तेज़ normalisation — कुछ ही दिनों में लगभग हर जगह उपलब्ध model, पहले से सोची गई regulation न कि थोपी गई — ऐसे क्षेत्र को दर्शाती है जो अपनी distribution और governance practices को अपनी तकनीकी क्षमताओं के समान गति से परिपक्व कर रहा है।


स्रोत