खोजें

Jalapeño ने अपने पहले मापे गए आँकड़े पेश किए, WebMCP Challenge ने छह प्लेटफ़ॉर्म को एकजुट किया, Perplexity ने अपना एजेंट स्थानीय रूप से चलाया

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Jalapeño ने अपने पहले मापे गए आँकड़े पेश किए, WebMCP Challenge ने छह प्लेटफ़ॉर्म को एकजुट किया, Perplexity ने अपना एजेंट स्थानीय रूप से चलाया

ai-powered-markdown-translator

gpt-5.6-sol के साथ fr से hi में अनुवादित लेख।

GitHub पर प्रोजेक्ट देखें ↗

चौबीस घंटों में नौ क्षेत्रों से जुड़ी इक्यावन घोषणाओं के साथ 25 अगस्त का दिन सप्ताह का सबसे व्यस्त दिन रहा। इनमें चार घटनाक्रम प्रमुख हैं। OpenAI ने अपनी स्वयं निर्मित इंफ़रेंस चिप Jalapeño के पहले मापे गए परिणाम प्रकाशित किए और इसके तुरंत बाद Chrome, Cloudflare, Shopify, Vercel, Render और Netlify के साथ WebMCP पर केंद्रित दस दिवसीय हैकाथॉन शुरू किया। Perplexity ने अपने पूरे Computer एजेंट को उपयोगकर्ता की मशीन पर उतार दिया। IBM ने अपने रीजनिंग मॉडल की पहली फ़ैमिली Granite 4.2 को ओपन कर दिया। और Anthropic ने चैट तथा Cowork के बीच Claude की मेमोरी को एकीकृत करते हुए उसे फ़ाइल-दर-फ़ाइल पढ़ने और संशोधित करने योग्य बना दिया। बाकी घोषणाएँ—National Hurricane Center में WeatherNext Cyclones की तैनाती, Stability AI की सीरीज़ बी और टूल के लगभग बीस अपडेट—नीचे दी गई हैं।


WebMCP: एक मानक, उसका उत्पाद समर्थन, उसका आंतरिक उपयोग और उसे गति देने की एक प्रतियोगिता

25 अगस्त — OpenAI ने WebMCP Challenge शुरू किया, जो अब भी प्रयोगात्मक अवस्था में मौजूद एक ओपन मानक पर केंद्रित दस दिवसीय हैकाथॉन है और एजेंटों के वेब से संवाद करने के तरीके को बदलता है। जिस समस्या को हल करने का लक्ष्य है, वह ठोस है: आज किसी वेबसाइट पर कार्य पूरा करने वाले एजेंट को यह अनुमान लगाना पड़ता है कि आँखों और माउस के लिए बनाए गए इंटरफ़ेस में कैसे नेविगेट किया जाए। WebMCP इस तर्क को उलट देता है—वेबसाइट स्वयं संरचित टूल उपलब्ध कराती है, जिन्हें एजेंट सीधे कॉल करता है।

इस घोषणा का सबसे उल्लेखनीय तथ्य प्रतियोगिता नहीं है। वह तालमेल है जिसे यह उजागर करती है: Chrome (Google), Cloudflare, Shopify, Vercel, Render और Netlify, सभी समान मानक पर OpenAI के साथ जुड़े हैं। निर्णायक मंडल भी इसे दर्शाता है, जिसमें Sarah Drasner (Distinguished Engineer, Chrome), Andrew Galloni (VP Research & Innovation, Cloudflare), Jude Gao (Next.js Core टीम, Vercel), Ilya Grigorik (Distinguished Engineer, Shopify), Sean Roberts (VP of Applied AI, Netlify), Justin Rushing (Browser Agent Lead, OpenAI) और MCP-B के निर्माता Alex Nahas शामिल हैं।

The WebMCP Challenge is here. We’ve teamed up with @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render, and @Netlify for a 10-day hackathon. Up for grabs: $35,000 in cash prizes, Codex Micros, ChatGPT Pro subscriptions, and more prizes from our supporters.

🇮🇳 WebMCP Challenge शुरू हो गया है। हमने दस दिवसीय हैकाथॉन के लिए @ChromiumDev, @CloudflareDev, @ShopifyDevs, @vercel, @render और @Netlify के साथ साझेदारी की है। पुरस्कारों में 35,000 डॉलर की नकद राशि, Codex Micro, ChatGPT Pro सदस्यताएँ और हमारे साझेदारों द्वारा प्रदान किए गए अन्य उपहार शामिल हैं।X पर @OpenAIDevs

समय-सारणी कसी हुई है और मूल्यांकन मानदंड स्पष्ट हैं: उपयोगिता, मौलिकता, क्रियान्वयन, WebMCP का सुविचारित उपयोग और मानव-एजेंट अनुभव की गुणवत्ता। पंजीकरण और प्रस्तुतियाँ Devpost के माध्यम से होती हैं। परियोजनाओं को आरंभ करने के लिए OpenAI ने एजेंट-नेटिव डेमो ऐप्लिकेशन भी प्रकाशित किए हैं—एजेंट द्वारा संचालित 3D मॉडलिंग, ऐसा सहयोगात्मक लेखन जिसमें एजेंट अपनी पहचान से टिप्पणी करता है, व्यक्तिगत क्रॉसवर्ड जनरेटर, यात्रा नोट्स को यात्रा-कार्यक्रम में बदलने वाला Wandernote और ब्राउज़र में DuckDB-Wasm के माध्यम से डेटा अन्वेषण। किसी मौजूदा ऐप्लिकेशन से शुरुआत करके उसमें WebMCP जोड़ने की भी अनुमति है।

प्रतियोगिता का घटकघोषित विवरण
घोषित अवधि10 दिन
प्रस्तुतियाँ खुलने का समय25 अगस्त 2026, 12 बजे PT
जमा करने की अंतिम तिथि3 सितंबर 2026, 13 बजे PT
विजेताओं की घोषणा23 सितंबर 2026 (संकेतात्मक तिथि)
कुल पुरस्कार राशि35,000 डॉलर
प्रत्येक विजेता का पुरस्कार (शीर्ष 10)3,000 डॉलर, एक वर्ष का ChatGPT Pro, एक Codex Micro कीबोर्ड, प्रचार-सामग्री
प्रस्तुति प्लेटफ़ॉर्मDevpost

मानक को दैनिक उपयोग के योग्य बनाने वाला उत्पाद-आधार भी उसी दिन आया: ChatGPT डेस्कटॉप ऐप्लिकेशन और ChatGPT Sites में एकीकृत ब्राउज़र अब WebMCP का उपयोग कर सकते हैं। जब ChatGPT या Codex किसी संगत वेबसाइट पर जाता है, तो एजेंट पृष्ठ द्वारा उपलब्ध कराए गए टूल का पता लगाकर इंटरफ़ेस में अंदाज़े से भटकने के बजाय उनका स्वतः उपयोग करता है—इसके लिए डेस्कटॉप ऐप्लिकेशन के नवीनतम संस्करण में अपडेट करना आवश्यक है। इस चक्र का दूसरा हिस्सा उत्पादन पक्ष पर है: अब Codex से WebMCP-संगत ऐप्लिकेशन बनवाकर उसे सीधे Sites पर तैनात करने के लिए कहा जा सकता है। Chrome के साथ समर्थन की विषमता उल्लेखनीय है, जहाँ WebMCP अब भी किसी प्रयोगात्मक फ़्लैग या मूल-परीक्षण (origin trial) के पीछे है, जबकि ChatGPT का ब्राउज़र इसे नेटिव रूप से संभालता है।

तीसरा और सबसे शिक्षाप्रद पहलू बाकी है: OpenAI ने अपने आंतरिक उपयोग का दस्तावेज़ीकरण किया है। कंपनी के एक इंजीनियर ने बताया कि कैसे उन्होंने प्रत्येक कार्य के लिए अलग ऑटोमेशन लिखना छोड़कर Runme बनाया—Codex के साथ सहयोग के लिए तैयार किया गया एक ओपन-सोर्स नोटबुक वेब ऐप्लिकेशन। इसमें वे स्पष्ट निर्देशों के साथ एक छोटा लक्ष्य लिखते हैं—पिछला निष्पादन देखना, विस्तृत योजना तैयार करना, शुरू करने से पहले स्वीकृति की प्रतीक्षा करना और चलाए गए कमांड तथा उनकी व्याख्या का दस्तावेज़ बनाना—फिर Codex कार्य के दौरान नोटबुक को पढ़ता और अपडेट करता है। वास्तुकला से जुड़े दो विकल्प ध्यान देने योग्य हैं। पहला, स्थायित्व: नोटबुक Google Drive में सहेजी जाती हैं और Runme समानांतर रूप से एक सहयोगी Markdown इंडेक्स *.index.md बनाता है, जिसे Drive इंडेक्स कर सकता है; इससे एजेंट किसी पिछले निष्पादन को परिचालन संदर्भ के रूप में खोज सकता है। दूसरा, क्षमताओं को उपलब्ध कराना: Runme स्थिर रूप से सर्व किया जाने वाला क्लाइंट ऐप्लिकेशन है और केवल पारंपरिक MCP एक्सेस-पॉइंट उपलब्ध कराने के लिए सर्वर जोड़ने से अतिरिक्त अवसंरचना आती तथा नोटबुक डेटा का प्रसंस्करण दूसरी जगह चला जाता। WebMCP ऐप्लिकेशन को सीधे ब्राउज़र से अपने टूल पंजीकृत करने देता है।

🔗 WebMCP Challenge · ChatGPT डेस्कटॉप और Sites में समर्थन · OpenAI में Codex, Runme और WebMCP


Jalapeño: OpenAI ने अपनी इंफ़रेंस चिप के पहले आँकड़े प्रकाशित किए और अपनी कंप्यूट रणनीति को खुलकर अपनाया

25 अगस्त — OpenAI ने स्वयं डिज़ाइन की गई अपनी पहली इंफ़रेंस चिप Jalapeño के शुरुआती मापे गए परिणाम प्रकाशित किए। घोषणा का महत्त्व केवल कच्चे प्रदर्शन लाभ में नहीं, बल्कि उस समझौते की प्रकृति में है जिसे दूर करने का यह दावा करती है: मौजूदा इंफ़रेंस प्रणालियों को सामान्यतः थ्रूपुट और लेटेंसी के बीच चयन करना पड़ता है, जबकि Jalapeño एक ही वास्तुकला में दोनों देने का दावा करती है।

माप InferenceX पर आधारित हैं, जो SemiAnalysis का एक सार्वजनिक बेंचमार्क है और किसी अनुरोध के संपूर्ण प्रसंस्करण का अनुकरण करता है। तीन ओपन मॉडल—GPT-OSS 120B, DeepSeek R1 670B और Kimi K2.5 1T—का व्यावसायिक प्रणालियों से परीक्षण किया गया। प्रति चिप के बजाय प्रति वॉट सामान्यीकरण करने का चयन स्पष्ट और सुविधाजनक है: Jalapeño उन प्रणालियों की तुलना में आधी ऊर्जा खपत करती है जिनसे उसकी तुलना की गई है। Jalapeño की घोषित खपत 700 W है और परीक्षित कार्यभारों पर मापी गई निरंतर खपत 550 W या उससे कम रही, जबकि GB200 की खपत 1,200 W और GB300 की 1,400 W है।

मूल्यांकित मॉडल (तुलनात्मक प्रणाली)प्रति kW अधिकतम थ्रूपुटआरंभ से अंत तक लेटेंसीन्यूनतम TBT
GPT-OSS 120B (GB200, 1 200 W)≈1,9x (85 448 vs 44 960)≈1,7x (1,03 s vs 1,80 s)≈2,7x (0,69 vs 1,87 ms)
DeepSeek R1 670B (GB300, 1 400 W)≈1,7x (19 641 vs 11 781)≈3,6x (1,65 s vs 5,99 s)≈4,1x (1,43 vs 5,90 ms)
Kimi K2.5 1T (GB300, 1 400 W)≈1,5x (18 195 vs 11 862)≈3,4x (1,56 s vs 5,31 s)≈3,8x (1,44 vs 5,48 ms)

तीनों मॉडलों में OpenAI ने अधिकतम थ्रूपुट पर प्रति वॉट 1.5 से 1.9 गुना अधिक AI कार्य, तुलनात्मक प्रणालियों के मुकाबले आरंभ से अंत तक 1.7 से 3.6 गुना कम लेटेंसी और अत्यधिक इंटरैक्टिव कार्यभारों पर 2.1 से 4.1 गुना तक अधिक प्रदर्शन की घोषणा की है। तकनीकी रूप से ये लाभ रैक स्तर पर चिप, मेमोरी, नेटवर्क, सॉफ़्टवेयर और प्रणाली के सह-डिज़ाइन से आते हैं। इंफ़रेंस अलग-अलग बाधाओं वाले दो चरणों से गुजरता है: प्रीफ़िल (prefill), जो प्रॉम्प्ट को संसाधित करके कंप्यूट को पूरी क्षमता तक इस्तेमाल करता है, और जनरेशन (decode), जो एक-एक करके टोकन बनाता है और मुख्यतः मेमोरी बैंडविड्थ पर निर्भर करता है। Jalapeño डेटा की आवाजाही को न्यूनतम करने का प्रयास करती है; मॉडल की स्थिति—जिसमें KV cache भी शामिल है—को स्पष्ट रूप से रखा और स्थानीय बनाए रखा जा सकता है, जबकि प्रणाली चरण के अनुसार कंप्यूट, मेमोरी और नेटवर्क के सही संयोजन को सक्रिय करती है।

डेवलपर के लिए सबसे दिलचस्प पहलू स्वयं चिप के डिज़ाइन में AI की भूमिका से संबंधित है। OpenAI के अनुसार, डिज़ाइन, मापन और सत्यापन चक्रों को छोटा करके कंपनी नौ महीनों में प्रारंभिक डिज़ाइन से निर्माण-प्रवेश (tapeout) तक पहुँच गई। चिप को मनुष्यों के साथ-साथ AI के लिए भी पूर्वानुमेय प्रोग्रामिंग लक्ष्य के रूप में तैयार किया गया: स्थानीय टेंसर के माध्यम से वर्णित कार्य, स्पष्ट संचार और पूर्वानुमेय समकालिकीकरण। Codex और GPT-Astra की सहायता से टीम ने दो महीनों में तीन ऐसे ओपन-वेट मॉडल पोर्ट किए जो शुरुआती उत्पादन योजना में शामिल नहीं थे; GPT-OSS के चुने हुए अटेंशन और mixture-of-experts ब्लॉक पर AI द्वारा बनाए गए कर्नेल, मानव विशेषज्ञों द्वारा लिखे गए कार्यान्वयनों की तुलना में 1.5 से 1.8 गुना तेज़ चलते हैं। इस सूक्ष्म अंतर को बनाए रखना आवश्यक है: ये आँकड़े चुने हुए ब्लॉक से संबंधित हैं, पूरे मॉडल से नहीं। समय-सारणी अब भी सतर्क है—उत्पादन योग्यता की प्रक्रिया जारी है, सॉफ़्टवेयर को परिपक्व करना बाकी है, OpenAI की अवसंरचना में तैनाती वर्ष के अंत तक घोषित है, Gen 2 उन्नत विकास चरण में है और Gen 3 आकार ले रही है।

उसी दिन Sarah Friar ने इसके पीछे के आर्थिक तर्क को स्पष्ट करने वाला आलेख प्रकाशित किया। इसमें उन्होंने एक व्यापक कंप्यूट पोर्टफ़ोलियो का समर्थन किया—जिसकी बुनियाद Microsoft और NVIDIA हैं तथा जिन्हें AWS, AMD, Broadcom, Cerebras, CoreWeave, Oracle, SB Energy और SoftBank पूरा करते हैं—और इसके पीछे व्यावसायिक तथा तकनीकी दोनों तर्क दिए: आपूर्तिकर्ताओं के बीच विश्वसनीय विकल्प बनाए रखने से प्रत्येक कार्यभार को सर्वोत्तम मूल्य-प्रदर्शन अनुपात वाले विकल्प की ओर भेजना और मूल्य निर्धारण में अनुशासन बनाए रखना संभव होता है। इस दावे के साथ एक ठोस आँकड़ा भी है: Artificial Analysis Coding Agent Index पर अधिकतम रीजनिंग के साथ GPT-5.6 Sol ने एक नया रिकॉर्ड बनाया, जबकि एक अन्य अग्रणी मॉडल की तुलना में 54% कम आउटपुट टोकन खर्च किए। अंत में पाठ Jevons paradox को स्वीकार करता है—इंटेलिजेंस को सस्ता बनाने से उसकी खपत कम नहीं होती, बल्कि लाभदायक उपयोगों का दायरा बढ़ता है। अवसंरचना के संदर्भ में Georgia के Project Camellia को बंद जल-चक्र और स्वतंत्र वार्षिक सार्वजनिक ऑडिट के अधीन प्रतिबद्धताओं के साथ प्रस्तुत किया गया है। OpenAI ने स्पष्ट किया है कि वह प्रशिक्षण और इंफ़रेंस दोनों के लिए NVIDIA तथा अपने अन्य साझेदारों के एक्सेलेरेटर को व्यापक स्तर पर तैनात करती रहेगी।

🔗 Jalapeño—प्रारंभिक परिणाम · प्रचुर इंटेलिजेंस के पीछे का पूरा स्टैक


Perplexity Portable Computer: सब कुछ मशीन पर चलता है, और इसके समर्थन में benchmarks भी हैं

25 अगस्त — Perplexity ने Portable Computer लॉन्च किया है, जो उसके Computer agent का ऐसा संस्करण है जो पूरी तरह उपयोगकर्ता की मशीन पर चलता है। यह बदलाव दिखावटी से अधिक वास्तुशिल्पीय है: स्थानीय रूप से केवल model ही नहीं चलता, बल्कि पूरी orchestration शृंखला — orchestrator, planner, tool router, scheduler, persistent task queue और local search index — भी चलती है।

Today we’re launching Portable Computer on @NVIDIA DGX Spark.

Portable Computer is a fully local version of Perplexity Computer, where the entire runtime: orchestrator LLM, subagent LLM, agent harness all run on your local hardware. No cloud dependency.

🇮🇳 आज हम @NVIDIA DGX Spark पर Portable Computer लॉन्च कर रहे हैं। Portable Computer, Perplexity Computer का पूरी तरह स्थानीय संस्करण है, जिसमें पूरा runtime environment — orchestrator LLM, sub-agent LLM और agent harness — आपके स्थानीय hardware पर चलता है। Cloud पर कोई निर्भरता नहीं है।X पर @perplexity_ai

यह घोषणा NVIDIA के साथ संयुक्त रूप से की गई है और शुरुआत में DGX Spark को लक्षित करती है — Grace Blackwell GB10 platform, 20-core Arm CPU, NVIDIA GPU और 128 GB unified memory — तथा आगे RTX GPU वाले PC तक इसके विस्तार की घोषणा की गई है। चुनने के लिए दो model प्रस्तुत किए गए हैं, Qwen 3.8 27B या PPLX 27B, जो Perplexity द्वारा post-trained Qwen model है; वहीं NVIDIA Nemotron 3.5 Lightning, एक open 30B model, भी selector में शामिल होने वाला है। स्थानीय रूप से किए गए कार्य में कोई credit खर्च नहीं होता। Cloud पर escalation संभव रहता है — अद्यतन जानकारी, browser, connected applications या 15 से अधिक frontier models में से किसी के लिए — लेकिन इसके लिए उपयोगकर्ता की स्पष्ट अनुमति आवश्यक है। Google Drive, Gmail, Slack और GitHub connectors device से काम करते हैं, dictation स्थानीय रूप से NVIDIA Nemotron 3.5 ASR Model के माध्यम से चलती है और audio मशीन से बाहर नहीं जाता, तथा code execution एक अलग-थलग sandbox में होता है। Portable Computer उन Pro और Max subscribers के लिए आरक्षित है जिनके पास DGX Spark है; पहले Linux और फिर Windows पर, application से one-click installation के साथ।

उसी दिन engineering team ने इस launch का दस्तावेज़ीकरण करने वाले आँकड़े प्रकाशित किए। मूल तर्क यह है कि model और harness को साथ में design किया जाना चाहिए: generic harnesses यह मानकर चलते हैं कि frontier model लंबे context को संभाल सकता है और विस्तृत समय-सीमा के लिए योजना बना सकता है, जबकि local models इसमें अच्छा प्रदर्शन नहीं करते।

मापा गया BenchmarkComputer (Qwen 3.8 27B)PiHermesComputer + PPLX 27B
Local Knowledge Work Bench (53 कार्य)82,6 %77,6 %74,0 %85,4 %
BrowseComp (1 266 कार्य)66,7 %50,2 %43,9 %
ParseBench-100 (बहुविध दस्तावेज़)65,1 %13,9 %34,6 %

BrowseComp पर Computer, Hermes की तुलना में 61 % कम समय और 16 % कम tokens तथा Pi की तुलना में 51 % कम समय और 70 % कम tokens इस्तेमाल करता है। इस अंतर को चार design choices समझाते हैं: एक न्यूनतम system prompt; ऐसे modular skills जो कार्य-यात्रा के दौरान load और unload किए जाते हैं; अत्यधिक उपयोग होने वाले connectors (Gmail, GitHub, Outlook, Google Calendar), जिन्हें ऐसे MCP servers के रूप में प्रस्तुत करने के बजाय compact command-line tools में बदला गया है जिनकी definitions context को बहुत अधिक खपा देती हैं; और हमेशा सक्रिय, non-configurable sandbox — यदि वह उपलब्ध न हो, तो harness किसी भी tool call से पहले निष्क्रिय हो जाता है, बजाय इसके कि non-isolated execution पर चला जाए। Perplexity एक उपयोगी व्यावहारिक निष्कर्ष भी बताता है: Qwen 3.8 27B की घोषित context window 260K tokens है, लेकिन अनुभवजन्य रूप से वह 100K से आगे कठिनाई महसूस करने लगता है।

Terminal Bench 2.1 (89 कार्य)Scoreप्रत्येक execution की API लागत
Qwen 3.8 27B, 100 % स्थानीय59,6 %लगभग 0
Qwen 3.8 27B + Claude Opus 5 की सलाह73,0 %0,415 USD
केवल Claude Opus 582,4 %0,65 USD

सलाहकार model की ओर escalation का तंत्र report का सबसे दिलचस्प बिंदु है: यह frontier से अंतर का लगभग तीन-पाँचवाँ हिस्सा उसकी लागत के करीब दो-तिहाई में पूरा कर देता है, और निर्णय उपयोगकर्ता के हाथ में रहता है। हर call से पहले harness प्रासंगिक context चुनता है, personal data classifier लागू करता है और उपयोगकर्ता को दिखाता है कि कौन-सी जानकारी device से बाहर जाएगी; सलाहकार model केवल text लौटाता है और उसकी files या tools तक कोई सीधी पहुँच नहीं होती। अंततः PPLX 27B का post-training, rejection fine-tuning और उसके बाद Docker containers में चलाए गए synthetic environments पर reinforcement learning को संयोजित करता है, जिसमें किसी वास्तविक उपयोगकर्ता का कोई data शामिल नहीं है। एक technical report और evaluation benchmark को open source करने की घोषणा भी की गई है।

🔗 स्थानीय harness के Benchmarks · Portable Computer — Perplexity का लेख


Claude: chat और Cowork के बीच एक ही memory, जिसे file-दर-file पढ़ा जा सकता है

25 अगस्त — Anthropic ने अब तक साथ-साथ मौजूद दो memories के बीच की सीमा हटा दी है। Claude आपके chat conversations से जो याद रखता है, वही अब Claude Cowork में भी उपलब्ध होता है, और इसका उलटा भी सत्य है। व्यावहारिक रूप से, जब Cowork cloud में कोई कार्य करता है, तो वह महीनों से संचित context के साथ शुरू होता है: तिमाही की प्राथमिकताएँ, projects की प्रगति और किसी संपर्क की लेखन संबंधी पसंद। Anthropic जानबूझकर बहुत व्यावहारिक उदाहरण देता है — अपने manager के लिए progress update माँगना, बिना यह बताए कि वह व्यक्ति कौन है या उसे किस तरह जानकारी प्राप्त करना पसंद है।

दूसरा बदलाव अधिक सूक्ष्म है, लेकिन रोज़मर्रा के व्यवहार को बदल देता है: memory अब बाद में तैयार किए गए summary के बजाय conversation के दौरान ही update होती रहती है। केवल यह बताना कि कोई deadline सितंबर तक टाल दी गई है, अगली conversation में उसे ध्यान में रखने के लिए पर्याप्त है। किसी विशिष्ट बात को अनिवार्य रूप से दर्ज कराने के लिए « इसे याद रखो » कहना अब भी संभव है, और memory को किसी भी समय pause या reset किया जा सकता है।

पारदर्शिता के लिए Anthropic ने black box के बजाय पढ़ने योग्य representation चुना है: Claude जो कुछ भी याद रखता है, वह Settings और फिर Memory में विषय के अनुसार वर्गीकृत छोटी files के रूप में दिखाई देता है। हर file को पढ़ा, सुधारा या हटाया जा सकता है। इसका व्यावहारिक लाभ तुरंत मिलता है — केवल एक file में अपनी company का पुराना नाम सुधार देना पर्याप्त है, ताकि बाद की सभी conversations सही नाम इस्तेमाल करें।

संवेदनशील विषयों का प्रबंधन product choices के लिहाज़ से सबसे दिलचस्प बिंदु है। Default रूप से Claude स्वास्थ्य, मूल, जातीयता, धार्मिक मान्यताओं, राजनीतिक विचारों या gender identity से जुड़ी बातें याद नहीं रखता। हालाँकि Anthropic स्वीकार करता है कि यह सीमा व्यक्तिगत होती है और इन विषयों को शामिल करने के लिए एक optional setting देता है — जिससे recipes सुझाते समय Claude gluten intolerance याद रख सकता है। यह setting पूर्वव्यापी नहीं है और इसे किसी भी समय बंद किया जा सकता है। एक श्रेणी हर setting में बाहर रहती है: identification numbers, आपराधिक इतिहास, immigration status और व्यापक रूप से वह सब कुछ जो Acceptable Use Policy का उल्लंघन करता है। जब Claude इस प्रकार की जानकारी दर्ज नहीं कर सकता, तो वह इसे स्पष्ट रूप से बताता है; यह design choice silent filtering के बजाय दिखाई देने वाले refusal को प्राथमिकता देती है।

Memory का पहलूवर्णित व्यवहार
दायराchat और Claude Cowork के बीच साझा एकल memory
Update का समयconversation के दौरान, जबकि पहले समाप्ति के बाद summary बनता था
Storage formatविषय के अनुसार वर्गीकृत छोटी files, जिन्हें अलग-अलग पढ़ा और बदला जा सकता है
संवेदनशील विषयdefault रूप से याद नहीं रखे जाते, setting से सक्रिय किए जा सकते हैं, कोई पूर्वव्यापी प्रभाव नहीं
स्थायी अपवर्जनidentification numbers, आपराधिक इतिहास, immigration status
Free, Pro और Max plansweb, desktop और mobile पर default रूप से memory सक्रिय
Team और Enterprise plansadministrator द्वारा उपलब्ध, सक्रिय किए जाने तक प्रत्येक उपयोगकर्ता के लिए निष्क्रिय

🔗 Claude की memory हर जगह काम करती है · @claudeai की घोषणा


IBM ने Granite 4.2, अपनी पहली reasoning family, और 470M के दो ASR models खोले

25 अगस्त — IBM ने Granite 4.2 जारी किया है, जिसे उसकी पहली ऐसी dense, decoder-only language model family के रूप में प्रस्तुत किया गया है जिसे स्पष्ट रूप से reasoning के लिए design किया गया है। जहाँ पिछली generations efficiency और पारंपरिक enterprise tasks पर केंद्रित थीं, यह version reasoning को केंद्र में रखता है और उसे adjustable बनाता है: प्रत्येक model तीन modes — thinking, non-thinking और low-effort — उपलब्ध कराता है, जिन्हें application अपनी स्वीकार्य latency और token budget के अनुसार चुनता है। तीनों sizes (3B, 8B, 30B) समान architecture और pipeline साझा करते हैं, जिससे integration के स्तर पर एक से दूसरे पर जाना आसान हो जाता है।

Architecture पारंपरिक ही है: 8 KV heads के लिए 40-head GQA attention, 131 072 tokens का context संभालने हेतु 10 million θ वाला RoPE, SwiGLU MLP, RMSNorm normalization और CoreWeave द्वारा host किए गए NVIDIA GB200 NVL72 cluster पर bfloat16 training। Pre-training लगभग 15 000 billion tokens पर शून्य से शुरू होती है और पाँच phases में विभाजित है। Granite 4.2 को वास्तव में अलग करने वाला तत्व उसका post-training है: एक ही pass के बजाय specialized stages की शृंखला वाला reinforcement pipeline, truncated importance sampling के साथ asynchronous GRPO में, जिससे loop के generation और training वाले दोनों हिस्से कभी एक-दूसरे को block नहीं करते। Curriculum में verifiable rewards वाले RLVR के तीन passes, instruction following और code पर केंद्रित boosters, 128K context में software engineering के दो stages, एक terminal stage, एक research stage और फिर RLHF alignment क्रमशः शामिल हैं। Agentic reinforcement block केवल 8B और 30B models पर लागू किया गया है, जो 3B और उसके बड़े समकक्षों के बीच agentic coding performance के अंतर को समझाता है।

IBM द्वारा प्रकाशित Benchmark3B Dense8B Dense30B Dense
SWE-Bench Verified47,6757,00
SWE-Bench Multilingual30,7841,89
Terminal-Bench 2.120,5629,24
τ³-bench45,7858,0662,00
AIME2578,3386,6789,17
GPQA54,8064,1466,41
LiveCodeBench v669,7173,2475,77
MMLU-Pro67,8474,0477,60
RULER 128K55,3071,4181,38

Release केवल bfloat16 weights तक सीमित नहीं है: vLLM के लिए चार quantized variants भी साथ जारी किए गए हैं — calibration के बिना dynamic per-channel FP8, तथा 2 000 SFT samples पर calibrated GPTQ के माध्यम से NVFP4 और MXFP4 — साथ ही llama.cpp के लिए Q2_K से Q8_0 तक चौदह GGUF formats उपलब्ध हैं। बारह languages समर्थित हैं, जिनमें French भी शामिल है, और पहले दिन से तीन agentic coding harnesses का documentation उपलब्ध है: OpenCode, Pi और OpenHands। Data quality के संदर्भ में IBM ऐसी pipeline का विवरण देता है जिसमें GPT-OSS-120B और Gemma 4, SFT samples को score करने के लिए judges की भूमिका निभाते हैं, जिसके बाद SHA-256 hashing से local और global deduplication किया जाता है।

उसी दिन IBM ने Granite Speech 5.0 Turbo CTC भी जारी किया, जो 470 million parameters वाले दो English speech-recognition models हैं और केवल अपने training data तथा license में भिन्न हैं — standard variant के लिए Apache 2.0 और अतिरिक्त data पर trained variant के लिए CC-BY-NC-SA-4.0। Architecture में बदलाव उल्लेखनीय है: पिछले Granite Speech models acoustic encoder, projector और LLM को मिलाते थे, जबकि ये केवल encoder वाले हैं। Stack में 16 Conformer blocks हैं, आठवें block के output पर self-conditioning लागू होती है, quadratic scaling से बचने के लिए dot-product attention को chunkwise attention से बदला गया है और CTC loss को सीधे optimize किया जाता है। असली नवीनता token rate है: subsampling operations, log-Mel spectrogram के output पर stream को 100 frames per second से घटाकर 12,5 per second कर देते हैं, जिससे नाम में « Turbo » का अर्थ स्पष्ट होता है। परिणाम OpenASR Leaderboard और far-field के लिए FFASR Leaderboard पर प्रस्तुत किए गए हैं, अलग-अलग scores के बजाय speed/accuracy Pareto graphs के साथ; साथ ही WebGPU के माध्यम से browser में चलने वाला continuous recognition demo भी उपलब्ध है, जो Chrome और Edge तक सीमित है।

🔗 Granite 4.2 — technical overview · Granite Speech 5.0 Turbo CTC


WeatherNext Cyclones, National Hurricane Center द्वारा रीयल टाइम में उपयोग किया गया पहला AI मॉडल

25 अगस्त — Google AI ने Google DeepMind और Google Research से निकले उष्णकटिबंधीय चक्रवात पूर्वानुमान मॉडल WeatherNext Cyclones का विवरण दिया है। यह घोषणा केवल उसके प्रदर्शन से अधिक इस बात के लिए उल्लेखनीय है कि यह मौसम संबंधी AI के प्रयोगशाला से परिचालन उपयोग तक पहुँचने की कहानी बताती है।

जिस समस्या को हल किया गया है, वह संरचनात्मक है। अब तक किसी चक्रवात पर नज़र रखने के लिए एक समझौता करना पड़ता था: सुपरकंप्यूटरों पर चलने वाले भौतिक मॉडल पूरे ग्रह में फैलने वाली बड़ी वायुमंडलीय संरचनाओं को अच्छी तरह पकड़ते हैं, लेकिन तूफ़ान की शक्ति निर्धारित करने वाली स्थानीय और तीव्र भौतिकी को समझने के लिए पूरी तरह अलग क्षेत्रीय मॉडलों पर जाना पड़ता था। WeatherNext Cyclones एक ही क्रम में पथ, तीव्रता और आकार का पूर्वानुमान लगाकर इस आगे-पीछे जाने की आवश्यकता समाप्त करता है।

घोषित लाभ पिछली प्रणालियों की तुलना में पूर्वानुमान के लिए एक पूरा अतिरिक्त दिन है। Google इस तुलना को सहज ढंग से रखता है: अब तीन दिन पहले किए गए पूर्वानुमान उतने ही सटीक हैं, जितने पहले दो दिन वाले पूर्वानुमान हुआ करते थे—ऐसी प्रगति जिसमें ऐतिहासिक रूप से एक दशक के पद्धतिगत विकास की आवश्यकता होती थी। दूसरा योगदान संभाव्यता-आधारित है: मॉडल इतना तेज़ है कि प्रत्येक तूफ़ान के लिए 1,000 तक सिमुलेशन बना सकता है, जिससे एकमात्र “सर्वाधिक संभावित” पथ की जगह संभावित परिदृश्यों की पूरी शृंखला मिलती है। इससे तीव्र गति से होने वाली सघनता को बेहतर समझा जा सकता है, जिसे 24 घंटों में अधिकतम निरंतर हवाओं की गति कम-से-कम 30 नॉट बढ़ने के रूप में परिभाषित किया गया है। इस वर्ष WeatherLab के माध्यम से पूर्वानुमानकर्ताओं को प्रत्येक तूफ़ान के लिए 1,000 संभाव्यता-आधारित पूर्वानुमान दिए जा रहे हैं।

सबसे महत्वपूर्ण पहलू वास्तविक तैनाती ही है। 2025 के हरिकेन मौसम के दौरान WeatherNext Cyclones का परीक्षण अमेरिकी National Hurricane Center में किया गया—यह पहली बार था जब इस संस्था ने रीयल-टाइम परिचालन में AI मॉडलों का उपयोग किया। मौसम वैज्ञानिकों ने इसकी सहायता से जमैका में हरिकेन Melissa के श्रेणी 5 में तट से टकराने का पूर्वानुमान तैयार किया, जिससे स्थानीय अधिकारियों को तैयारी के लिए अतिरिक्त समय मिला। Nature में एक शोध-पत्र प्रकाशित हुआ है और Google ने मॉडल का कोड तथा वेट्स GitHub पर ओपन सोर्स के रूप में जारी करने की घोषणा की है।

मॉडल का पहलूWeatherNext Cyclones का योगदान
पूर्वानुमानित राशियाँएक ही पास में पथ, तीव्रता और आकार
पूर्वानुमान समय में लाभएक दिन; 3-दिवसीय पूर्वानुमान = पुराने 2-दिवसीय पूर्वानुमान की सटीकता
प्रति तूफ़ान सिमुलेशन1,000 तक
परिचालन तैनातीU.S. National Hurricane Center, 2025 का हरिकेन मौसम
प्रलेखित उपयोग का मामलाजमैका में हरिकेन Melissa का श्रेणी 5 में तट से टकराना
सघनता की सीमा24 घंटों में अधिकतम निरंतर हवाओं में 30 नॉट से अधिक की वृद्धि
उपलब्ध कराने के माध्यमWeatherLab; GitHub पर ओपन सोर्स कोड और वेट्स

🔗 @GoogleAI की घोषणा · Google DeepMind का लेख


Stability AI ने EA, Sony Music, Universal और Warner के साथ 76 मिलियन डॉलर की Series B पूरी की

25 अगस्त — Stability AI ने अपनी Series B पूरी होने की घोषणा की है: 76 मिलियन डॉलर की नई पूँजी, जिससे जून 2024 में Prem Akkaraju द्वारा कंपनी की कमान संभालने के बाद से कुल वित्तपोषण 232 मिलियन डॉलर हो गया है; इसमें दो इक्विटी दौर और परिवर्तनीय बॉन्ड शामिल हैं। क्षेत्र के पैमाने पर यह राशि मामूली है, लेकिन निवेशक समूह की संरचना ही असली मुद्दा है।

मनोरंजन जगत की चार बड़ी कंपनियाँ हिस्सेदार बनी हैं: वीडियो गेम के लिए Electronic Arts और संगीत के लिए Sony Music Group, Universal Music Group तथा Warner Music Group। रिकॉर्ड उद्योग की तीनों बड़ी कंपनियाँ अब एक ही प्रयोगशाला की शेयरधारक हैं। इनके साथ AMD Ventures और Pacific Alliance Ventures भी शामिल हैं। ये निवेशक अचानक सामने नहीं आए हैं: EA, Universal और Warner शरद 2025 से ही Stability AI के रणनीतिक साझेदार थे। इसलिए यह दौर मौजूदा वाणिज्यिक समझौतों को इक्विटी हिस्सेदारी में बदलता है।

दूसरा संकेत वित्तीय निवेशकों की निरंतरता से मिलता है। Coatue, Greycroft, Kadmos Capital, Sean Parker और Eric Schmidt नए नेतृत्व के अधीन लगातार दूसरे दौर में फिर निवेश कर रहे हैं—2023 और 2024 में Stability AI के अशांत दौर के बाद इसे भरोसे की पुष्टि माना जा सकता है। Coatue के सह-संस्थापक Thomas Laffont निदेशक मंडल में शामिल हो रहे हैं, जिसमें पहले से James Cameron, Sean Parker, Dana Settle और Prem Akkaraju शामिल हैं।

This unmatched group of investors is an affirmation of our vision where generative AI empowers every producer, musician, and storyteller. Stability is unique in the AI field because we are creative people making tools for creatives.

🇮🇳 निवेशकों का यह बेजोड़ समूह हमारे उस दृष्टिकोण की पुष्टि करता है जिसमें generative AI हर निर्माता, संगीतकार और कथाकार को सामर्थ्य देता है। Stability AI के क्षेत्र में अद्वितीय है, क्योंकि हम ऐसे रचनात्मक लोग हैं जो रचनात्मक लोगों के लिए उपकरण बनाते हैं। — Stability AI के CEO Prem Akkaraju, 25 अगस्त की प्रेस विज्ञप्ति

अपनाई गई रणनीति एक विशिष्ट क्षेत्र पर केंद्रित प्रयोगशाला की है: कोई सामान्य-उद्देश्य वाला मॉडल नहीं, बल्कि रचनात्मक पेशेवरों के लिए ऐसे उपकरण जिन्हें अधिकार-धारकों के विरुद्ध नहीं, बल्कि उनके साथ मिलकर बनाया गया है। यही Stable Audio 3.0 की दिशा है—पूरी तरह लाइसेंस प्राप्त डेटा पर प्रशिक्षित ओपन-वेट मॉडल परिवार, जिसे 18 अगस्त को ऑडियो वर्कस्टेशन के लिए एक प्लगइन के साथ विस्तारित किया गया। इस धन से उत्पादों की अगली शृंखला, अनुप्रयुक्त अनुसंधान और पेशेवर सेवा विभाग का वित्तपोषण किया जाना है।

🔗 @StabilityAI की घोषणा


उद्यमों के लिए ChatGPT: Admin प्लगइन, बहु-ब्राउज़र एक्सटेंशन और 100 डॉलर की Premium सीट

25 अगस्त — OpenAI की तीन घोषणाएँ एक ही वर्ग को लक्षित करती हैं: बड़े पैमाने पर ChatGPT और Codex तैनात करने वाले संगठन।

इनमें सबसे महत्वपूर्ण ChatGPT Work और Codex के लिए Admin प्लगइन है, जो उन कार्यों को एक संवाद में समेटता है जिनके लिए अब तक analytics डैशबोर्ड, सेटिंग स्क्रीन और रिपोर्टों के बीच जाना पड़ता था। इसके दायरे में रोज़मर्रा के काम आते हैं: उपयोग और क्रेडिट खपत को समझना, अपनी सीमा के करीब पहुँच चुके सदस्यों या समूहों की पहचान करना, लोगों के जुड़ने और छोड़ने का प्रबंधन करना, प्रभावी अनुमतियों की समीक्षा करना और पहुँच संबंधी समस्या का निदान करना, उपयोग सीमाएँ समायोजित करना तथा खर्च अनुरोधों की वास्तविक खपत से तुलना करके निर्णय लेना। सबसे रोचक हिस्सा बिना कोड लिखे स्वचालन है: लंबित उपयोग अनुरोधों को उसी उपकरण में अनुमोदन के लिए Slack या Microsoft Teams भेजा जा सकता है जिसका अनुमोदक पहले से उपयोग करते हैं; और किसी सुविधा तक पहुँच के अनुरोध पूर्वनिर्धारित मानदंड पूरे करने पर स्वतः स्वीकृत किए जा सकते हैं, जबकि अपवाद किसी व्यक्ति के पास भेजे जाते हैं। सुरक्षा की दृष्टि से एक महत्वपूर्ण बात यह है कि प्लगइन उपयोगकर्ता की मौजूदा भूमिका और अनुमतियों के भीतर काम करता है और किसी पहुँच का विस्तार नहीं करता; प्रत्येक निर्देश को समर्थित पढ़ने या लिखने की कार्रवाई से जोड़ा जाता है और उसका संरचित परिणाम मिलता है। OpenAI अपने उपयोग का उदाहरण देता है—Slack में एक ChatGPT Work एजेंट आंतरिक IT अनुरोधों को संभालता है और तैनात कार्यप्रवाह टिकटों की लगभग 45% मात्रा का समाधान करते हैं; समर्थन की मात्रा लगभग दोगुनी होने के बावजूद लंबित काम समाप्त हो गया है।

दूसरी घोषणा में ChatGPT ब्राउज़र एक्सटेंशन अब Chrome तक सीमित नहीं है और Microsoft Edge, Brave, Opera तथा Vivaldi का समर्थन करता है। यह बदलाव उन लोगों के लिए महत्वपूर्ण है जो गोपनीयता के विकल्प या उद्यम संबंधी बाध्यता के कारण किसी वैकल्पिक ब्राउज़र में काम करते हैं। दो उपयोगों पर ज़ोर दिया गया है: ChatGPT Desktop में @ tab उल्लेख के माध्यम से खुले टैब का संदर्भ किसी कार्य में लाना, ताकि Codex पहले से दिखाई दे रहे दस्तावेज़ या टिकट के आधार पर काम करे; और एजेंट को ठोस वेब कार्य करने के लिए ब्राउज़र नियंत्रित करने देना, जिनमें सदस्यताएँ रद्द करना भी एक उदाहरण है।

तीसरी घोषणा अधिक संक्षिप्त है: 100 डॉलर की Premium सीट ChatGPT Business की पेशकश में जोड़ी गई है, जिसे छोटी कंपनियों और स्टार्टअप के लिए रखा गया है तथा टीम के आकार के अनुसार लचीली और विस्तारयोग्य योजना के रूप में प्रस्तुत किया गया है। घोषणा X पर की गई, उसके साथ कोई विस्तृत ब्लॉग लेख नहीं था और संदेश में सीट की सटीक सुविधाएँ स्पष्ट नहीं की गई हैं।

🔗 Admin प्लगइन · बहु-ब्राउज़र एक्सटेंशन · ChatGPT Business Premium सीट


NVIDIA: RTX Spark के लिए Gamescom, और SANA ने MiniMax H3 की विलंबता 27 गुना घटाई

25 अगस्त — NVIDIA इस सप्ताह कोलोन में आयोजित Gamescom का लाभ उठाते हुए इस शरद ऋतु में आने वाले अपने Windows PC प्लेटफ़ॉर्म RTX Spark की सूची बढ़ा रहा है। Electronic Arts, Embark Studios और Ubisoft अब KRAFTON, NetEase, Riot Games तथा XBOX के साथ जुड़ गए हैं, जिन्होंने मई में COMPUTEX के समय ही प्रतिबद्धता जताई थी। घोषित गेम विभिन्न तकनीकी आवश्यकताओं को समेटते हैं: EA की ओर से EA SPORTS F1 25 और Apex Legends, Ubisoft से Anno 117: Pax Romana तथा Embark Studios से ARC Raiders और THE FINALS।

सबसे ठोस बात एंटी-चीट से जुड़ी है। किसी गेम को चलाना ही पर्याप्त नहीं है: बड़े ऑनलाइन गेम एंटी-चीट प्रणालियों पर निर्भर करते हैं जिन्हें प्रत्येक प्लेटफ़ॉर्म पर पोर्ट करना पड़ता है, अन्यथा गेम मल्टीप्लेयर में खेलने योग्य नहीं रहता। NVIDIA ने EA के साथ मिलकर EA Javelin Anticheat को RTX Spark पर मूल रूप से लाने की घोषणा की है—बुनियादी ढाँचे से जुड़ा यही वह विवरण है जो किसी नए PC प्लेटफ़ॉर्म को वास्तव में अपनाए जाने का निर्णय करता है। रेंडरिंग की ओर, DLSS 4.5 Ray Reconstruction तुरंत उपलब्ध है; इसमें दूसरी पीढ़ी का transformer मॉडल पारंपरिक शोर-निवारकों की जगह सुपरकंप्यूटर पर प्रशिक्षित नेटवर्क का उपयोग करता है। CONTROL Resonant और 007 First Light में path tracing आ रही है, Gears of War: E-Day में RTX Mega Geometry शामिल है और Aniimo में NVIDIA ACE तकनीकों को 2027 की शुरुआत के लिए घोषित किया गया है।

इसी कंपनी का दूसरा पक्ष, 24 अगस्त को, अधिक तकनीकी था। MiniMax ने अपने वीडियो मॉडल H3 पर लागू Sol Engine के संबंध में NVIDIA की SANA टीम के परिणाम साझा किए हैं: एक GB200 पर 768p में दस सेकंड का वीडियो बनाने का समय 414 सेकंड से घटकर 14.93 सेकंड रह गया, अर्थात 27.7 गुना गति वृद्धि। यह विधि kernel अनुकूलन पर नहीं, बल्कि निर्माण को दो पास में बाँटने पर आधारित है—पहले H3 द्वारा 4 चरणों में कम रिज़ॉल्यूशन वाला प्रारूप और फिर Sol-Attn के साथ LTX को सौंपा गया 3 चरणों का लक्ष्य रिज़ॉल्यूशन पर परिष्करण पास। कुल सात चरण। दूसरे उपाय में महँगे VAE डिकोडिंग को हल्के decoder TAEH3 और TAEHV से बदल दिया गया है, जबकि परिष्करण पास के लिए latents को स्थिर रखा गया है।

MiniMax H3 पर मापमापा गया मान
मापा गया कार्यभार768p में 10 s का वीडियो, केवल एक GB200
पहले की विलंबता414 s
बाद की विलंबता14.93 s
गति-वृद्धि गुणक27.7x
निर्माण के चरण4 (कम रिज़ॉल्यूशन वाला H3 प्रारूप) + 3 (LTX)
बदले गए decoderVAE डिकोडिंग की जगह TAEH3 और TAEHV
प्रति नोड अनुमानित प्रवाहप्रति माह 378,000 वीडियो, 97% से अधिक GPU मार्जिन

अनुमानित प्रवाह MiniMax का आकलन है, उत्पादन में लिया गया माप नहीं, और इसे उसी रूप में पढ़ा जाना चाहिए। लेकिन दिशा स्पष्ट है: दस सेकंड का वीडियो पंद्रह सेकंड में बनने के साथ उच्च-निष्ठा वीडियो निर्माण अतुल्यकालिक बैच रेंडरिंग से लगभग संवादात्मक बुनियादी ढाँचे की ओर बढ़ रहा है।

🔗 Gamescom में NVIDIA · H3 पर SANA और Sol Engine


चीनी ओपन मॉडल अनुसंधान का मानक बन रहे हैं, और Qwen3.8-27B ने Code Arena के शीर्ष 10 में प्रवेश किया

25 अगस्त — Qwen ने उसी सुबह दो परिणाम साझा किए और दूसरा पहले का अर्थ स्पष्ट करता है।

पहला एक रैंकिंग है। वेब इंटरफ़ेस निर्माण पर मॉडलों का मूल्यांकन करने वाली Code Arena: WebDev रैंकिंग में Qwen3.8-27B ने कुल 1595 अंकों के साथ 9वाँ स्थान प्राप्त किया है। शीर्ष 10 में यह अपने आकार की श्रेणी का एकमात्र मॉडल है और अपने से बहुत बड़े Qwen3.8-Max से केवल छह स्थान पीछे है। Arena के अनुसार यह रैंकिंग की Pareto सीमा को नए सिरे से परिभाषित करता है और तुलना के लिए एक स्पष्ट बिंदु देता है: समान आकार का, लेकिन अप्रैल में जारी Gemma 4-31B, 80वें स्थान पर है।

मूल्यांकित मॉडलCode Arena: WebDev रैंकप्राप्त अंकरैंकिंग की टिप्पणी
GLM-5.3 (Max)कुल मिलाकर 8वाँ159720 अगस्त का आँकड़ा, ओपन मॉडलों में दूसरा
Qwen3.8-27Bकुल मिलाकर 9वाँ1595शीर्ष 10 में अपने आकार का एकमात्र मॉडल
Qwen3.8-Max27B से छह स्थान आगेउपलब्ध नहींउसी परिवार का बहुत बड़ा मॉडल
Gemma 4-31Bकुल मिलाकर 80वाँउपलब्ध नहींअप्रैल 2026 में जारी

दूसरा परिणाम उपयोग का एक माप है। Ai2 में Olmo परियोजना के सह-नेता रहे Nathan Lambert ने ChatGPT जारी होने के बाद से प्रकाशित AI और machine learning से जुड़े 500,000 arXiv लेखों का Codex से विश्लेषण कराया, ताकि अनुसंधान में वास्तव में उपयोग किए गए ओपन मॉडलों की पहचान हो सके। बदलाव दो आँकड़ों में दिखता है: 2024 में लगभग 30% लेख किसी अमेरिकी ओपन मॉडल का उल्लेख करते थे, जबकि चीनी मॉडल का उल्लेख 10% में था; आज लगभग 40% लेख चीनी ओपन LLM का और केवल 25 से 30% अमेरिकी मॉडल का उल्लेख करते हैं।

मॉडल परिवारLLM का उल्लेख करने वाले लेखों का हिस्सा
OpenAI (बंद मॉडल)लगभग 37%
Qwenलगभग 33%
Gemini, Claude10 से 15%
Gemma, Mistral5 से 10%
Olmoलगभग 1%

विस्तार से देखें तो किसी भी LLM का उल्लेख करने वाले लेखों में से एक-तिहाई में Qwen का उल्लेख है। Llama अप्रैल 2025 के आसपास 30% के शिखर पर पहुँचा था, ठीक उसी समय जब Llama 4 जारी हुआ, और तब से उसका हिस्सा घट रहा है। Lambert स्वयं एक महत्वपूर्ण सीमा बताते हैं: मॉडल जारी होने की तुलना में प्रकाशन पीछे रहते हैं, क्योंकि अनुसंधान में समय लगता है—इसलिए ये आँकड़े मौजूदा पसंद के बजाय चल रहे कार्यों की स्थिति बताते हैं। इसके समानांतर एक दीर्घकालिक रुझान भी दिखता है, जो ओपन बनाम बंद की प्रतिस्पर्धा से अलग है: LLM का उल्लेख करने वाले AI लेखों का अनुपात जनवरी 2023 के 10.43% से बढ़कर 2026 में 50% से अधिक हो गया है।

🔗 Code Arena पर Qwen3.8-27B · arXiv विश्लेषण को Qwen द्वारा साझा किया जाना · @natolambert का विश्लेषण


Claude Code 2.1.245 पर पहुँचा, और वेब पर Claude का रेंडरिंग 4 गुना अधिक सहज हुआ

इस अवधि में Claude Code के दो संस्करण जारी हुए, और उनकी सामग्री स्पष्ट रूप से संगठनों में परिनियोजन पर केंद्रित है। CHANGELOG में तारीखें नहीं हैं, लेकिन Git इतिहास उनका समय बताता है: 2.1.243 का commit 24 अगस्त को 23:40 UTC पर और 2.1.245 का commit 25 अगस्त को 05:13 UTC पर दिखाई देता है।

जोड़ी गई सेटिंगसंबंधित संस्करणव्यावहारिक लाभ
modelPricing2.1.243/cost, status bar और telemetry में अनुबंधित दरें
modelPicker2.1.243/model के लिए क्रमबद्ध और लेबलयुक्त model सूची
promptCacheTtl / subagentPromptCacheTtl2.1.243बातचीत पर एक घंटे का prompt cache, subagents पर 5 मिनट
/usage में Loops का विवरण2.1.243पटरी से उतर रहे /loop कार्यों की पहचान
Console के माध्यम से बिना key का कनेक्शन2.1.243वे संगठन जो API keys प्रतिबंधित करते हैं
glibc 2.44 सुधार2.1.245Arch Linux, CachyOS और Fedora Rawhide पर startup crash

सबसे संरचनात्मक सेटिंग modelPricing है: अब तक दिखाए जाने वाले खर्चों की गणना सार्वजनिक दर के आधार पर होती थी; अब कोई संगठन इसमें प्रत्येक model की अपनी अनुबंधित दरें और अपना discount coefficient डाल सकता है, जिससे आँकड़े आंतरिक पुनर्बिलिंग के लिए सीधे उपयोग योग्य हो जाते हैं। promptCacheTtl और subagentPromptCacheTtl की जोड़ी API key इस्तेमाल करने वाले उपयोगकर्ताओं के लिए एक ठोस आर्थिक समझौते को संभालती है: मुख्य बातचीत पर एक घंटे का cache रखना, जहाँ context स्थिर रहता है, जबकि subagents को पाँच मिनट पर रखना, क्योंकि उनके contexts अधिक अस्थिर होते हैं। सुधारों की ओर देखें तो non-interactive mode में दूरस्थ MCP servers कनेक्शन टूटने के बाद अब अटके नहीं रहते, /resume अब केवल पचास सबसे हालिया sessions तक सीमित नहीं है, और दस मिनट से अधिक समय तक निष्क्रिय sessions अब पुनः प्रयास और स्पष्ट error से पहले लगभग तीन मिनट में समाप्त हो जाते हैं।

इसके अतिरिक्त, 24 अगस्त को Anthropic ने घोषणा की कि उसने Claude web और desktop पर बनते समय responses दिखाने वाले engine को फिर से लिखा है। सिद्धांत interface rendering में पारंपरिक है: हर नए fragment पर पूरी response को दोबारा बनाने के बजाय केवल उसी हिस्से को बदलना जो अभी बदल रहा है। लंबी response में अंतर संरचनात्मक है—पहले से दिखाए गए text की लंबाई बढ़ने के साथ rendering cost बढ़ना बंद हो जाता है। घोषित लाभ संगत हैं: लगभग 4 गुना अधिक सहजता, कम शक्तिशाली laptop पर 9 गुना कम रुकावटें, interface का सबसे खराब freeze 4.5 गुना छोटा, और 120 Hz MacBook पर शुरुआत से अंत तक 120 frames प्रति second। दिलचस्प विवरण लक्षित उपयोगकर्ता-वर्ग है: साधारण configurations को सबसे अधिक लाभ मिलता है।

🔗 Claude Code CHANGELOG · 4 गुना अधिक सहज रेंडरिंग, @ClaudeDevs


Code agents का औद्योगीकरण: Warp ने अपने factories का format प्रकाशित किया, Rohlik का 90% code agents लिखते हैं

24 अगस्त की देर शाम—Warp ने 18 अगस्त को घोषित अपने cloud agents platform, Warp Factories, की आंतरिक कार्यप्रणाली दिखाई: चुना गया configuration format और early access की शुरुआत। शुरुआती बिंदु स्पष्ट है—गुणवत्ता और लागत के कारण Warp अपने agents को स्थानीय machines से बाहर ले जा रहा है, और उसे environments, harnesses तथा security permissions को versioned code के रूप में वर्णित करने की आवश्यकता थी।

Configuration तत्वचुना गया मान
Definition filefactory.yaml, schemaVersion: v1alpha1
मुख्य keysname, repositories (owner / name), agentDefaults.model
Agent की परिभाषाagents/<nom>/agent.md के साथ agentType (FOREMAN, REVIEW…) और model
Triggersautomations/<nom>/automation.md: agent, triggers (provider, event)
उपलब्ध interfacesCLI (warp agent run-cloud), REST API, TypeScript SDK, MCP server
Early accessयोग्य ग्राहकों को 10,000 USD तक का निःशुल्क उपयोग

यह विभाजन दिलचस्प है: agents का वर्णन किसी एक YAML में नहीं, बल्कि समर्पित Markdown files में किया जाता है, जिससे agent की परिभाषा पढ़ने योग्य और diff करने योग्य document बन जाती है। Warp यह तरीका स्वयं पर लागू करता है—उसकी आंतरिक factory, जिसका नाम “wilson” है, warp-server या warp-terraform जैसे repositories को समेटती है, अपने secrets और MCP servers घोषित करती है, और अपने agents को भूमिका के अनुसार (code-review, foreman, implementation, spec, triage) 34 lines में व्यवस्थित करती है। Access request page पर दिए गए आँकड़े ऐसे व्यावसायिक दावे हैं जिन्हें बाहर से सत्यापित नहीं किया जा सकता: प्रतिदिन 200,000 agent executions, बिना बदलाव के merge किए गए 30% से अधिक pull requests, और प्रति pull request 20% कम लागत।

25 अगस्त को Cognition ने अपनी ओर से पिछले उदाहरण की तुलना में कहीं अधिक दस्तावेजीकृत case study प्रकाशित की। Rohlik Group चेक गणराज्य में शुरू हुआ एक online grocery retailer है, जो पाँच देशों में सक्रिय और लाभदायक है तथा पिछले वर्ष उसका revenue 1.3 billion dollars से अधिक था; वह 17,000 products वाली साप्ताहिक खरीदारी एक घंटे से कम समय में या पंद्रह मिनट के slots में पहुँचाता है। लेख को आकार देने वाला आँकड़ा यह है: आज वहाँ लगभग 90% code agents द्वारा generate होता है और engineering संगठन स्वयं को “agent-mostly” बताता है।

यह परिणाम केवल किसी tool को जोड़ देने से नहीं मिला। Rohlik के अनुसार उसने एक वर्ष पहले शुरुआत की थी और Devin के साथ उसका पहला अनुभव bugs से भरा माना गया था। बदलाव client-side पर रखी गई बुनियाद से आया: पचास से अधिक आंतरिक और बाहरी MCP integrations, इस सिद्धांत के साथ कि हर नया tool पहले दिन से ही agents के लिए उपलब्ध होना चाहिए; Snowflake data warehouse के ऊपर एक semantic layer; और agents को वही context देने वाला knowledge base जो किसी नए सहकर्मी को दिया जाता। काम जहाँ पैदा होता है, वहीं से Devin तक पहुँचता है—किसी bug पर Slack conversation या Linear specification document से लेकर pull request तक। दावा किए गए परिणाम—नवंबर से engineering throughput दोगुना होना, AutoStore robotics integration को आठ महीनों में पूरा करना जबकि उद्योग में दो से तीन वर्ष लगते हैं, और prototyping का समय एक महीने से घटकर एक दिन होना—अब भी provider द्वारा प्रकाशित customer page के आँकड़े हैं। सबसे स्पष्ट प्रभाव कहीं और है: श्रेष्ठ engineers अब अपना 80% समय code review करने में बिताते हैं, और Rohlik में Devin के उपयोग का लगभग 30% हिस्सा business users द्वारा data analysis के लिए है।

🔗 factory.yaml format, @warpdotdev · Rohlik case study, @cognition · Devin customer page


GitHub: agentic workflows पर चार अभ्यास और Customize tab की सामान्य उपलब्धता

25 अगस्त—GitHub ने अपने GitHub Skills learning platform पर चार नए अभ्यास जारी किए। दृष्टिकोण स्पष्ट है: वर्ष की agentic नई सुविधाओं का केवल दस्तावेजीकरण करने के बजाय GitHub उन्हें demo repository में व्यावहारिक रूप से आज़माने देता है, जहाँ निर्देश pull requests के माध्यम से क्रमशः दिए जाते हैं।

प्रकाशित अभ्यासअभ्यास का उद्देश्य
Agent Orchestration Build Your AI Dream TeamCopilot CLI में custom agents: योजना बनाना, design करना, निर्माण करना, सत्यापित करना, सौंपना
Agentic Workflows that Read the Roomgh aw extension, Markdown में agentic workflow, pull requests के माध्यम से प्रस्तुत बदलाव
Idea to Merge with the Copilot Appएक session से merged pull request तक, पूरी तरह GitHub Copilot app में
Ship with Qualityस्वचालित quality signals, test coverage, pull requests पर अनिवार्य checks

इन चारों में सबसे उल्लेखनीय पहला है: यह पहली बार है जब GitHub ने अपनी CLI में multi-agent orchestration पर guided course प्रस्तुत किया है, ऐसा विषय जिसे अब तक केवल prose में दस्तावेजीकृत किया गया था। दूसरा gh aw extension पेश करता है, जिसमें security के लिए एक महत्वपूर्ण बात है—workflow द्वारा प्रस्तावित modifications सीधे लागू होने के बजाय pull requests से गुजरते हैं, जिससे human review का एक चरण बना रहता है।

उसी दिन GitHub Copilot app में Customize tab सामान्य रूप से उपलब्ध हो गया। इसका काम पिछले महीनों में अलग-अलग पेश किए गए चार extension mechanisms को एक ही स्थान पर लाना है: MCP servers, plugins, skills और canvases। Featured view हर category से संपादकीय रूप से चुने गए विकल्प दिखाता है, उस उपयोगकर्ता के लिए जो जानता है कि उसे क्या करना है लेकिन यह नहीं कि किस प्रकार का extension उसकी आवश्यकता पूरी करेगा। MCP servers को अलग navigation भी मिला है, जिसमें popularity के अनुसार प्रमुखता से दिखाए गए विकल्प और category-आधारित मार्ग शामिल हैं। Changelog canvases की उपयोगिता को एक ठोस उदाहरण से दिखाता है: issues को छाँटने, backlog को प्राथमिकता देने, follow-ups assign करने और फिर किसी कार्य को Copilot को सौंपने के लिए Azure DevOps canvas, ताकि वह जाँच करे, implementation करे या review तैयार करे।

🔗 चार GitHub Skills अभ्यास · Customize tab की सामान्य उपलब्धता


Developers के लिए Google tooling: Gemini CLI 0.57.0 और Antigravity 2.10.0

25 अगस्त—Google ने Gemini CLI 0.57.0 का stable version जारी किया, जिससे पंद्रह मिनट पहले preview 0.58.0 जारी हुआ था। इस version की सामग्री नई सुविधाओं से कम और Google अपने tool का रखरखाव कैसे करता है, इसके बारे में अधिक बताती है: changelog की 24 entries में से 13 के आगे [SSR Agent] Issue Fix लगा है और वे अक्सर पुराने issue numbers, 19239 से 28518 तक, की ओर ले जाती हैं। ये सुधार backlog में जमा परेशानियों को संबोधित करते हैं—terminal interface का अनिश्चित काल तक अटकना, जिसके लिए timeouts जोड़े गए; personal accounts के लिए भ्रामक administration error message; autocomplete suggestions के बाद space का अभाव; और external editor से बाहर निकलने पर terminal rendering का refresh न होना। दूसरे शब्दों में, Google अपने agent को स्वयं के technical debt पर लगाता है और परिणाम सीधे stable version में पहुँचता है।

प्रकाशित versionतारीख और समय (UTC)Release channelमुख्य बिंदु
v0.57.025 अगस्त, 18:37:14Stable13 [SSR Agent] सुधार, evals validation, context-aware retries
v0.58.0-preview.025 अगस्त, 18:22:01PreviewmacOS Seatbelt profile में Docker isolation, safety verifiers

सुविधाओं की ओर देखें तो प्रयास evaluation पर केंद्रित है, जिसमें eval validation command और विफलताओं के summaries शामिल करने वाला tool-call formatter है। Reliability भी बेहतर हुई है: capacity errors अब context को ध्यान में रखते हुए silent retries शुरू करते हैं, और multi-turn request रद्द करने पर partial state के बजाय पूर्ण rollback होता है। Release notes खोजने वालों के लिए ध्यान देने योग्य बात यह है कि repository की docs/changelogs/index.md file को 6 अगस्त के v0.54.0 के बाद update नहीं किया गया है।

2.9.1 और उसके Remote Control के चार दिन बाद, Google Antigravity 24 अगस्त को 2.10.0 पर पहुँचा और उसने उन दो कमियों को पूरा किया जिनके कारण tool से बाहर जाना पड़ता था: integrated terminal और native Git version control, दोनों सीधे sidebar में स्थित हैं। यह संयोजन product की दिशा के अनुरूप है—Antigravity स्वयं को ऐसे environment के रूप में प्रस्तुत करता है जहाँ line-by-line code editing के बजाय agents को संचालित किया जाता है, लेकिन इसके लिए window बदले बिना command चलाना और diff देखना भी संभव होना चाहिए। Version का बाकी हिस्सा इस दायरे को बढ़ाता है कि agent को क्या दिया जा सकता है और उसके काम में क्या देखा जा सकता है: audio files भी स्वीकार्य attachments में शामिल हो गई हैं, images पर interactive comments किसी visual को annotate करके agent को दिशा देने देते हैं, और MCP tools के enriched execution previews यह स्पष्ट करते हैं कि tool server ने वास्तव में क्या किया। Google के अनुसार version में 13 improvements और 8 fixes हैं तथा rollout क्रमिक रूप से हो रहा है।

🔗 Gemini CLI v0.57.0 · Antigravity changelog


Anthropic ने कल्याण पर स्वतंत्र evaluations के लिए 5 million dollars का वित्तपोषण किया

25 अगस्त—Anthropic ने उपयोगकर्ताओं के कल्याण पर AI के प्रभाव से संबंधित स्वतंत्र research को वित्तपोषित करने के लिए 5 million dollars का grants program शुरू किया। चयनित प्रतिभागियों को प्रत्यक्ष funding, models तक access और technical support मिलता है, लेकिन वे पूरी स्वतंत्रता से काम करते हैं: उनकी evaluations open source में प्रकाशित होती हैं और पूरे उद्योग द्वारा पुनः उपयोग की जा सकती हैं। Applications 21 सितंबर तक खुली हैं और पूर्ण proposal जमा करने के लिए चुने गए candidates को 5 अक्टूबर से पहले सूचित किया जाएगा।

तकनीकी तर्क बताता है कि यह क्षेत्र सामान्य evaluation methods का विरोध क्यों करता है। किसी model के अधिकांश behaviors के लिए यह तय करने हेतु एक अलग response की जाँच करना पर्याप्त होता है कि वह सही और उपयुक्त है या नहीं। कल्याण के लिए context आवश्यक है: संकट में पड़ा उपयोगकर्ता जरूरी नहीं कि शुरुआत में ही self-harm संबंधी विचारों का उल्लेख करे, और संतुलित आहार पर दी गई सलाह एक स्थिति में उचित होने पर भी संभावित रूप से खतरनाक हो सकती है यदि व्यक्ति ने eating disorders का इतिहास दिखाया हो। Safeguards team साथ ही कठोरता के पाँच मानदंड प्रकाशित करती है: क्या मापा जा रहा है इसे स्पष्ट रूप से बताना; design में clinicians और domain specialists को शामिल करना; precautions और harms दोनों का परीक्षण करना—अर्थात अत्यधिक सहमति के जोखिम के साथ अत्यधिक refusal के जोखिम का भी मूल्यांकन करना—; multi-turn scenarios के माध्यम से वास्तविक उपयोग को प्रतिबिंबित करना; और automated graders को वास्तविक experts के विरुद्ध validate करना। यह तीसरा मानदंड, over-compliance और over-refusal के बीच समरूपता, इस दृष्टिकोण को guardrails को केवल अधिक कठोर बनाने से अलग करता है।

🔗 कल्याण research grants


Quantization-Aware Healing: एक 4-बिट मॉडल जो अपने मूल पूर्ण-परिशुद्धता मॉडल से आगे निकलता है

25 अगस्त — किसी बड़े मॉडल को परिनियोजन योग्य बनाने की मानक पाइपलाइन में तीन चरण क्रमशः आते हैं: आर्किटेक्चर को संपीड़ित करना, परिणाम को क्वांटाइज़ करना, फिर गुणवत्ता में आई गिरावट की भरपाई करना। इस अंतिम चरण के लिए प्रमुख विधि QAT (quantization-aware training) है, जो छद्म-क्वांटाइज़ेशन संचालन जोड़ती है और पुनः प्रशिक्षण देती है; इसका एक विकल्प QAD है, जो पूर्ण-परिशुद्धता वाले संपीड़ित मॉडल से आसवन करता है। दोनों ही मामलों में, छात्र अधिकतम अपने संपीड़ित शिक्षक की बराबरी कर सकता है और इसलिए संपीड़न द्वारा निर्धारित सीमा उसे विरासत में मिलती है।

Multiverse Computing केवल एक पंक्ति का बदलाव प्रस्तावित करता है: सीधे मूल मॉडल, यानी संपीड़न से पहले वाले मॉडल से आसवन करना। इस तरह क्वांटाइज़ेशन हानिपूर्ण पश्च-प्रसंस्करण न रहकर सीखने की प्रक्रिया का अभिन्न चरण बन जाता है। परिणाम सहज धारणा के विपरीत है — 60B तक संपीड़ित और फिर MXFP4 में क्वांटाइज़ किए गए GPT-OSS 120B पर लागू करने से यह विधि ऐसा 4-बिट मॉडल बनाती है जो नौ में से सात बेंचमार्क पर अपने ही bfloat16 स्रोत की बराबरी करता है या उससे आगे निकल जाता है। सबसे बड़े लाभ वहीं मिलते हैं जहाँ संपीड़न सबसे अधिक नुकसान पहुँचाता है: दीर्घ-संदर्भ तर्क में AA-LCR पर +7.4 अंक और AIME 2025 पर +5.6 अंक। केवल MMLU-Pro और SciCode पर गिरावट आई है, और दोनों डेढ़ अंक से कम हैं।

समान पाइपलाइन में QAT से सीधी तुलना शायद व्यवहार में सबसे उपयोगी परिणाम है। MXFP4 में क्वांटाइज़ किए गए GPT-OSS 9B पर दोनों विधियाँ लगभग समान शिखर तक पहुँचती हैं, 54.9 बनाम 54.6, लेकिन समान लागत पर नहीं: QAH लगभग सौ चरणों में वहाँ पहुँचकर उसी स्तर पर बना रहता है, जबकि QAT को वहाँ पहुँचने में लगभग 700 चरण लगते हैं और उसके बाद उसका प्रदर्शन गिरने लगता है। इसका ठोस परिणाम अलग तरह का परिनियोजन जोखिम है — QAT चेकपॉइंट के लिए समयपूर्व रोक की सावधानीपूर्वक निगरानी आवश्यक होती है, जबकि QAH चेकपॉइंट के लिए इसकी आवश्यकता बहुत कम होती है।

🔗 Quantization-Aware Healing


Gradio ने ग्राफ़-आधारित AI पाइपलाइन निर्माता gr.Workflow को एकीकृत किया

25 अगस्त — Hugging Face ने gr.Workflow प्रस्तुत करने वाली एक मार्गदर्शिका प्रकाशित की है, जो अब Gradio में एकीकृत एक आधारभूत घटक है। शुरुआती निष्कर्ष सरल है: अधिकांश रोचक AI अनुप्रयोग केवल एक मॉडल कॉल नहीं, बल्कि चरणों की एक शृंखला होते हैं — एक छवि बनाई जाती है, उसकी पृष्ठभूमि हटाई जाती है, उससे वॉइस-ओवर तैयार किया जाता है और किसी LLM से शीर्षक माँगा जाता है। अब तक इस शृंखला को जोड़ने और साफ़-सुथरे ढंग से प्रस्तुत करने के लिए तर्क और इंटरफ़ेस दोनों लिखने पड़ते थे। gr.Workflow दोनों को मिला देता है: चरणों को टाइप किए गए नोड्स के ग्राफ़ के रूप में वर्णित किया जाता है और ग्राफ़ स्वयं इंटरफ़ेस बन जाता है।

डेवलपर्स के लिए इसका महत्व दृश्य प्रदर्शन से कहीं आगे है। ग्राफ़ के प्रत्येक आउटपुट को स्वचालित रूप से अपना REST एंडपॉइंट मिलता है: उदाहरण के रूप में दिया गया मीडिया स्टूडियो, जो FLUX जनरेशन, पृष्ठभूमि हटाने, वाक्-संश्लेषण और एक LLM को क्रम से जोड़ता है, तीन अलग-अलग रूट (/sticker, /voiceover, /episode_title) उपलब्ध कराता है, जिन्हें इंटरफ़ेस से गुज़रे बिना कोड से कॉल किया जा सकता है। नोड्स चार प्रकार के स्रोतों से संवाद कर सकते हैं — Hugging Face के Inference Providers के माध्यम से होस्ट किए गए मॉडल, निर्माण-खंडों के रूप में पुनः उपयोग किए गए अन्य सार्वजनिक Gradio Spaces, Hub के किसी डेटासेट की एक पंक्ति और मनमाना Python। अंतिम विकल्प सबसे अधिक संभावनाएँ खोलता है: @spaces.GPU से सजाया गया ऑपरेटर नोड अपने निष्पादन की अवधि के लिए ZeroGPU का GPU आरक्षित करता है, जिससे अपने मॉडल वेट चलाए जा सकते हैं। मार्गदर्शिका के साथ Spaces पर वास्तव में परिनियोजित पाँच अनुप्रयोग भी दिए गए हैं, जिनमें एक डेटासेट प्रोफ़ाइलर और Lightricks/LTX-Video से स्थिर छवि को एनिमेट करने वाला प्रदर्शन शामिल है।

🔗 gr.Workflow मार्गदर्शिका


ElevenLabs ने Composer लॉन्च किया, जो खंड-दर-खंड गीत संपादक है

25 अगस्त — ElevenLabs ने Composer की घोषणा की है, जो गीत पर खंड-दर-खंड काम करने वाला संपादक है। इसका सिद्धांत संगीत मॉडलों की प्रमुख जनरेशन पद्धति से अलग है: एक ही बार में पूरा गीत बनाने और कोई अंश पसंद न आने पर सब कुछ फिर से शुरू करने के बजाय, Composer किसी पद, मुखड़े या ब्रिज पर अलग से दोबारा काम करने देता है। शुरुआत के चार विकल्प दिए गए हैं — आपके अपने बोल, आपके द्वारा लाई गई मौजूदा ट्रैक, एक खाली पृष्ठ या साधारण प्रॉम्प्ट — जिसके बाद क्रमिक संशोधनों से गीत तैयार होता है।

Eleven Music के बाद संगीत की ओर ElevenLabs का यह दूसरा कदम है और यह कंपनी के लिए गतिविधियों से भरे सप्ताह में आया है, क्योंकि CLI v1 एक दिन पहले ही जारी हुआ था। इसकी स्थिति शेष ऑडियो क्षेत्र के अनुरूप है: Suno ने 13 अगस्त को Studio 2.0 लॉन्च किया, Pika ने 18 अगस्त को अपनी Pika Music शृंखला जारी की और Stability AI ने उसी दिन ऑडियो वर्कस्टेशनों के लिए अपना प्लगइन उपलब्ध कराया। अब प्रतिस्पर्धा का क्षेत्र जनरेशन की कच्ची गुणवत्ता के बजाय गीत की संरचना पर सूक्ष्म नियंत्रण बन गया है। हालाँकि एक सीमा है: घोषणा के साथ कोई ब्लॉग पोस्ट नहीं है और इस बारे में कोई जानकारी उपलब्ध नहीं है कि किन योजनाओं में Composer की पहुँच मिलेगी, निर्यात प्रारूप क्या होंगे या API उपलब्ध होगा या नहीं।

🔗 Composer की घोषणा, @ElevenLabs


LiveAvatar ने समवर्ती उपयोग की सभी सीमाएँ हटाईं और कीमत घटाकर 0.01 USD प्रति मिनट की

25 अगस्त — HeyGen ने अपने रियल-टाइम अवतार उत्पाद LiveAvatar पर समवर्ती उपयोग की सीमाएँ हटाने की घोषणा की है। घोषणा की भाषा बदलाव की प्रकृति पर ज़ोर देती है: सीमाएँ बढ़ाई नहीं गई हैं, बल्कि पूरी तरह हटा दी गई हैं। एक सत्र हो या दस हज़ार, सभी एक ही API पर बिना किसी पूर्व कोटा वार्ता के चलते हैं। घोषणा के साथ दो अन्य विवरण हैं — रेंडरिंग पूर्ण-शरीर 1080p में बनी रहती है और बड़े पैमाने पर कीमत घटकर 0.01 USD प्रति मिनट तक पहुँच जाती है।

यह मूल्य स्तर संभावित उपयोगों की प्रकृति बदल देता है: एक सेंट प्रति मिनट पर रियल-टाइम अवतार बड़े पैमाने पर ग्राहक सहायता, प्रशिक्षण या इंटरैक्टिव कियोस्क के लिए व्यवहार्य हो जाता है, जहाँ अब तक प्रति-इकाई लागत ही व्यावहारिकता निर्धारित करती थी। तकनीकी दृष्टि से समवर्ती उपयोग की सीमा हटना सबसे रोचक बिंदु है। रियल-टाइम अवतार प्लेटफ़ॉर्म सामान्यतः एक साथ चलने वाले सत्रों की संख्या सीमित करते हैं, क्योंकि हर सत्र लगातार GPU का उपयोग करता है; यह सीमा हटाने के लिए या तो पर्याप्त अतिरिक्त क्षमता चाहिए या मॉडल की दक्षता में सुधार। HeyGen ने अपने दृष्टिकोण की व्याख्या करने वाला एक लेख प्रकाशित किया है, जिसके तकनीकी विवरण स्कैन के समय उपलब्ध नहीं थे।

🔗 LiveAvatar पर असीमित समवर्ती उपयोग


Grok 4.6 अब OpenCode Go में उपलब्ध

25 अगस्त — Grok 4.6 अब ओपन-सोर्स कोडिंग एजेंट OpenCode की सदस्यता योजना OpenCode Go में शामिल हो गया है। घोषणा दिन के अंत में OpenCode ने की और आधे घंटे बाद @grok खाते ने इसे साझा किया। डेवलपर्स के लिए ठोस जानकारी कोटा है: Go योजना के उपयोगकर्ताओं को प्रत्येक 5 घंटे की अवधि में 169 अनुरोध मिलते हैं। यह एक रोलिंग सीमा है, मासिक गणना नहीं, इसलिए सहायक कोडिंग सत्रों में सामान्यतः होने वाले अचानक अधिक उपयोग के अनुकूल है।

यह एकीकरण Grok 4.6 को तृतीय-पक्ष टूल्स के लिए खोलने की शृंखला का हिस्सा है: मॉडल 14 अगस्त को GitHub Copilot, 19 अगस्त को Amazon Bedrock और फिर 21 अगस्त को Google के Gemini Enterprise Agent Platform पर उपलब्ध हुआ। इसके अतिरिक्त, xAI ने मई 2026 में OpenCode को अपनी SuperGrok और X Premium सदस्यताओं से पहले ही जोड़ दिया था — इसलिए आज का नया बदलाव स्वयं OpenCode तक पहुँच नहीं, बल्कि Go योजना में 4.6 मॉडल की उपलब्धता है, जिसमें उपयोगकर्ता द्वारा अलग से xAI सदस्यता देने के बजाय कोटा शामिल है।

🔗 @grok द्वारा साझा घोषणा · @opencode की घोषणा


Cohere ने 2026 में संप्रभु AI अपनाने पर IDC अध्ययन प्रकाशित किया

25 अगस्त — Cohere ने विनियमित क्षेत्रों में संप्रभु AI को अपनाने पर IDC से करवाए गए InfoBrief के परिणाम प्रकाशित किए हैं। अध्ययन में अप्रैल से मई 2026 के बीच कनाडा, संयुक्त राज्य अमेरिका, यूनाइटेड किंगडम और जर्मनी में एक अरब डॉलर से अधिक वार्षिक राजस्व वाली कंपनियों के 500 से अधिक वरिष्ठ निर्णयकर्ताओं का सर्वेक्षण किया गया।

सबसे उल्लेखनीय परिणाम अपनाने से कम और वैचारिक भ्रम से अधिक संबंधित है। हर तीन में से एक अधिकारी को अपने शब्दों में संप्रभु AI का वर्णन करने में कठिनाई होती है और केवल 13% कहते हैं कि वे इस विषय से बहुत व्यापक रूप से परिचित हैं। जो लोग इसकी परिभाषा दे पाते हैं, उनमें 52% इसे स्थानीय या राष्ट्रीय नियंत्रण के संदर्भ में व्यक्त करते हैं और 35% डिजिटल स्वतंत्रता का उल्लेख करते हैं। यह अंतर संगठनात्मक संरचना में भी दिखाई देता है: IT अधिकारियों की जागरूकता व्यावसायिक अधिकारियों से दोगुनी है।

सर्वेक्षण किया गया क्षेत्रडेटा रिसाव और अनुपालन मुख्य चिंता के रूप मेंप्रतिस्पर्धात्मक लाभ प्रेरक के रूप में
वित्तीय सेवाएँ82 %21 %
उद्योग77 %32 %
दूरसंचार75 %37 %
स्वास्थ्य74 %28 %
ऊर्जा70 %21 %

प्रेरणाओं के मामले में सहमति स्पष्ट और सभी क्षेत्रों में समान है: सर्वेक्षण किए गए प्रत्येक क्षेत्र में डेटा रिसाव, गोपनीयता और अनुपालन सबसे ऊपर हैं। प्रतिस्पर्धात्मक लाभ एक द्वितीयक लेकिन बढ़ती हुई प्रेरणा के रूप में सामने आता है, जिसे जर्मनी (23%) या यूनाइटेड किंगडम (18%) की तुलना में कनाडा (35%) और संयुक्त राज्य अमेरिका (28%) में अधिक महत्व दिया गया। यह अध्ययन स्पष्ट रूप से Cohere की स्थिति को बल देता है, जिसकी एजेंटिक प्लेटफ़ॉर्म North ग्राहक द्वारा चुनी गई अवसंरचना और अधिकार-क्षेत्र में चलती है; फिर भी आँकड़े एक पहचाने गए स्रोत से संबद्ध हैं। IDC का यह भी अनुमान है कि 2028 तक बहुराष्ट्रीय कंपनियों के CIO मॉड्यूलर संप्रभु क्लाउड परिवेशों और डेटा स्थानीयकरण में अपना निवेश 65% बढ़ाएँगे।

🔗 State of Sovereign AI Adoption 2026


संक्षिप्त समाचार

  • Bain & Company, Claude Partner Network में शामिल हुआ — परामर्श फ़र्म Global Premier भागीदार बनी है, जिसके साथ उसके 19,000 कर्मचारियों के लिए Claude का परिनियोजन किया गया है; पायलट चरण में ही 7,000 से अधिक सक्रिय उपयोगकर्ता थे और दो-तिहाई से अधिक प्रतिभागियों ने Claude for Excel अपना लिया। 🔗 Anthropic पोस्ट
  • Amp ने बताया कि orbs क्या हैं — नाम को लेकर भ्रम के जवाब में Thorsten Ball का नोट: orb एक दूरस्थ एजेंट है, जिसे वेब, फ़ोन या CLI से नियंत्रित किया जा सकता है। लागत पर दो उपयोगी स्पष्टीकरण हैं: असीमित निष्क्रिय अवस्था के लिए शुल्क नहीं लगता और एक साथ चलने वाले orbs की संख्या सीमित नहीं है। 🔗 Amp नोट
  • Together AI ने Qwen3.8 27B को fine-tuning और समर्पित inference के लिए उपलब्ध किया — मॉडल अब अपने डेटा पर परिशोधन और आरक्षित हार्डवेयर पर Dedicated Model Inference, दोनों के लिए उपलब्ध है। 🔗 @togethercompute की पोस्ट
  • FINAL-Bench ने FINCHAL शुरू किया, जो एजेंटों के लिए वित्तीय पूर्वानुमान प्रतियोगिता है — 2,000 डॉलर की पुरस्कार राशि वाली यह प्रतियोगिता पूर्वानुमानों के बजाय पोज़िशन माँगती है और कौशल को संयोग से अलग करने के लिए भाग्य की अधिकतम सीमा (luck ceiling) प्रकाशित करती है। 🔗 FINAL-Bench पोस्ट
  • Au-Zone ने EdgeFirst Model Zoo प्रकाशित किया — वास्तविक एम्बेडेड सिलिकॉन पर मापे गए डिटेक्शन और सेगमेंटेशन के चार YOLO परिवार, जहाँ प्रत्येक प्रकाशित आँकड़ा उसे उत्पन्न करने वाले सत्यापन सत्र से जुड़ता है; यह निर्माताओं द्वारा घोषित TOPS की अपारदर्शिता के विपरीत है। 🔗 EdgeFirst पोस्ट
  • macOS के लिए Gemini की बुद्धिमान श्रुतलेख सुविधा — डेस्कटॉप की किसी भी विंडो में बोलकर लिखना, झिझक को स्वचालित रूप से हटाना और वाक्य के बीच किए गए सुधारों को ध्यान में रखना; आवाज़ से फ़ाइलों का सारांश बनाने और पाठ को दोबारा लिखने का काम भी किया जा सकता है। 🔗 blog.google मार्गदर्शिका
  • push rules अब पथ अपवाद स्वीकार करते हैं — सार्वजनिक पूर्वावलोकन में Restrict file paths और Restrict file size नियम विशिष्ट पथों को छूट दे सकते हैं, उदाहरण के लिए **/gradle/wrapper/*.jar को छोड़कर हर जगह JAR को अवरुद्ध करना। 🔗 GitHub बदलाव-सूची
  • सुरक्षा परामर्श से किसी उपयोगकर्ता को अवरुद्ध करना — सार्वजनिक रिपॉज़िटरी में सेटिंग्स पर वापस जाए बिना विवरण या टिप्पणी के तीन-बिंदु मेन्यू से यह कार्रवाई की जा सकती है; परामर्श जस का तस रहता है। 🔗 GitHub बदलाव-सूची
  • Manus ने डेटा पुनर्स्थापना की अत्यधिक माँग की सूचना दी — जो पुनर्स्थापनाएँ पूरी नहीं होतीं, उन्हें दिन में बाद में फिर से शुरू करना होगा; बैकअप पैकेजों को अक्षुण्ण और अपरिवर्तित रखने का स्पष्ट निर्देश दिया गया है। 🔗 @ManusAI की पोस्ट
  • Kling ने अपने MCP सर्वर पर तीन मार्गदर्शिकाएँ प्रकाशित कीं — सत्यापित रचनात्मक कॉन्फ़िगरेशन को फिर से चलाने और बड़ी संख्या में विविधताएँ बनाने के लिए Kling को MCP-संगत सहायक से जोड़ना; तीन में से दो ट्यूटोरियल Claude Code को क्लाइंट के रूप में उल्लेखित करते हैं। 🔗 Kling ब्लॉग
  • Wan 3.0 अब Runway और Replicate पर उपलब्ध — Runway ने इसे 24 अगस्त को छवि, वीडियो और ऑडियो में कई संदर्भ इनपुट के साथ एकीकृत किया; Replicate ने 25 अगस्त को इसे उपलब्ध कराया और समकालिक ऑडियो के साथ एक ही टेक में मूल रूप से 30 सेकंड तैयार करने की क्षमता पर ज़ोर दिया। 🔗 @runwayml की पोस्ट
  • Runway ने अपने AI Summit के लिए नए वक्ताओं की घोषणा की — सितंबर में San Francisco में होने वाले कार्यक्रम का विस्तार रोबोटिक्स, स्वायत्त वाहनों, विपणन और अवसंरचना तक किया गया। 🔗 @runwayml की पोस्ट
  • MiniMax ने H3 एकीकरणों की एक सूची प्रकाशित की — Awesome MiniMax H3 Integrations खुले वीडियो मॉडल के इर्द-गिर्द बन रही परियोजनाओं को सूचीबद्ध करता है, जिनमें 24 GB VRAM पर चलने वाले कॉन्फ़िगरेशन शामिल हैं। 🔗 @MiniMax_AI की पोस्ट
  • Luma ने Dream Lab Weekly शुरू किया — Luma के रचनात्मक पेशेवरों और उत्पाद पर उनके साप्ताहिक कार्य को समर्पित वीडियो शृंखला का पहला एपिसोड। 🔗 @LumaLabsAI की पोस्ट
  • NVIDIA ने खुले मॉडलों की रूटिंग पर Nemotron Labs सत्र प्रसारित किया — Get Started with Open Model Routing शीर्षक वाला 55 मिनट का सीधा प्रसारण, जो Nemotron 3.5 Lightning और NeMo Switchyard पर किए गए कार्य का विस्तार है। 🔗 @NVIDIAAI की पोस्ट
  • ओडिसी पर Grok Imagine प्रतियोगिता के लिए एक सप्ताह शेष — ओडिसी से ऐसा दृश्य बनाना है जो टूल की वीडियो और आवाज़ क्षमताओं को प्रदर्शित करे; पुरस्कार राशियाँ 100,000, 50,000 और 25,000 डॉलर हैं। 🔗 @grok की पोस्ट
  • Plus और Pro सदस्यों के लिए सीमा रीसेट का भंडार — रीसेट अवधि की प्रतीक्षा करने के बजाय उपयोगकर्ता भंडार में रखा एक रीसेट इस्तेमाल करता है; लॉन्च के समय एक निःशुल्क रीसेट और रेफ़रल के माध्यम से अतिरिक्त रीसेट मिलते हैं, जबकि Business में साझा workspace क्रेडिट उपलब्ध हैं। 🔗 ChatGPT और Codex बदलाव-सूची

इसका क्या अर्थ है

सिलिकॉन फिर से मॉडल प्रयोगशालाओं का विषय बन रहा है। OpenAI ने एक ही दिन अपनी अनुमान-प्रसंस्करण चिप के पहले मापे गए आँकड़े और अपनी compute रणनीति स्पष्ट करने वाला लेख प्रकाशित किया। यह संयोगवश एक ही तारीख पर नहीं हुआ: जब कोई मॉडल प्रदाता अपना सिलिकॉन डिज़ाइन करता है, उसे किसी तीसरे पक्ष के सार्वजनिक benchmark पर मापता है और दस भागीदारों के पोर्टफ़ोलियो को सार्वजनिक रूप से स्वीकार करता है, तो प्रतिस्पर्धा की प्रकृति बदल जाती है। प्रश्न अब «कौन-सा मॉडल सबसे अच्छा है» नहीं रह जाता, बल्कि «प्रति सफल कार्य लागत कितनी है» बन जाता है, और इसका उत्तर weights जितना ही rack में भी तय होता है। शायद सबसे महत्वपूर्ण विवरण कहीं और है: चिप डिज़ाइन करने और उसके kernels लिखने में AI का उपयोग हुआ, नौ महीनों में उसे निर्माण के लिए भेज दिया गया और चुने गए blocks पर जनित implementations ने मानव विशेषज्ञों के implementations को पीछे छोड़ दिया। चक्र पूरा हो गया है—मॉडल उस hardware को डिज़ाइन कर रहे हैं जिस पर वे चलेंगे।

AI फिर से device पर उतर रहा है और आँकड़े भी अब इसकी पुष्टि करने लगे हैं। एक ही दिन मिले तीन संकेत एक ही दिशा दिखाते हैं। Perplexity अपने पूरे agent को DGX Spark पर स्थानीय रूप से चलाता है, बिना credits खर्च किए, जबकि cloud escalation उपयोगकर्ता का निर्णय बना रहता है। Multiverse Computing ने ऐसी विधि प्रकाशित की है जिसमें 4-bit मॉडल अपने पूर्ण-परिशुद्धता वाले स्रोत के बराबर या उससे बेहतर प्रदर्शन करता है, जिससे आक्रामक quantization के विरुद्ध सामान्य तर्क समाप्त हो जाता है। Au-Zone ने embedded silicon के अनुसार vision के माप प्रकाशित किए हैं और घोषित TOPS की आलोचना की है कि वे यह बिल्कुल नहीं बताते कि कोई विशिष्ट मॉडल वास्तव में कैसा प्रदर्शन करेगा। इन तीनों में से कोई भी कार्य frontier की बराबरी का दावा नहीं करता: Perplexity का ईमानदार आँकड़ा Terminal Bench 2.1 पर स्थानीय रूप से 59.6% है, जबकि अकेले Claude Opus 5 का आँकड़ा 82.4% है। लेकिन सलाहकार मॉडल की ओर escalation दो-तिहाई लागत में अंतर का तीन-पाँचवाँ हिस्सा भर देता है, और समानता से अधिक यही समझौता स्थानीय निष्पादन को उचित ठहराता है।

खुले weights अब मानक स्थिति के रूप में स्थापित हो रहे हैं। Qwen द्वारा साझा किए गए 500,000 arXiv लेखों के विश्लेषण से पहले से दिखाई दे रहा उलटफेर दर्ज होता है: चीनी खुले मॉडलों का उल्लेख 10% से बढ़कर लगभग 40% हो गया है, जबकि अमेरिकी खुले मॉडल 25 से 30% के बीच स्थिर हैं। Qwen3.8-27B अपनी क्षमता के आकार वाला एकमात्र मॉडल होते हुए Code Arena के शीर्ष 10 में पहुँचा; GLM-5.3 ने बहु-परीक्षणों में DeepSWE पर GPT-5.6 Sol और Claude Fable 5 को 2.1 से 5.4 गुना कम लागत पर पीछे छोड़ा; IBM ने पहले ही दिन Granite 4.2 को चार quantized variants और चौदह GGUF formats के साथ खोल दिया—हर जगह यही तर्क दोहराया जा रहा है। weights खोलना अब पीछे छूटने के बाद बराबरी पाने का कदम नहीं, बल्कि दूसरों का default infrastructure बनने का माध्यम है; हालाँकि Nathan Lambert स्वयं एक सावधानी जोड़ते हैं: प्रकाशन releases से पीछे चलते हैं और ये curves वर्तमान प्राथमिकताओं के बजाय जारी कार्यों का वर्णन करते हैं।

और web अब आँखों के बजाय agents द्वारा पढ़े जाने की तैयारी कर रहा है। WebMCP Challenge में 35,000 डॉलर का पुरस्कार है, जो कम है; लेकिन इससे जो उजागर होता है, उसका मूल्य अधिक है। Chrome, Cloudflare, Shopify, Vercel, Render और Netlify, OpenAI के साथ ऐसे standard पर एकमत हैं जो sites से अपेक्षा करता है कि वे agents को interface का अनुमान लगाने देने के बजाय structured tools उपलब्ध कराएँ। उसी दिन ChatGPT desktop मूल रूप से WebMCP का उपयोग करने में सक्षम हुआ, Codex संगत application बना और deploy कर सकता है, और OpenAI ने notebooks के एक tool में protocol के अपने आंतरिक उपयोग का दस्तावेज़ीकरण किया। यह अभिसरण Rohlik के वर्णन से भी मेल खाता है, जिसमें पचास से अधिक MCP integrations और यह सिद्धांत शामिल हैं कि हर नया tool पहले ही दिन agents के लिए सुलभ होना चाहिए। agents के लिए interface layer अब शोध का विषय न रहकर engineering की आवश्यकता बन रही है।


स्रोत