खोजें

Health in ChatGPT, FLUX 3 छवि और वीडियो को एकीकृत करता है, ChatGPT Voice desktop पर आता है

Health in ChatGPT, FLUX 3 छवि और वीडियो को एकीकृत करता है, ChatGPT Voice desktop पर आता है

ai-powered-markdown-translator

gpt-5.4-mini के साथ फ़्रेंच से हिंदी में अनुवादित लेख.

GitHub पर प्रोजेक्ट देखें ↗

23 जुलाई 2026 सात प्रमुख घोषणाओं को समेटे हुए है: OpenAI अमेरिका में Health in ChatGPT जारी करता है और ChatGPT Voice को desktop ऐप पर लाता है, Black Forest Labs FLUX 3 में छवि, वीडियो, ऑडियो और action prediction को एकीकृत करता है, GitHub पहली बार यह सीमित करता है कि उसके agents Issues में अकेले क्या बदलते हैं, HeyGen अपने HyperFrames framework को एक पूर्ण video creation agent में बदलता है, और Cognition Poke के अधिग्रहण तथा अमेरिकी Department of Energy के साथ एक समझौता ज्ञापन के जरिए अपना दायरा बढ़ाता है। इन सात विषयों के इर्द-गिर्द अठारह उल्लेखनीय नई चीज़ें भी हैं — Claude के voice mode से लेकर code tools (Cursor, Replit, Zed, v0, Amp) तक, और Gemini तथा Hugging Face में cyberdefense तक।


Health in ChatGPT अमेरिका में आता है

23 जुलाई — OpenAI Health in ChatGPT को web और iOS पर 18 वर्ष या उससे अधिक आयु के, लॉग-इन किए हुए अमेरिकी उपयोगकर्ताओं के लिए जारी कर रहा है, Free, Go, Plus और Pro योजनाओं के साथ। यह सुविधा Apple Health और समर्थित medical records (अमेरिकी hospital systems, One Medical, Function Health) को सुरक्षित रूप से जोड़ने देती है, ताकि ChatGPT के पास उपयोगकर्ता के health context तक पहुंच हो — किसी test result की तुलना पिछले tests से करना, यह संक्षेप करना कि अंतिम appointment के बाद क्या बदला, या sleep और activity को दैनिक routine के साथ मिलाना।

OpenAI एक आंकड़ा सामने रखता है: हर सप्ताह 300 मिलियन से अधिक लोग ChatGPT से स्वास्थ्य-संबंधी प्रश्न पूछते हैं। कंपनी का कहना है कि वह सैकड़ों doctors के साथ काम कर रही है ताकि accuracy, safety और उन स्थितियों की पहचान को मापा और बेहतर किया जा सके जिनमें professional care की आवश्यकता होती है। मॉडल पक्ष पर, GPT-5.5 Instant (free plan) सभी उपयोगकर्ताओं के लिए एक साझा आधार लाता है, जबकि GPT-5.6 Sol (paid plans) जटिल प्रश्नों पर और आगे जाता है; HealthBench Professional पर, जो doctors के साथ विकसित मूल्यांकन है, सभी GPT-5.6 models GPT-5.5 से बेहतर प्रदर्शन करते हैं।

गोपनीयता के मामले में OpenAI जोर देता है: जुड़े हुए medical records और Apple Health data, साथ ही उन पर आधारित conversations, कभी भी models के प्रशिक्षण या विज्ञापन को लक्षित करने के लिए उपयोग नहीं किए जाते, चाहे elsewhere training setting कुछ भी हो। डिफ़ॉल्ट रूप से, ChatGPT हर बार इन data के उपयोग से पहले अनुमति मांगता है; account disconnect करने पर synchronized data 30 दिनों के भीतर हटा दिए जाते हैं। एक महत्वपूर्ण बात: Health Codex में उपलब्ध नहीं है। इस वर्ष की शुरुआत में, एक प्रारंभिक version ने इन exchanges को एक समर्पित space तक सीमित रखा था — लेकिन स्वास्थ्य-संबंधी 70% से अधिक conversations कहीं और हो रही थीं, इसलिए अब इसे सभी conversations में native रूप से एकीकृत किया गया है।

🔗 आधिकारिक घोषणा — OpenAI


FLUX 3 : Black Forest Labs छवि, वीडियो, ऑडियो और action prediction को एकीकृत करता है

23 जुलाई — Black Forest Labs (BFL), image models के निर्माता FLUX, FLUX 3 की घोषणा करते हैं, जिसे अलग-अलग models को बाद में जोड़ने के बजाय एकीकृत architecture में प्रशिक्षित एक एकल multimodal model के रूप में प्रस्तुत किया गया है। कंपनी पिछले generations की तुलना में सभी styles में “वास्तविकता के अधिक निकट” rendering पर जोर देती है।

कवर की गई modality23 जुलाई तक स्थिति
छविउपलब्ध
वीडियो (FLUX 3 Video)शुरुआती पहुंच, आज से उपलब्ध
ऑडियोएकीकृत architecture में शामिल
action predictionmimic और Audi के साथ robotization कार्य

इस रिलीज़ को दो बातें अलग बनाती हैं। पहली, FLUX 3 Video BFL के ऐतिहासिक दायरे को — जो अब तक fixed image पर केंद्रित था — वीडियो तक बढ़ाता है, एक ऐसा क्षेत्र जहाँ अब तक Runway, Luma, Kling या Wan का दबदबा रहा है। दूसरी, BFL बताता है कि model का एकीकृत architecture physical actions की भविष्यवाणी के लिए बढ़ाया जा सकता है, जिसमें mimic (teleoperation और robotic learning में विशेषज्ञ) और Audi के साथ मिलकर काम किया गया है — यह एक ऐसा आयाम है जो BFL को उस physical AI क्षेत्र के और करीब लाता है जहाँ NVIDIA Cosmos और Isaac के साथ भारी निवेश कर रहा है।

घोषणा वाले पोस्ट को कुछ ही घंटों में 393,000 से अधिक views मिले, और आगे की thread में पहले FLUX 3 Image samples दिखाए गए। यह generative media segment में window का सबसे उल्लेखनीय model launch है, जितना इसकी महत्वाकांक्षा के कारण — चार modalities के लिए एक ही model — उतना ही robotization की ओर इसके विस्तार के कारण।

🔗 X पर घोषणा


ChatGPT Voice, Chat, Work और Codex को आवाज़ से नियंत्रित करता है

23 जुलाई (21:43) — OpenAI ChatGPT Voice को desktop application (macOS और Windows) में लाने की घोषणा करता है, Plus, Pro, Business, Edu और Enterprise योजनाओं के लिए, और आज से वैश्विक rollout के साथ। GPT-Live द्वारा संचालित, यह सुविधा केवल आवाज़ के ज़रिए computer को नियंत्रित करने और कई agents — ChatGPT Work या Codex — को निर्देशित करने देती है: model बोलता है, सुनता है और application के भीतर काम का समन्वय करता है।

ChatGPT Voice is now in the desktop app. Control your computer and direct multiple agents running in ChatGPT Work or Codex, using just your voice. It’s powered by GPT-Live, so it can speak, listen, and coordinate work in the app at the same time. Rolling out globally today on macOS and Windows to Plus, Pro, Business, Edu, and Enterprise plans.

🇮🇳 ChatGPT Voice अब desktop application में उपलब्ध है। अपने computer को नियंत्रित करें और ChatGPT Work या Codex में चल रहे कई agents को सिर्फ अपनी आवाज़ से निर्देशित करें। यह GPT-Live द्वारा संचालित है, इसलिए यह एक ही समय में बोल सकता है, सुन सकता है और application में काम का समन्वय कर सकता है। आज से macOS और Windows पर Plus, Pro, Business, Edu और Enterprise योजनाओं के लिए वैश्विक rollout।@OpenAI on X

आधिकारिक Codex changelog (version 26.715) एक ऐसा विवरण जोड़ता है जो tweet में नहीं था: macOS पर, एक “Screen context” विकल्प voice conversation के दौरान ChatGPT के साथ foreground window का screenshot साझा करने देता है, ताकि assistant देख सके कि उपयोगकर्ता काम करते हुए क्या देख रहा है। एक follow-up tweet स्पष्ट करता है कि ChatGPT Voice Codex में भी iOS app के माध्यम से paired remote access के साथ उपयोग किया जा सकता है — Android support “आ रहा है” बताया गया है, लेकिन कोई तारीख नहीं दी गई।

🔗 Codex changelog — version 26.715


Claude का voice mode भी बेहतर हुआ

23 जुलाई — Anthropic Claude के voice mode को अपडेट करता है, जो सभी योजनाओं पर उपलब्ध है। अब यह एक समर्पित हल्के model के बजाय अधिक सक्षम models — Opus और Sonnet — पर आधारित है, ताकि मौखिक बातचीत अधिक गहरी हो सके।

Voice mode now runs on Claude’s more capable models and reaches the tools you’ve connected mid-conversation. Talk through the hard problems out loud, in many more languages.

🇮🇳 अब voice mode Claude के सबसे सक्षम models के साथ काम करता है और बातचीत के दौरान आपके जुड़े हुए tools तक पहुँच सकता है। जटिल समस्याओं पर ज़ोर से सोचें, और वह भी कहीं अधिक भाषाओं में।@claudeai on X

Claude अब बातचीत के दौरान account से पहले से जुड़े tools (messaging, calendar) तक भी पहुंच सकता है, बिना उसे बीच में रोके। voice mode को Spanish, French, Hindi और Japanese भी मिलते हैं, जो आज से mobile, computer और web पर public beta में हैं।

🔗 संबंधित ब्लॉग लेख


Codex : ऐसे प्रोजेक्ट जो कई folders में फैले होते हैं

23 जुलाई (22:31) — ChatGPT Voice के साथ ही आने वाले इसी release में (Codex changelog 26.715), Codex desktop ChatGPT ऐप में multi-folder local projects पेश करता है। अब एक local project code, documentation और reference files को कई folders में फैला कर एक साथ रख सकता है; Codex पूरे सेट में पढ़ और लिख सकता है, जबकि एक primary folder Git root बना रहता है।

किसी project के menu से, “Edit project” विकल्प folders जोड़ने और primary folder तय करने देता है। नए chats, Git operations, AGENTS.md की automatic discovery, skills और config.toml file—all primary folder का उपयोग करते हैं; secondary folders file search के लिए पढ़ने और लिखने दोनों में उपलब्ध रहते हैं।

🔗 X पर घोषणा


GitHub उन agents को सीमित करता है जो Issues में बदलाव करते हैं

23 जुलाई — GitHub ने GitHub Issues पर agent automations को सीमित करने के लिए public preview में controls का एक सेट लॉन्च किया है। शुरुआती निष्कर्ष यह है: agents (GitHub Agentic Workflows, Copilot cloud agent) labels लगाते हैं, types बदलते हैं, assign करते हैं और issues को increasingly automatically बंद करते हैं, बिना इसके कि teams हमेशा जान सकें क्यों या उन पर आसानी से नियंत्रण रख सकें।

जोड़ी गई क्षमतायह क्या करती है
अनुमोदनautomation लागू करने के बजाय सुझाव देता है; परिवर्तन एक-एक कर या समूह में validation की प्रतीक्षा करते हैं
विश्वास स्कोरहर action को उच्च / मध्यम / निम्न confidence मिलता है; केवल उच्च वाला स्वतः लागू होता है
औचित्यहर action अपना कारण दर्ज करता है, लागू होने पर या लंबित रहने पर — एक consultable audit trail

has:suggestions search उन issues को ढूँढ़ती है जिनमें review के लिए लंबित बदलाव हैं; administrators उस confidence threshold को कॉन्फ़िगर करते हैं जो तय करता है कि क्या स्वतः लागू होगा। ये controls GitHub Agentic Workflows के साथ काम करते हैं (issue-intents: true को workflow frontmatter में जोड़कर) और Copilot cloud agent के साथ भी (कोई अपडेट आवश्यक नहीं)। launch के समय, जिन actions को कवर किया गया है, वे हैं: labels, custom fields, type, closing और assignment, REST और GraphQL APIs के माध्यम से।

GitHub स्वयं जिस सावधानी को सामने रखता है: approvals को “a workflow convenience, not a security control” के रूप में प्रस्तुत किया गया है — वे server-side barrier लागू नहीं करते, और आवश्यक permissions वाला agent अभी भी किसी बदलाव को सुझाव देने के बजाय सीधे लागू कर सकता है। उपयोग के मामले जिन पर जोर दिया गया है: automatic triage, metadata enrichment, spam detection with justification।

🔗 GitHub changelog


GitHub Mobile Copilot के साथ आपके CI failures ठीक करता है

23 जुलाई — GitHub mobile app (iOS और Android) में Fix with Copilot सुविधा का विस्तार करता है, जो पहले से pull request comments पर उपलब्ध थी। अब, जब किसी pull request पर GitHub Actions check विफल होता है, तो GitHub Mobile से सीधे उस failed check पर Fix with Copilot बटन दिखाई देता है।

एक ही कदम में, Copilot coding agent failure का विश्लेषण करता है, मौजूदा pull request के ऊपर एक नए सुझाए गए fix के साथ नया pull request खोलता है, और फिर review के लिए उपयोगकर्ता को सूचित करता है। इसका घोषित उद्देश्य CI failures पर चलते-फिरते प्रतिक्रिया देना है, बिना workstation पर लौटे, ताकि pull requests चलते रहें—even keyboard से दूर होने पर भी।

🔗 GitHub changelog


Runway generative model के चयन को स्वचालित करता है

23 जुलाई — Runway Media Router लॉन्च करता है, जिसे “preferences के अनुसार अनुकूलित” पहला media generation router बताया गया है। हर request के लिए manually model चुनने के बजाय, उपयोगकर्ता एक बार तय करता है कि “best” का मतलब क्या है — cost, quality या latency — और router उपयुक्त video, image या audio model को स्वतः चुन लेता है।

यह सुविधा अभी Runway Dev में उपलब्ध है, जो साथ ही लॉन्च किया गया developer platform है। यह एक नए model की बजाय infrastructure component है: यह उन product teams के लिए है जो कई third-party generative models को orchestrate करती हैं और cost/quality/latency के निर्णय को स्वचालित करना चाहती हैं — एक ऐसा approach जो LLM routers (OpenRouter आदि) के करीब है, लेकिन generative media पर लागू किया गया है।

🔗 X पर घोषणा


HeyGen HyperFrames को एक video creation agent में बदलता है

23 जुलाई — HeyGen HyperFrames को — जो अब तक अपनी दैनिक creative series के माध्यम से आम जनता में अधिक जाना जाता था — एक साधारण HTML rendering engine से एक केंद्रीय उत्पाद: Video Agent में बदल देता है, जो सीधे HeyGen में एकीकृत है। सिद्धांत यह है: उपयोगकर्ता जो चाहता है उसे वर्णित करता है, और agent पूरी video को शुरू से अंत तक बनाता है — avatar, graphics, subtitles और music, यह सब “अनंत रूप से अनुकूलन योग्य” के रूप में प्रस्तुत किया गया है।

इस launch के साथ एक viral growth operation भी जुड़ा है (post के साथ interaction करने पर HeyGen का एक महीना मुफ्त), जिसने कुछ ही घंटों में 1.1 मिलियन से अधिक views, 810 replies और 788 reposts उत्पन्न किए — generative media segment में scan window के पूरे दौरान यह अब तक का सबसे अधिक देखा गया post था।

Developers के लिए एक उल्लेखनीय बात: consumer product के समानांतर, HeyGen HyperFrames को GitHub पर open-source भी कर रहा है (repo heygen-com/hyperframes, जिसे “HTML लिखें। Video बनाएं। Agents के लिए बनाया गया।” के रूप में वर्णित किया गया है), जिससे तीसरे पक्ष के agents HeyGen app के बाहर भी HTML से video बना सकते हैं। यही thread एक नए large-scale video translation API की भी घोषणा करता है (देखें संक्षिप्त समाचार)। यानी HeyGen के लिए एक ही दिन में product और developer platform दोनों दिशा में दोहरी चाल है।

🔗 मुख्य घोषणा


Cognition Poke का अधिग्रहण करता है, जो आपके संदेशों में रहता है

23 जुलाई — Cognition (Devin) The Interaction Company of California के अधिग्रहण की घोषणा करता है, जो Poke का प्रकाशक है — एक व्यक्तिगत conversational agent जो सीधे उपयोगकर्ता के संदेशों में रहता है। Scott Wu, Cognition के CEO और सह-संस्थापक, द्वारा हस्ताक्षरित पोस्ट के अनुसार, वह स्वयं और Walden (Cognition के सह-संस्थापक) Interaction के शुरुआती angel investors थे, और दोनों teams पहले से ही उसी तकनीकी दांव को साझा कर रही थीं: “हमेशा सक्रिय” cloud agents।

Poke is a personal agent that lives in your texts. It messages you first, follows up with you, and feels less like software and more like a friend. People have exchanged more than 100 million messages with it in just the last three months, and it’s the only AI agent approved to text natively on Apple Messages.

🇮🇳 Poke एक व्यक्तिगत agent है जो आपके संदेशों में रहता है। वह सबसे पहले आपको लिखता है, बातचीत को फिर से आगे बढ़ाता है, और software से कम, एक दोस्त जैसा लगता है। केवल पिछले तीन महीनों में उसके साथ 100 मिलियन से अधिक संदेशों का आदान-प्रदान हुआ है, और वह Apple Messages पर native रूप से संदेश भेजने की अनुमति प्राप्त एकमात्र AI agent है।Scott Wu on the Cognition blog

उपयोगकर्ताओं के लिए, फिलहाल कुछ नहीं बदलता — Poke पहले की तरह काम करता रहता है — लेकिन Cognition इसे “तेज़ और अधिक विश्वसनीय” बनाने के लिए अपने models और infrastructure लाने की घोषणा करता है। यह कदम Cognition को उसके ऐतिहासिक core business (स्वायत्त software engineer Devin) से आगे बढ़ाकर consumer personal agents की ओर ले जाता है, जो कंपनी के लिए एक नई रणनीतिक दिशा है।

🔗 X पर घोषणा


Cognition ऊर्जा विभाग की Genesis Mission में शामिल हुई

22 जुलाई — Cognition ने अमेरिकी ऊर्जा विभाग (DOE) के साथ एक समझौता ज्ञापन (MOU) पर हस्ताक्षर किए हैं, ताकि वह Genesis Mission में शामिल हो सके। यह एक राष्ट्रीय पहल है, जिसे नवंबर 2025 में राष्ट्रपतिीय आदेश द्वारा शुरू किया गया था और जिसे “IA के लिए अमेरिका की मैनहैटन परियोजना” के रूप में प्रस्तुत किया गया है। यह पहल अमेरिका की 17 राष्ट्रीय प्रयोगशालाओं, उद्योग और अकादमिक जगत को जोड़ती है, ताकि देश के सबसे शक्तिशाली सुपरकंप्यूटरों को सबसे बड़े संघीय वैज्ञानिक डेटा-सेटों से जोड़ा जा सके; घोषित लक्ष्य एक दशक में अमेरिकी वैज्ञानिक अनुसंधान की उत्पादकता को दोगुना करना है। इस तरह Cognition अब Google DeepMind, OpenAI और Arcee AI के साथ जुड़ती है, जिनकी इसी मिशन में भागीदारी की कवरेज पहले ही कल, 22 जुलाई को की जा चुकी थी।

प्रतिबद्धता का क्षेत्रDevin (Cognition) का योगदान
सॉफ़्टवेयर और डेटा सुरक्षावैज्ञानिक कोडबेस में कमजोरियों को ढूँढना और ठीक करना
legacy कोड का आधुनिकीकरणपुरानी कोड का दस्तावेज़ीकरण, परीक्षण और अनुवाद (Fortran, C++, COBOL)
अनुसंधान क्षमता का विस्तारडेटा पाइपलाइनों, इंफ्रास्ट्रक्चर और डिप्लॉयमेंट को सौंपना
क्लाउड आधुनिकीकरणlegacy अनुप्रयोगों को cloud-native प्लेटफ़ॉर्मों पर स्थानांतरित करना

पोस्ट में बताया गया है कि Cognition प्लेटफ़ॉर्म वर्तमान में FedRAMP Class D (High) प्रमाणन की प्रक्रिया में है, कि Devin Desktop और Devin CLI पहले ही इस स्तर पर प्रमाणित हैं और ITAR/IL4-IL6 के अनुरूप हैं, तथा कि Devin का उपयोग पहले से ही US Army, US Navy और NASA के Jet Propulsion Laboratory द्वारा किया जा रहा है। अपनी भागीदारी के हिस्से के रूप में, Cognition राष्ट्रीय प्रयोगशालाओं के लिए कोड सुरक्षा स्कैन और remediation रिपोर्ट in-kind के रूप में देने की पेशकश कर रही है, साथ ही Genesis Mission के परियोजना-आह्वानों के माध्यम से चयनित टीमों के लिए अतिरिक्त compute भी।

🔗 Cognition ब्लॉग पर घोषणा


कोड टूल्स तेज़ी से आगे बढ़ रहे हैं

इस सप्ताह AI-सहायित विकास टूल्स में पाँच उल्लेखनीय अपडेट आए हैं, जिनमें मूल्य निर्धारण, सुविधाएँ और इवेंट-चालित ऑटोमेशन शामिल हैं।

Cursor अपनी उपयोग सीमाएँ दोगुनी करता है

21 जुलाई — Cursor ने सभी व्यक्तिगत और Teams योजनाओं में शामिल उपयोग सीमाएँ दोगुनी कर दी हैं (Enterprise को छोड़कर, जिसका उल्लेख नहीं है)। यह बदलाव Grok (xAI) और Composer (Cursor का proprietary मॉडल) पर लागू होता है, साथ ही किसी भी भविष्य के Cursor मॉडल पर भी, और घोषित मूल्य निर्धारण में “दोगुना” गुणक के अलावा कोई बदलाव नहीं है। इस पोस्ट ने भारी engagement पैदा किया — कुछ ही घंटों में लगभग 1,000 repost और 10,000 likes — जो समुदाय से बहुत सकारात्मक स्वागत का संकेत है। यह घोषणा Cursor Router से अलग है, जिसे एक दिन पहले जारी किया गया था।

🔗 X पर घोषणा

Replit ने होस्टिंग की कीमतें आधे से भी अधिक घटाईं

23 जुलाई — Replit ने बड़े पैमाने पर प्रकाशित ऐप्स की होस्टिंग पर एक महत्वपूर्ण मूल्य कटौती की घोषणा की है — 50% से भी अधिक — जो 1 अगस्त 2026 से प्रभावी होगी। हर प्रकाशित ऐप Replit Cloud पर चलता है, जिसमें उपयोग के अनुसार automatic scaling, सुरक्षित authentication और database, तथा analytics और SEO शामिल हैं। नई कीमतें सभी उपयोगकर्ताओं पर उनके अगले मासिक बिलिंग चक्र से स्वतः लागू हो जाएँगी, और उनकी ओर से किसी कार्रवाई की आवश्यकता नहीं होगी।

🔗 X पर घोषणा

Zed 1.12 : Git Panel और multi-selection

22 जुलाई — Zed ने स्थिर संस्करण 1.12 जारी किया है: अब Git पैनल में अलग-अलग “Staged” और “Unstaged” अनुभाग हैं, और किसी भी समूह की एंट्री पर क्लिक करने से संबंधित multibuffer खुलता है। File Finder और Text Finder भी multi-selection (cmd-क्लिक macOS पर, ctrl-क्लिक Linux/Windows पर, या tab) का समर्थन करते हैं, ताकि एक साथ कई फ़ाइलें खोली जा सकें। प्रारंभ में थ्रेड में उल्लेखित CSV filtering को बाद में Zed की एक correction द्वारा हटा दिया गया, जिसने स्पष्ट किया कि यह सुविधा वास्तव में अभी सार्वजनिक नहीं हुई थी।

🔗 X पर घोषणा

v0 : slash commands, सभी के लिए Shopify, Snowflake विश्वसनीयता

21 जुलाई — v0 (Vercel) अब slash commands जोड़ता है: composer में / टाइप करने से एक menu खुलता है, जिससे keyboard छोड़े बिना skills.sh के माध्यम से कोई skill (skill) संलग्न की जा सकती है। Shopify integration, जो उत्पाद, कीमतें और stock को live पढ़ने वाली एक e-commerce vitrine बनाता है, अब सभी उपयोगकर्ताओं के लिए खुला है। Snowflake पर एक reliability pass अंतिम deployment के बाद से code परिवर्तनों का पता लगाती है और generated output को नकली डेटा के बजाय जुड़े हुए खाते की ओर निर्देशित करती है।

🔗 v0 Changelog

Amp : बाहरी घटनाओं पर orbs प्रतिक्रिया देते हैं

23 जुलाई — Amp के “orbs” (दूरस्थ agents के लिए cloud sandboxes) अब एक नए webhooks API (amp.createWebhook) के माध्यम से बाहरी घटनाओं पर जाग सकते हैं: GitHub पर CI failure, नया Linear issue, monitoring alert, Discord message। Amp provider signature की जाँच करता है और deliveries को deduplicate करता है; बाहरी घटना अविश्वसनीय डेटा बनी रहती है, जिसे कभी भी agent के लिए सीधे निर्देश के रूप में नहीं समझा जाता। उद्धृत उपयोग उदाहरण: मुख्य branch पर हर CI failure की जाँच करना और परिणाम Slack पर पोस्ट करना, या निर्भरताओं के नए संस्करणों पर नज़र रखना ताकि स्वचालित रूप से एक update pull request खोली जा सके।

🔗 Amp घोषणा


साइबर रक्षा: Gemini और Hugging Face रक्षकों को हथियार दे रहे हैं

इस विंडो की दो अलग-अलग घोषणाएँ एक ही आवश्यकता की ओर इशारा करती हैं: सॉफ़्टवेयर कमजोरियों के सामने रक्षा को बेहतर उपकरणों से लैस करना।

Gemini 3.5 Flash Cyber 72% कमजोरियाँ पकड़ता है

23 जुलाई — 21 जुलाई की संयुक्त घोषणा (Gemini 3.6 Flash, 3.5 Flash-Lite, 3.5 Flash Cyber) के बाद, Google DeepMind ने Gemini 3.5 Flash Cyber पर एक समर्पित thread प्रकाशित किया है, जिसमें कमजोरियों की पहचान और सुधार के लिए विशेष एक हल्के मॉडल का संख्यात्मक benchmark दिया गया है।

परीक्षण किया गया मॉडलपहचान दर
Gemini 3.5 Flash Cyber72 %
Gemini 3.5 Flash (standard)55 %
Claude Opus 4.6 (Anthropic)54 %

यह परीक्षण — “Chrome Production Commit Scanning Pipeline” नाम से — Chrome और Android के वास्तविक codebases पर किया गया, जहाँ मॉडल ने उन जटिल कमजोरियों का पता लगाया जिन्हें standard मॉडलों ने चूक दिया था। उपलब्धता अभी भी एक सीमित-प्रवेश pilot है, जो सरकारों और trusted partners तक सीमित है, और Google इसे “responsible deployment” के दृष्टिकोण के रूप में प्रस्तुत करता है।

🔗 @GoogleDeepMind थ्रेड

The Stack v3, साइबर रक्षा का open source ईंधन

23 जुलाई — Hugging Face में Head of Research, Leandro von Werra, The Stack v3 की घोषणा करते हैं, जो संगठन के code dataset की नई पीढ़ी है (HuggingFaceCode — जिसके मूल में StarCoder मॉडल हैं): 5,000 अरब tokens प्रशिक्षण के लिए तैयार, 120 TB raw data, 700 से अधिक programming भाषाएँ, ODC-BY लाइसेंस के तहत। संचार का angle स्पष्ट रूप से defensive है — von Werra इस प्रकाशन को “cyber defense के लिए अच्छे open code models” की तत्काल आवश्यकता से उचित ठहराते हैं, जो कल Sakana AI में Fugu-Cyber की रिलीज़ की प्रतिध्वनि है।

🔗 X पर घोषणा


Together AI और NVIDIA inference तथा fine-tuning को सशक्त बना रहे हैं

Together AI ने अपने inference प्लेटफ़ॉर्म की नई पीढ़ी लॉन्च की

23 जुलाई — Together AI ने Together Dedicated Model Inference की घोषणा की है, जो open-weight मॉडलों के लिए अपने inference प्लेटफ़ॉर्म का एक पुनर्निर्माण है। इसमें शामिल हैं: एक स्थिर endpoint के पीछे multiple deployments, सुरक्षित rollouts (canary, blue-green, automatic rollback के साथ rolling), A/B testing और वास्तविक traffic पर “shadow traffic”, तथा एक नई cache layer की बदौलत लगभग 4 गुना तेज़ startups (Kimi K2.7, MiniMax M3 या GLM 5.2 जैसे frontier MoE मॉडल 7 से 14 मिनट में deploy किए जाते हैं), और custom fine-tuning (RL full-weight, LoRA, SFT) का बंद beta, जिसमें checkpoints को production में सीधे deploy किया जा सकता है। एक presentation webinar 6 अगस्त के लिए घोषित किया गया है।

🔗 X पर घोषणा

NVIDIA : 5 डॉलर से कम में RL fine-tuning

23 जुलाई — NVIDIA ने Nemotron 3 Nano पर hosted reinforcement learning fine-tuning के एक demonstration को सामने रखा है, जिसे Prime Intellect Lab के साथ किया गया: गणित की एक task पर सटीकता 22% से बढ़कर 91% हो गई, लागत $5 से कम रही। पूरा flow — baseline, reward convergence तक training, validation re-test — एक downloadable LoRA adapter के साथ समाप्त होता है, जिसे configuration की केवल एक पंक्ति बदलकर Nemotron 3 Super और Ultra पर लागू किया जा सकता है।

🔗 X पर घोषणा


Gemini Notebook Collections के साथ आपके notebooks को व्यवस्थित करता है

20 जुलाई — Gemini Notebook (पूर्व NotebookLM) Collections लॉन्च करता है, जो अपने notebooks को पारंपरिक folder tree के बजाय photo albums या playlists की तरह व्यवस्थित करने के लिए एक नया टैब है: कोई कठोर संरचना नहीं, और एक ही notebook जितनी चाहें उतनी collections में, या किसी में भी, शामिल हो सकता है।

यह एक जारी की गई सुविधा है — उत्पाद में दिखाई देने वाला नया टैब — कोई साधारण teaser नहीं। इस सख्त scan window से एक दिन पहले की तारीख वाला यह tweet, फिर भी, अब तक अनुत्तरित रही उपयोगकर्ताओं की एक बार-बार उठने वाली माँग का उत्तर था।

🔗 @Gemini_Notebook pinned tweet


xAI और Qwen अपनी पेशकशों का विस्तार कर रहे हैं

Grok 4.5 सभी consumer surfaces पर उपलब्ध

22 जुलाई — xAI घोषणा करता है कि Grok 4.5 अब उसकी सभी consumer surfaces पर Grok को शक्ति दे रहा है: grok.com, X, और iOS तथा Android ऐप्स। यह मॉडल Word, Excel, PowerPoint और Outlook में xAI के Microsoft 365 add-ins के माध्यम से भी उपलब्ध है। यह कोई नया मॉडल नहीं है: इसका flagship launch 8 जुलाई को ही कवर किया जा चुका है, और 16 जुलाई को यूरोप में इसकी पूर्ण उपलब्धता भी; यह घोषणा rollout की अंतिम कड़ी है, यानी mobile और consumer site पर वास्तविक स्विचओवर।

🔗 आधिकारिक घोषणा

Grok Microsoft Outlook में आ गया

21 जुलाई — xAI ने Grok for Outlook के साथ Grok को Microsoft 365 में विस्तारित किया है: एक agent जो लंबे discussion threads का सारांश बनाता है, उपयोगकर्ता की शैली में उत्तर लिखता है, समाप्त हो चुकी conversations को archive करता है, और यह संकेत देता है कि किसे उत्तर की प्रतीक्षा है — स्पष्ट validation के बिना कुछ भी नहीं भेजा जाता। आज से X और SuperGrok के paid subscribers के लिए Microsoft Marketplace के माध्यम से उपलब्ध, यह module Word, Excel और PowerPoint के लिए पहले से उपलब्ध modules के साथ जुड़ता है।

🔗 आधिकारिक घोषणा

Qwen Cloud ने Token Plan Individual लॉन्च किया

21 जुलाई — Qwen Cloud ने Token Plan Individual लॉन्च किया है, $6 प्रति माह से शुरू होने वाली subscription पेशकश, जो Qwen family के साथ-साथ GLM और DeepSeek के लिए एक unified credit pool तक पहुँच देती है, तथा Qwen3.8-Max-Preview (एक मॉडल जो पहले ही 19 जुलाई को कवर किया गया था) तक early access प्रदान करती है। प्रचार इन्फ़ोग्राफ़िक तीन pricing tiers (Lite / Standard / Pro), off-peak घंटों में छूट और 8 simultaneous agents तक आपूर्ति करने योग्य एक pool का विवरण देता है।

🔗 X पर घोषणा


Anthropic ने AI के आर्थिक भविष्य में 200 मिलियन डॉलर निवेश किए

22 जुलाई — Anthropic अपने Economic Futures Research Fund के research agenda का अनावरण करता है, जो 200 मिलियन डॉलर से वित्तपोषित है, ताकि AI के आर्थिक प्रभावों के लिए समाज को तैयार करने वाले interventions पर महत्वाकांक्षी बाहरी शोध को समर्थन दिया जा सके। पाँच प्राथमिक क्षेत्र: कामगारों पर प्रभाव, पेशेवर संक्रमणों का साथ, आय समर्थन प्रणालियों का आधुनिकीकरण, AI से जुड़ी वृद्धि के साझा करने के तंत्र (pre-distributive capital accounts), और सार्वजनिक निवेश पर नए डेटा।

Anthropic का इरादा मुख्यतः 5 से 30 मिलियन डॉलर के बीच की परियोजनाओं को वित्तपोषित करने का है, जो विश्वविद्यालयों, स्वतंत्र शोध संस्थानों और गैर-लाभकारी संगठनों के लिए खुले हैं — व्यक्तिगत शोधकर्ताओं के लिए नहीं। यह fund एक साल पहले शुरू किए गए “Economic Futures” कार्यक्रम को विकसित करता है, जो कई छोटी grants की बजाय कम संख्या में महत्वाकांक्षी grants पर केंद्रित है।

🔗 आधिकारिक घोषणा


संक्षिप्त समाचार

  • Anthropic ने Public First Action को अपना समर्थन दोगुना किया (+20 मिलियन डॉलर) — AI मुद्दों पर जन-शिक्षा के इस गैर-दलीय संगठन के लिए कुल समर्थन 40 मिलियन डॉलर तक पहुँच गया; ये दान केवल शिक्षा और सार्वजनिक नीति मिशन को वित्तपोषित करते हैं, किसी चुनावी समर्थन के बिना। 🔗 स्रोत
  • Claude Code : skills के साथ बनाए गए verification loops पर मार्गदर्शिका — कैसे manual checks को Claude Code skills में बदला जाए ताकि Claude स्वयं अपनी verification को loop कर सके। 🔗 स्रोत
  • Outtake case study : Claude पर निर्मित cyber investigation agent — Outtake कई घंटे चलने वाले sessions कैसे संचालित करता है ताकि attack networks का मानचित्र बनाया जा सके। 🔗 स्रोत
  • Cognition — DeepWiki 500,000 indexed repositories से आगे निकल गया — AI-जनित code documentation टूल, निःशुल्क; LangChain के साथ meetup 28 जुलाई को San Francisco में घोषित। 🔗 स्रोत
  • Replit ने Firecrawl integration को प्रमुखता दी — apps के लिए एक क्लिक में web context, शुरुआती उपयोगकर्ताओं को 10,000 credits के साथ। 🔗 स्रोत
  • Hugging Face ने Diffusers में Nunchaku (SVDQuant) को मूल रूप से जोड़ा — 4-bit quantized checkpoints (weights और activations) अब from_pretrained() के माध्यम से लोड होते हैं, बिना अलग inference library के। 🔗 स्रोत
  • Together AI 27 जुलाई के लॉन्च के साथ ही Kimi K3 (Moonshot AI) को host करेगा — inference “day zero” पर उपलब्ध, benchmarks प्रभावी लॉन्च के बाद साझा किए जाएँगे। 🔗 स्रोत
  • Gemini CLI v0.52.0 — triage और egress services, write_file/replace में JSON/IPYNB के लिए LLM correction bypass, google-auth-library को version 10.9.0 में अपडेट किया गया। 🔗 स्रोत
  • GitHub — Projects और Issues के लिए multi-select fields — एक custom field अब एक समय में कई मान रख सकता है (टीमें, modules, categories)। 🔗 स्रोत
  • HeyGen — बड़े पैमाने पर video translation API — एक पूरे video chain को 24 घंटे से कम में 10 localized versions में दोहराना, batch processing के साथ। 🔗 स्रोत
  • Codex Sites Analytics public test में — Codex से प्रकाशित sites के लिए बुनियादी performance metrics। 🔗 स्रोत
  • OpenAI ने “छोटे व्यवसायों के लिए ChatGPT” कार्यक्रम शुरू किया — ChatGPT Work webinars, US में AI academies, Dropbox, Shopify, Intuit, Slack, Atlassian और Wix के साथ partnerships। 🔗 स्रोत
  • David Vélez (Nubank) और Robin Vince (BNY) OpenAI के boards में शामिल हुए — OpenAI Foundation और OpenAI Group PBC ने दोनों executives का स्वागत किया। 🔗 स्रोत
  • Cohere ने Arabic AI के लिए HUMAIN के साथ partnership की घोषणा की — Cohere Transcribe Arabic की सफलता के बाद, फिलहाल कोई उत्पाद या तिथि निर्दिष्ट नहीं। 🔗 स्रोत

इसका क्या मतलब है

वॉइस एक पूर्ण-स्वतंत्र संचालन इंटरफ़ेस के रूप में स्थापित हो रही है, और यह उसी दिन दो अलग-अलग खिलाड़ियों के यहाँ हो रहा है। ChatGPT Voice डेस्कटॉप पर आ रहा है ताकि Chat, Work और Codex को बिना कीबोर्ड के संचालित किया जा सके, GPT-Live द्वारा संचालित; दूसरी ओर, Claude अपना वॉइस मोड अपने सबसे शक्तिशाली मॉडलों पर चलाता है और बातचीत के दौरान उसे जुड़े हुए टूल्स तक पहुँच देता है। दोनों घोषणाएँ स्वतंत्र हैं, लेकिन तारीख का यह मेल संभवतः संयोग नहीं है: यह एक ही दाँव को दर्शाता है — मौखिक बातचीत एक पूर्ण-स्वतंत्र कार्य-चैनल बनती जा रही है, जो एजेंटों या जुड़े हुए टूल्स के माध्यम से वास्तविक कार्रवाइयाँ शुरू कर सकती है, न कि केवल प्रश्नों के जवाब देने वाले सहायक का एक साधारण गैजेट।

एजेंटों को नियंत्रित करना अब अपने आप में एक विषय बनता जा रहा है, उन्हें केवल चलाने से अलग। GitHub Approvals, एक trust score और उन परिवर्तनों के लिए justification ला रहा है जिन्हें उसके एजेंट Issues में अपने-आप लागू करते हैं — और साथ ही वह खुद स्पष्ट करता है कि यह “security control नहीं है”, बस workflow की सुविधा है। दूसरी ओर, Runway प्रतिस्पर्धी generative मॉडलों के बीच एक स्वचालित arbitration layer जोड़ता है (cost, quality, latency)। साझा बिंदु यह है कि जैसे-जैसे एजेंट अधिक स्वायत्त होते जाते हैं, प्रकाशक क्षमताएँ सिर्फ जोड़ते जाने के बजाय governance और संचालन की परतें भी जोड़ते हैं — यही रुझान Codex के multi-folder projects में भी दिखाई देता है, जिन्हें इस तरह बनाया गया है कि एजेंट बड़े दायरे पर काम कर सकें, बिना truth की root notion खोए, यानी primary Git folder।

Cyberdefense बड़े AI खिलाड़ियों के बीच प्रतिस्पर्धा का एक स्पष्ट मोर्चा बनकर उभर रहा है। Gemini 3.5 Flash Cyber Chrome और Android के real codebases पर 72% vulnerability detection का दावा करता है, जबकि उसका अपना standard model 55% पर है और Google द्वारा नाम लेकर उद्धृत Claude Opus 4.6 54% पर है — यह तुलना इतनी प्रत्यक्ष है कि ध्यान देने योग्य है। उसी दिन, Hugging Face The Stack v3 प्रकाशित करता है, जो 5,000 अरब tokens का code dataset है, और प्रकाशन को स्पष्ट रूप से “cyberdefense के लिए अच्छे open code models” की ज़रूरत के आधार पर उचित ठहराता है। ये दोनों स्वतंत्र घोषणाएँ बड़े पैमाने पर software vulnerabilities के exploitation को लेकर साझा चिंता और एक सममित प्रतिक्रिया को दर्शाती हैं: एक तरफ विशेषीकृत closed models, और दूसरी तरफ उन्हें प्रशिक्षित करने के लिए open data।

Cognition एक ही सप्ताह में दोनों दिशाओं में अपना खेल का मैदान बढ़ाता है। Poke का अधिग्रहण, एक personal agent जो उपयोगकर्ता के messages में रहता है और तीन महीनों में 100 मिलियन से अधिक messages का आदान-प्रदान कर चुका है, कंपनी के गुरुत्वाकर्षण केंद्र को उसके autonomous software engineer Devin से आगे बढ़ाकर public-facing agents की ओर ले जाता है। उसी समय, अमेरिकी Department of Energy के साथ Genesis Mission के लिए उसका memorandum of understanding उसे Google DeepMind, OpenAI और Arcee AI के साथ खड़ा करता है — जो पहले से ही 22 जुलाई से इस पहल में शामिल हैं — एक ऐसी दौड़ में जो अब चार-घोड़ों की बन गई है, ताकि अमेरिकी सार्वजनिक वैज्ञानिक अनुसंधान में अपनी जगह बनाई जा सके। दो चालें, एक ही तर्क: एक ओर आम उपयोगकर्ताओं पर और दूसरी ओर संस्थागत infrastructure पर एक साथ अपनी स्थिति मज़बूत करना, बजाय इसके कि किसी एक ही segment तक सीमित रहा जाए।


स्रोत