खोजें

Qwen-Image-2.1 खुले वज़नों में जनरेशन और एडिटिंग को एकीकृत करता है, Antigravity सैंडबॉक्स Windows पर आया, एक ही परीक्षण सेट पर तेरह सत्यापनकर्ता

कृत्रिम बुद्धिमत्ता द्वारा जनित लेख
Qwen-Image-2.1 खुले वज़नों में जनरेशन और एडिटिंग को एकीकृत करता है, Antigravity सैंडबॉक्स Windows पर आया, एक ही परीक्षण सेट पर तेरह सत्यापनकर्ता

ai-powered-markdown-translator

लेख का fr से hi में अनुवाद gpt-5.6-sol के साथ किया गया।

GitHub पर प्रोजेक्ट देखें ↗

शनिवार और रविवार को प्रयोगशालाएँ शांत रहीं: न DeepSeek, न Meta, न Ai2, न Sakana, न Mistral और न ही xAI ने कुछ प्रकाशित किया, और खुले मॉडल के क्षेत्र के आधिकारिक खाते पूरे दो दिन खाली रहे। केवल एक वास्तविक रिलीज़ हुई: Qwen-Image-2.1, जिसे रविवार दोपहर बाद खुले वज़नों में प्रकाशित किया गया। बाकी अधिकांश सामग्री Hugging Face के सामुदायिक ब्लॉग की पाँच पोस्ट, Antigravity का ऐसा संस्करण जो कुछ भी ठीक नहीं करता, और 18 सितंबर की दो GitHub चेंजलॉग प्रविष्टियों तक सीमित है—एक शांत दिन, जिसे बढ़ा-चढ़ाकर पेश करने का कोई कारण नहीं है।


Qwen-Image-2.1, जनरेशन, एडिटिंग और पारदर्शिता प्रदान करने के लिए एक ही मॉडल

20 सितंबर — Qwen ने अपना इमेज जनरेशन और एडिटिंग मॉडल Qwen-Image-2.1 खुले वज़नों में Hugging Face, ModelScope और GitHub पर प्रकाशित किया। मुख्य तर्क इसका आकार नहीं, बल्कि एकीकरण है: वज़नों की एक ही शृंखला टेक्स्ट निर्देश से इमेज बनाने और मौजूदा इमेज को संपादित करने, दोनों कामों को संभालती है, जबकि पहले इन दोनों उपयोगों के लिए दो मॉडल चाहिए थे।

सबसे ठोस नई सुविधा मूल पारदर्शिता है: मॉडल सीधे RGBA लेयर बनाता और संशोधित करता है, और आउटपुट में पारदर्शिता चैनल होगा या नहीं, यह निर्देश तय करता है। Qwen दिसंबर 2025 से एक समर्पित मॉडल Qwen-Image-Layered के माध्यम से यह क्षमता प्रदान कर रहा था, जिसे अब इसमें समाहित कर लिया गया है। इससे कटआउट का एक चरण समाप्त हो जाता है: किसी तस्वीर से विषय को पुनः उपयोग योग्य लेयर के रूप में निकालना या किसी पारदर्शी लेयर में टेक्स्ट बदलना।

एडिटिंग के लिए मॉडल एक ही संरचना में अधिकतम 10 संदर्भ इमेज स्वीकार करता है, और संपादित किए जाने वाले क्षेत्र को रंगीन वृत्त, रंगी हुई टिप्पणी या अलग से दिए गए मास्क के माध्यम से चिह्नित किया जा सकता है—यह तीसरा तरीका इसलिए मौजूद है क्योंकि पहले दोनों मूल सामग्री को ढक देते हैं। इसकी दक्षता मिश्रित ग्रैन्युलैरिटी वाले अटेंशन पर आधारित है, जहाँ एडिटिंग इनपुट एक स्थिर संदर्भ बनाते हैं जिसे पहले ही चरण से कैश कर लिया जाता है।

तकनीकी तत्वघोषित मान
विज़ुअल जनरेशन पैरामीटर7 अरब, 32 Single-Stream DiT लेयर पर
स्वीकृत संदर्भ इमेजअधिकतम 10
आउटपुट की पारदर्शिताजनरेशन और एडिटिंग, दोनों में मूल RGBA लेयर
समाहित समर्पित मॉडलQwen-Image-Layered, दिसंबर 2025 में प्रकाशित
पहले दिन से समर्थनvLLM-Omni और ComfyUI

Qwen ने Qwen-Image-Bench पर एक तुलना प्रकाशित की है, लेकिन उसके मान पोस्ट की केवल एक इमेज में हैं: उन्हें यहाँ दोहराया नहीं गया है।

Generate, edit, and create transparent images with one model: a 7.1B DiT paired with Qwen3-VL-8B.

🇮🇳 एक ही मॉडल से पारदर्शी इमेज जनरेट, एडिट और निर्मित करना: Qwen3-VL-8B के साथ संयोजित 7.1 अरब पैरामीटर वाला DiT।X पर @vllm_project

🔗 घोषणा


Qwen Code v0.24.2, Web Shell में संपूर्ण वॉइस और विस्तृत होता bwrap सैंडबॉक्स

वही प्रकाशक, वही दिन, पर असंबंधित उत्पाद। 20 सितंबर — v0.24.1 के चौबीस घंटे से कुछ अधिक समय बाद प्रकाशित Qwen के कमांड-लाइन कोड एजेंट का v0.24.2 अपनी शृंखला का पहला संस्करण है जिसमें कोई भी ब्रेकिंग बदलाव नहीं है, जबकि पिछले दोनों संस्करणों में एक-एक ऐसा बदलाव था।

bubblewrap सैंडबॉक्स को संपूर्ण निष्पादन आधार मिला है: संरचित प्रोसेस लॉन्च, निगरानी और सीमित workers। इसी संदर्भ में, जिस workspace की विश्वसनीयता अभी तय नहीं हुई है, उसके लिए अब स्पष्ट निर्णय लेना आवश्यक है। Web Shell में Live Voice अब वास्तव में उपयोग योग्य है: मॉडल और वॉइस को कॉन्फ़िगरेशन कार्ड से चुना जा सकता है, और कॉल के दौरान माइक्रोफ़ोन का स्तर दिखाई देता है। समानांतर में कई सत्र चलाने वालों के लिए अब प्रत्येक आने वाले संदेश का मूल्यांकन उसी सत्र के संदर्भ में किया जाता है जिसके लिए वह भेजा गया है, और स्थगित टूल के लिए prompt cache सुरक्षित रहता है।

🔗 रिलीज़ नोट्स


एक भी token लिखे बिना उत्तर सत्यापित करना, और ऐसी रैंकिंग जिसमें लेखक स्वयं निर्णायक और पक्षकार है

20 सितंबर — एक ही दिन, 2 018 आइटम वाले एक ही सेट पर दो पोस्ट प्रकाशित हुईं। पहली Zero-Token Confidence प्रस्तुत करती है: एक probe मॉडल की अंतिम hidden state को एक forward pass में पढ़ता है और बिना कोई token जनरेट किए उससे calibrated probability निकालता है। मॉडल से यह पूछने पर कि क्या वह आश्वस्त है, area under the curve 0.5000 मिलता है, यानी संयोग के बराबर; उसकी आंतरिक अवस्था पढ़ने पर 0.8801 मिलता है और इसमें 0.0615 सेकंड लगते हैं, जबकि उत्तर जनरेट करने में 1.631 सेकंड लगते हैं। दूसरी पोस्ट तेरह सत्यापनकर्ताओं को इसी परीक्षा से गुज़ारती है: केवल तीन 0.70 पार करते हैं, और ZTC, JEV से 0.0014 आगे है—ऐसा अंतर जिसे अलग नहीं माना जा सकता।

सबसे ठोस तथ्य कहीं और है: एक baseline जो उत्तर की केवल लंबाई और स्वरूप देखता है, उसकी सामग्री कभी नहीं, 0.7036 तक पहुँचता है और तेरह में से आठ प्रणालियों को पछाड़ देता है। एक सावधानी यह है कि रैंकिंग का लेखक निष्पक्ष तृतीय पक्ष नहीं है—वह बताता है कि वह अपनी प्रणाली को भी माप रहा है, लेकिन यह नहीं बताता कि तेरह में से कौन-सी उसकी है, और दोनों पोस्ट एक ही दिन प्रकाशित हुईं। आँकड़े सटीक हो सकते हैं; लेकिन रैंकिंग की स्वतंत्रता स्थापित नहीं है।

🔗 ZTC · रैंकिंग


54 डॉलर का LoRA, जो एक साथ सुधारता भी है और बिगाड़ता भी

20 सितंबर — ScalablyAI ने अपने एजेंट प्लेटफ़ॉर्म द्वारा छोड़े गए 143 145 टूल-उपयोग ब्लॉक से Qwen3.8-27B पर दो LoRA adapters को 53.88 डॉलर में प्रशिक्षित किया, फिर प्रशिक्षण के पहले चरण से पहले स्थिर की गई परीक्षण शृंखला पर उनका मूल्यांकन किया।

नतीजा दोहरा है। अस्वीकृत टूल कॉल के बाद recovery की 73 अवस्थाओं में adapter की सफलताएँ 31 से बढ़कर 38 हो गईं, सात मामले उसके पक्ष में बदले और एक भी विरुद्ध नहीं गया। लेकिन सही trajectory के 73 निर्णयों में वह 49 से घटकर 45 पर आ गया, यानी साढ़े पाँच अंकों की गिरावट, जबकि सीमा दो पर तय थी। किसी adapter को unload करना एक परमाणु क्रिया है, इसलिए गिरावट छोड़ने के लिए लाभ भी छोड़ना पड़ता: दोनों को अस्वीकार कर दिया गया। इसी से अपनाई गई संरचना निकली—एक ओर 433 संपादन योग्य memory rules और दूसरी ओर वज़नों को यथावत रखना।

If every useful experience immediately changes the weights, learning and corruption can become the same operation, and at production sample sizes you cannot tell which one you performed.

🇮🇳 यदि हर उपयोगी अनुभव तुरंत वज़नों को बदल देता है, तो सीखना और भ्रष्ट करना एक ही क्रिया बन सकते हैं, और production में उपलब्ध नमूना-आकार पर आप यह नहीं जान सकते कि आपने अभी दोनों में से कौन-सी क्रिया की है।Hugging Face ब्लॉग पर pavle-scalably

🔗 पूरी रिपोर्ट और साक्ष्य रजिस्टर


SeamFlow वहाँ UV सीम लगाता है जहाँ कोई कलाकार लगाता

20 सितंबर — किसी 3D सतह को 2D में खोलने के लिए उसे काटना पड़ता है; अच्छा विभाजन इन सीमों को वहाँ रखता है जहाँ वे सबसे कम दिखाई दें। City University of Hong Kong, Bambu Lab और Nanyang Technological University के साथ Meshy AI द्वारा प्रस्तुत SeamFlow मॉडल से पहले ही निरूपण बदल देता है: mesh का प्रत्येक edge एक token बन जाता है, और binary label को continuous value में ढीला किया जाता है, जिससे flow matching लागू किया जा सकता है।

लाभ संरचनात्मक हैं: अब projection चरण या tokens की मनमानी क्रम-व्यवस्था नहीं चाहिए, और प्रत्येक अनुमानित कट मौजूदा edge पर ही पड़ता है। पेशेवरों द्वारा बनाई गई सीमों वाले 350 000 Objaverse meshes पर प्रशिक्षित मॉडल अपने कट folds में रखता है: सीमों के साथ औसत dihedral angle 67.59 डिग्री तक पहुँचता है, जबकि xatlas के लिए यह 56.65 और PartUV के लिए 55.97 है। यह 5.63 सेकंड में mesh खोलता है, जबकि autoregressive baseline को 11.46 सेकंड लगते हैं, और इसे 61.0% मामलों में पहली पसंद बनाया गया, जबकि अगले विकल्प को 19.1% मामलों में चुना गया।

🔗 SeamFlow


Antigravity 2.15.1 ने Windows पर सैंडबॉक्स उपलब्ध कराया, पर सक्रिय नहीं किया

19 सितंबर — Antigravity के संस्करण 2.15.1 का सार एक पंक्ति में है: फ़ाइल और नेटवर्क sandboxing Windows पर आ गया है। केवल एक सुधार, कोई bug fix नहीं, जबकि एक दिन पहले आए 2.15.0 में सात सुधार और सोलह fixes थे—यह लक्षित जोड़ है, maintenance release नहीं।

बाकी उत्पाद शृंखला से अंतर ही वास्तविक मुद्दा है। Linux पर सैंडबॉक्स kernel namespaces पर आधारित है; macOS पर sandbox-exec के Seatbelt profiles पर; और दोनों में यह default रूप से सक्रिय है। Windows पर इस्तेमाल की गई primitive दर्ज नहीं की गई है, सक्रियण अब भी “Enable Sandbox Mode (Preview)” checkbox के माध्यम से हाथ से करना पड़ता है, और दिए गए तीन security presets—Default, Full machine, Turbo mode—में से कोई इसे सक्रिय नहीं करता: checkbox चुनने पर preset, Custom में बदल जाता है। Google ने भविष्य के किसी संस्करण में समानता लाने की घोषणा की है, लेकिन कोई समय-सारणी नहीं दी।

🔗 Antigravity चेंजलॉग


संक्षेप में

  • पाँच annotators, एक ही निर्देश, पाँच अलग उत्तर — 100 तुर्की दृश्यों और 9 positives वाले मानवीय संदर्भ पर पाँच machine annotators 0 से 78 positives तक जाते हैं, जबकि 74.7 से 86.3% के raw agreement के बावजूद सभी Cohen’s kappa 0.000 से 0.185 के बीच रहते हैं। लेखक, जो स्वयं को मूल्यांकित schema का रचयिता बताता है, याद दिलाता है कि कोई designer अपने schema की transferability का निष्पक्ष निर्णायक नहीं होता। 🔗 स्रोत
  • 20 सितंबर के Gemini CLI nightly में कोई बदलाव नहीं है — tag v0.62.0-nightly.20260920.gcfbcaa8df पिछले दिन वाले उसी commit पर लगाया गया है, hash suffix भी वही है, और संस्करण पृष्ठ पर “What’s Changed” अनुभाग नहीं है। stable (v0.60.0) और preview (v0.61.0-preview.0) channels भी अपरिवर्तित हैं। 🔗 स्रोत
  • GitHub के एक विधिवेत्ता द्वारा लिखा गया Copilot CLI plugin Eyeball open source है — टूल विश्लेषित clause की जगह पर स्रोत दस्तावेज़ के screenshots जोड़ता है, ताकि विश्लेषण और उसका प्रमाण साथ-साथ पढ़े जा सकें। repository dvelton/eyeball MIT license के अंतर्गत सार्वजनिक है, Python में लिखी गई है, इसके 35 stars हैं और 5 अप्रैल 2026 से कोई commit नहीं हुआ है। 🔗 स्रोत
  • 18 सितंबर से npm tokens केवल staging तक सीमित किए जा सकते हैं — “Read and write (stage only)” permission किसी continuous integration pipeline को npm stage publish के माध्यम से संस्करण जमा करने देता है, लेकिन प्रकाशित करने नहीं; ऑनलाइन प्रकाशन के लिए maintainer की 2FA मंज़ूरी आवश्यक है। यह रोक registry की ओर से लागू होती है, उस token पर भी जिसे 2FA को bypass करने के लिए configure किया गया हो; npm जनवरी 2027 में यह direct publication हटा देगा। 🔗 स्रोत
  • 18 सितंबर से code coverage rule को REST API के माध्यम से नियंत्रित किया जा सकता है — ruleset option “Restrict code coverage”, जो न्यूनतम सीमा लागू करता है या pull request पर स्वीकार्य गिरावट सीमित करता है, API में general availability में आ गया है, इसलिए infrastructure as code में भी। यह GitHub Enterprise Cloud और GitHub Team तक सीमित है, GitHub Enterprise Server पर उपलब्ध नहीं है। 🔗 स्रोत
  • Wan अपनी Peel-Off Sticker सुविधा को प्रमुखता दे रहा है — Alibaba Wan का खाता wan.video की ऐसी सुविधा दिखाता है जो किसी व्यक्तिगत फ़ोटो को दृश्य में जोड़कर Wan 3.0 से animate करती है। यह launch नहीं है: संदेश में न आरंभ होने की तारीख है, न कीमत और न गुणवत्ता का कोई माप। 🔗 स्रोत
  • Cohere ने Montréal की ALL IN conference से चार फ़ोटो प्रकाशित कीं — 19 सितंबर का संदेश कंपनी के साथ Aston Martin F1 और Magnus Carlsen की उपस्थिति बताता है। कोई उत्पाद घोषणा, कोई आँकड़ा और कोई लिंक नहीं। 🔗 स्रोत

इसका क्या अर्थ है

सप्ताहांत की एकमात्र model release खुली है, और यह जोड़ने के बजाय समेकित करती है। Qwen-Image-2.1, Qwen-Image-Layered के बगल में एक और मॉडल बनकर नहीं आता: यह उसे समाहित करता है और पारदर्शिता को मुख्य मॉडल में जोड़कर नौ महीने पुराने समर्पित मॉडल की आवश्यकता समाप्त कर देता है। यही प्रक्रिया जनरेशन और एडिटिंग के बीच भी होती है, जिन्हें वज़नों की एक ही शृंखला में एकीकृत किया गया है। विज़ुअल सामग्री बनाने वालों के लिए इसका अर्थ है छोटी pipeline—लोड करने के लिए एक मॉडल, सीधे उपयोग योग्य RGBA layer और कटआउट चरण की आवश्यकता नहीं—और ecosystem ने उसी दिन साथ दिया, क्योंकि प्रकाशन के समय ही vLLM-Omni और ComfyUI काम कर रहे थे।

रविवार की तीन पोस्ट एक ही चिंता को तीन दृष्टिकोणों से बताती हैं: क्या मॉडल द्वारा उत्पादित सामग्री पर भरोसा किया जा सकता है, और किस कीमत पर। Zero-Token Confidence लागत के माध्यम से उत्तर देता है—0.0615 सेकंड बनाम 1.631, क्योंकि tokens जनरेट करने वाला सत्यापनकर्ता उसी budget के लिए agent से प्रतिस्पर्धा करता है। तेरह सत्यापनकर्ताओं की रैंकिंग मापन के माध्यम से उत्तर देती है, और उसका निष्कर्ष पेशे के लिए अप्रिय है: केवल उत्तर की लंबाई और स्वरूप पढ़ने वाला baseline तेरह में से आठ को हरा देता है। इसलिए यह साबित करने की सीमा कि कोई सत्यापनकर्ता वास्तव में पढ़ता है, अधिकांश प्रणालियों के दावों से अधिक ऊँची है—और लेखक द्वारा यह स्वीकारना कि वह अपनी प्रणाली को भी माप रहा है, किसी तृतीय पक्ष द्वारा पुनरावृत्ति की प्रतीक्षा करने का कारण देता है।

ScalablyAI की रिपोर्ट वह आयाम जोड़ती है जो बाकी दोनों में नहीं है: reversibility। 54 डॉलर के weight update ने एक ही artifact में failure के बाद recovery पर मापा गया लाभ और सही निर्णयों पर संभावित हानि उत्पन्न की, ऐसे नमूना-आकार पर जहाँ production दोनों में अंतर नहीं कर सकता। चूँकि adapter का आधा भाग unload नहीं किया जा सकता, पूरा adapter फेंकना पड़ा। संचालन संबंधी निष्कर्ष—सस्ते में पूर्ववत किया जा सकने वाला ज्ञान text files में रहता है, और वज़न केवल frozen test suite के पीछे बदलते हैं—स्वयं को सुधारने वाली AI की चर्चा के लिए उपयोगी प्रतिपक्ष है।

टूलिंग के क्षेत्र में operating system द्वारा isolation एक विकल्प के बजाय आधार बन रहा है। Qwen Code, bubblewrap को आंतरिक execution foundation बनाता है, Antigravity अपना सैंडबॉक्स Windows पर लाता है, और npm ऐसा token बनाता है जो संस्करण तैयार कर सकता है पर प्रकाशित नहीं कर सकता: तीन publishers, जिन्होंने तीन दिनों में security को बयान से हटाकर default value की ओर बढ़ाया। Windows के मामले में एक सावधानी है: ऐसा सैंडबॉक्स जिसे हाथ से checkbox चुनकर सक्रिय करना पड़े और जिसे तीनों उपलब्ध presets में से कोई सक्रिय न करे, अभी default protection नहीं है; और जब तक Google कोई समय-सारणी नहीं देता, macOS तथा Linux से अंतर बना रहेगा।


स्रोत