検索

Qwen-Image-2.1、オープンウェイトで生成と編集を統合、AntigravityのサンドボックスがWindowsに登場、単一のテストセットで13の検証システムを評価

人工知能によって生成された記事
Qwen-Image-2.1、オープンウェイトで生成と編集を統合、AntigravityのサンドボックスがWindowsに登場、単一のテストセットで13の検証システムを評価

ai-powered-markdown-translator

gpt-5.6-solを使用してフランス語から日本語に翻訳された記事。

GitHub でプロジェクトを見る ↗

土曜日と日曜日、研究所は沈黙していた。DeepSeekもMetaもAi2もSakanaもMistralもxAIも何も公開せず、オープンモデル分野の公式アカウントも2日間にわたって動きがなかった。本当の意味での新規公開は、日曜の午後半ばにオープンウェイトでリリースされたQwen-Image-2.1だけだ。残りの主な動きは、Hugging Faceのコミュニティブログに掲載された5本の記事、修正を一切含まないAntigravityの新バージョン、そして9月18日分として遡って拾ったGitHubの変更履歴2件にとどまる。水増しする理由のない、静かな一日だった。


Qwen-Image-2.1、生成・編集・透明度対応を単一モデルで実現

9月20日 — Qwenは、画像生成・編集モデルQwen-Image-2.1を、Hugging Face、ModelScope、GitHubでオープンウェイトとして公開した。売りは規模ではなく統合にある。これまで別々のモデルを必要としていた、テキスト指示からの作成と既存画像の編集を、同一のウェイト系列で処理する。

最も具体的な新機能はネイティブの透明度対応だ。モデルはRGBAレイヤーを直接生成・編集し、出力に透明度チャンネルを含めるかどうかは指示によって決まる。Qwenは2025年12月から専用モデルQwen-Image-Layeredでこの機能を提供していたが、今回はそれが統合された。写真から被写体を再利用可能なレイヤーとして切り抜いたり、透明レイヤー内のテキストを置き換えたりする際に、切り抜き工程が不要になる。

編集では、1つの構図に最大10枚の参照画像を入力できる。編集領域は、色付きの円、描き込んだ注釈、または別途用意したマスクで指定する。3つ目の方法があるのは、最初の2つでは元の内容が覆われてしまうためだ。効率性を支えるのは混合粒度のattentionで、編集入力からなる静的コンテキストを最初のステップでキャッシュする。

技術要素公表値
視覚生成パラメータ70億、32層のSingle-Stream DiT
対応する参照画像最大10枚
出力の透明度生成・編集ともにネイティブRGBAレイヤー
統合された専用モデル2025年12月公開のQwen-Image-Layered
初日からの対応vLLM-OmniとComfyUI

QwenはQwen-Image-Benchでの比較を公開しているが、数値は記事内の画像にしか掲載されていないため、ここでは転載しない。

Generate, edit, and create transparent images with one model: a 7.1B DiT paired with Qwen3-VL-8B.

🇯🇵 単一のモデルで画像の生成、編集、透明画像の作成を実現。71億パラメータのDiTとQwen3-VL-8Bを組み合わせている。Xの@vllm_project

🔗 発表


Qwen Code v0.24.2、Web Shellの音声機能を完成させ、bwrapサンドボックスを拡充

同じ開発元、同じ日だが、無関係な製品だ。9月20日 — Qwenのコマンドライン型コーディングエージェントv0.24.2は、v0.24.1からわずか24時間余りで公開された。直前の2バージョンにはそれぞれ破壊的変更が含まれていたが、この系列では初めて破壊的変更がない。

bubblewrapサンドボックスには、構造化されたプロセス起動、監視、隔離されたworkerからなる完全な実行基盤が追加された。同じ流れで、信頼可否が未決定のworkspaceでは、今後は明示的な判断が求められる。Web Shellでは、Live Voice機能が実際に使える状態になった。設定カードからモデルと音声を選択でき、通話中にはマイクレベルが表示される。複数のsessionを並行して動かす利用者向けには、受信メッセージが宛先のsessionごとに評価されるようになり、遅延toolでもprompt cacheが保持される。

🔗 リリースノート


1 tokenも生成せずに回答を検証、ただしランキング作成者は当事者

9月20日 — 同じ日に、同じ2,018項目のデータセットを扱う2本の記事が公開された。1本目はZero-Token Confidenceを紹介する。probeが1回のforward passでモデルの最後のhidden stateを読み取り、tokenを生成することなく、校正済みの確率を算出する。モデルに自信があるかを直接尋ねた場合のAUCは0.5000で、つまり偶然と同じだ。一方、内部状態を読み取る方法では0.8801に達し、所要時間は回答生成の1.631秒に対して0.0615秒だった。2本目では13の検証システムを評価している。0.70を超えたのはわずか3つで、ZTCはJEVを0.0014上回ったものの、両者を明確に区別できる差ではない。

より確かな事実は別にある。回答の内容を一切見ず、長さと書式だけを見るbaselineが0.7036を記録し、13システム中8つを上回った。ただし注意点がある。ランキングの作成者は中立な第三者ではない。自身のシステムも測定対象に含めたと述べているが、13システムのうちどれなのかは明かしておらず、2本の記事も同日に公開されている。数値自体は正確かもしれないが、ランキングの独立性は立証されていない。

🔗 ZTC · ランキング


54ドルのLoRA、改善と破壊を同時にもたらす

9月20日 — ScalablyAIは、自社のエージェントプラットフォームに蓄積された143,145件のtool利用ブロックを使い、Qwen3.8-27B向けのLoRA adapterを2つ、53.88ドルで学習した。その後、学習開始前に固定したsuiteで評価した。

結果は二面的だった。拒否されたtool call後の回復状態73件では、成功数が31件から38件に増えた。7件がadapter有利に転じ、逆方向に転じたものはなかった。一方、正常なtrajectoryの判断73件では、49件から45件に低下した。減少率は5.5ポイントで、2ポイントに設定された許容上限を超えた。adapterのunloadは不可分であるため、この後退を避けるには改善も諦める必要があり、2つとも不採用となった。そこで採用されたのが、一方に編集可能な433件のmemory ruleを置き、もう一方ではウェイトに手を触れないという構成だ。

If every useful experience immediately changes the weights, learning and corruption can become the same operation, and at production sample sizes you cannot tell which one you performed.

🇯🇵 役立つ経験のたびに即座にウェイトを変更するなら、学習と破損が同じ操作になり得ます。そして本番環境で利用できるサンプル数では、今どちらを行ったのか判別できません。Hugging Faceブログのpavle-scalably

🔗 完全版レポートと証拠台帳


SeamFlow、アーティストが置くような位置にUV seamを配置

9月20日 — 3D surfaceを2Dに展開するには切断が必要であり、優れた展開では、その切れ目を最も目立ちにくい位置に置く。Meshy AIがCity University of Hong Kong、Bambu Lab、Nanyang Technological Universityと共同で発表したSeamFlowは、モデルに入力する前の表現を変える。meshの各edgeを1つのtokenとし、binary labelを連続値へ緩和することで、flow matchingを適用できるようにした。

利点は構造的だ。projectionの工程もtokenの恣意的な順序も不要で、予測された切断線はすべて既存のedge上に置かれる。専門家がseamを作成した350,000件のObjaverse meshで学習したモデルは、折り目に切断線を配置する。seamに沿った平均dihedral angleは67.59度で、xatlasの56.65度、PartUVの55.97度を上回る。展開時間は5.63秒で、autoregressive baselineの11.46秒より速い。第一候補として選ばれた割合も61.0%で、次点の19.1%を上回った。

🔗 SeamFlow


Antigravity 2.15.1、Windowsでサンドボックスを利用可能にするも自動では有効化せず

9月19日 — Antigravity 2.15.1の内容は1行に収まる。ファイルとネットワークのサンドボックス化がWindowsに導入された。改善は1件だけで、修正はない。前日の2.15.0には改善7件と修正16件が積み重ねられていたため、これは保守リリースではなく、対象を絞った追加だ。

本当の焦点は、ほかのプラットフォームとの差にある。Linuxではkernel namespace、macOSではsandbox-execのSeatbelt profileをサンドボックスに使用し、どちらも標準で有効になっている。Windowsでは使用するprimitiveが文書化されておらず、「Enable Sandbox Mode (Preview)」というチェックボックスで手動有効化する必要がある。用意された3つのセキュリティpreset、Default、Full machine、Turbo modeのいずれもサンドボックスを有効化せず、チェックを入れるとpresetがCustomに切り替わる。Googleは将来のバージョンで挙動を揃えるとしているが、時期は示していない。

🔗 Antigravity変更履歴


短報

  • 5人のannotator、同じ指示、5通りの異なる回答 — トルコの100場面を対象とし、人間の基準でpositiveが9件だったところ、5つのmachine annotatorによるpositive判定は0件から78件までばらついた。単純一致率は74.7%から86.3%だったにもかかわらず、Cohen’s kappaはすべて0.000から0.185の範囲にとどまった。評価対象となったschemaの作成者だと明かす著者は、設計者は自身のschemaのtransferabilityを判断する中立な審判ではないと念を押している。🔗 出典
  • 9月20日のGemini CLI nightlyには変更なし — tag v0.62.0-nightly.20260920.gcfbcaa8dfは前日と同じcommit、同じhash suffixに付けられており、バージョンページにも「What’s Changed」セクションがない。stable channel(v0.60.0)とpreview channel(v0.61.0-preview.0)にも変更はない。🔗 出典
  • GitHubの法律専門家が作成したCopilot CLI plugin、Eyeballがopen source化 — このtoolは、分析対象の条項がある位置に元文書のscreenshotを差し込み、分析と根拠を並べて読めるようにする。repository dvelton/eyeballはMIT licenseの下で公開されており、Python製で、starは35件、2026年4月5日以降commitはない。🔗 出典
  • 9月18日から、stageのみに制限されたnpm tokenを提供 — 「Read and write (stage only)」権限により、CI pipelineはnpm stage publishを通じてバージョンを登録できるが、公開はできない。公開にはmaintainerによる2FA承認が必要となる。この制限はregistry側で適用され、2FAを迂回するよう設定されたtokenにも及ぶ。npmは2027年1月に、この直接公開機能を廃止する。🔗 出典
  • 同じく9月18日から、code coverage ruleをREST APIで管理可能に — ruleset optionの「Restrict code coverage」は、最低thresholdを義務付けるか、pull requestで許容されるcoverage低下幅を制限する機能で、APIで一般提供となった。これにより、infrastructure as codeから扱える。GitHub Enterprise CloudとGitHub Team限定で、GitHub Enterprise Serverは対象外。🔗 出典
  • Wan、Peel-Off Sticker機能を紹介 — Alibaba Wanのアカウントは、個人写真を場面内に合成し、Wan 3.0で動かすwan.videoの機能を紹介した。これは新規リリースではない。投稿には提供開始日、料金、品質指標のいずれも記載されていない。🔗 出典
  • Cohere、モントリオールのALL IN conferenceから写真4枚を公開 — 9月19日の投稿では、Aston Martin F1とMagnus Carlsenが同社とともに参加したことを伝えている。製品発表も、数値も、リンクもない。🔗 出典

これが意味すること

この週末に公開された唯一のモデルはオープンで、追加ではなく統合を進めた。Qwen-Image-2.1はQwen-Image-Layeredの隣に積み重なるのではなく、それを吸収した。透明度を主要モデルへ組み込むことで、9か月間存在した専用モデルを不要にした。同じ統合は生成と編集の間でも起きており、両者が単一のウェイト系列にまとめられている。画像制作を行う側にとっては、pipelineが短くなる。読み込むモデルは1つで、直接利用できるRGBAレイヤーが得られ、切り抜き工程も不要だ。ecosystemも同日に追随し、公開時点からvLLM-OmniとComfyUIが利用可能になった。

日曜日に公開された3本の記事は、同じ問題意識を3つの角度から語っている。モデルが生成したものを信頼できるのか、そしてその判断にどれほどの費用がかかるのかという問題だ。Zero-Token Confidenceは費用の面から答える。所要時間は1.631秒に対して0.0615秒だ。tokenを生成する検証システムは、同じ予算を巡ってエージェントと競合するからである。13の検証システムのランキングは測定によって答えるが、その教訓は業界にとって不都合だ。回答の長さと書式しか見ないbaselineが、13システム中8つを上回った。検証システムが本当に内容を読んでいると証明するための基準は、多くのシステムが示している以上に高い。そして、著者自身が自分のシステムも測定したと認めている以上、第三者による追試を待つべきだろう。

ScalablyAIのレポートは、ほかの2本に欠けていた要素、可逆性を加える。54ドルのウェイト更新は、失敗後の回復について測定可能な改善を生み出す一方で、同じartifact内に正常な判断を損なう可能性も生んだ。本番環境で得られるサンプル数では、両者を見分けられない。adapterの半分だけをunloadすることはできないため、すべて破棄せざるを得なかった。ここから導かれた運用上の結論、つまり容易に元へ戻せる安価な知識はtext fileに置き、ウェイトを動かすのは固定済みのsuiteを通した場合に限るという方針は、自己改善するAIをめぐる言説への有用な対論となる。

toolingの側では、OSによる隔離が選択肢ではなく基盤になりつつある。Qwen Codeはbubblewrapを内部実行基盤とし、AntigravityはサンドボックスをWindowsへ移植し、npmはバージョンを準備できても公開はできないtokenを考案した。3つの開発元が3日間で、セキュリティを理念から標準値へと移している。ただしWindowsについては留保が必要だ。手動でチェックを入れる必要があり、用意された3つのpresetのどれも有効化しないサンドボックスは、まだ標準の保護とはいえない。Googleが時期を示さない限り、macOSおよびLinuxとの差は残ったままだ。


出典