検索

Claude CodeがAGENTS.mdを読み込み、Qwen3.8-Omni-Flashが登場、Codexが音声会話をテスト

ai-powered-markdown-translator

gpt-5.6-solを使用してフランス語から日本語に翻訳された記事。

GitHub でプロジェクトを見る ↗

今週金曜日、エージェントツールは共通形式へと収束している。プロジェクトにCLAUDE.mdがない場合、Claude CodeはAGENTS.mdを読み込むようになり、AntigravityはMarkdownエージェントのシステムプロンプトにサブエージェントのカタログを挿入し、Codexはサブエージェントごとの使用量を詳細に示し、MiniMaxはターミナルエージェントのコードを公開した。この日の残りの動きは、Qwen3.8-Omni-FlashとGrok Voice Transcribe 2.0という2つのモデルのリリース、そして異例の提携に集約される。AnthropicがAccentureの評価担当者を自社内に受け入れるというものだ。


Claude CodeがAGENTS.mdを読み込み、サブエージェントを分離し、TaskOutputを廃止

9月18日 — 20時間のうちにClaude Codeの3つのバージョンが相次いで公開された。2.1.275は9月17日22時33分(UTC)、2.1.276は18日2時12分(UTC)、2.1.277は18日18時06分(UTC)に公開された。

最も構造的な新機能は、2.1.277のわずか1行に記されている。CLAUDE.mdがないプロジェクトでは、Claude CodeがAGENTS.mdを読み込むようになった。これは、市場にある複数のコーディングエージェントで共有される慣例となった指示ファイルだ。この設定は/configの「Project instructions」で変更できる。この機能は、Bedrock、Vertex、Foundryではまだ利用できない。

Added AGENTS.md support: in a project with no CLAUDE.md, Claude Code reads AGENTS.md instead; change it under “Project instructions” in /config (not yet on Bedrock, Vertex or Foundry)

🇯🇵 AGENTS.mdのサポートを追加:CLAUDE.mdがないプロジェクトでは、Claude Codeが代わりにAGENTS.mdを読み込む。この設定は/configの「Project instructions」で変更できる(Bedrock、Vertex、Foundryではまだ利用不可)。 — Claude Code CHANGELOG、anthropics/claude-code

同じバージョンのほかの2つの変更は、コンテキストの安全性に関わる。サブエージェントから返されたテキストがセッションの指示として扱われないよう、サブエージェントの結果は、それと明示するヘッダー付きでメインエージェントへ渡される。また、不可視のUnicode書式文字がプロンプトから削除され、送信前にクリーンアップ後の内容が表示される。2.1.277では、非推奨となっていたTaskOutputツールも削除された。Claudeは今後、バックグラウンドタスクの出力ファイルをReadで読み込む。

2.1.275では、進行中のターンを中断し、キュー内のすべてのメッセージを一度に送る即時送信キー(ctrl+enter)に加え、claude.aiアカウントで有効化されたskillsとpluginsをターミナルへ同期する機能が追加された。サプライチェーン対策として、npm由来のpluginsは整合性検証付きのnpm pack --ignore-scriptsによって取得され、パッケージのインストールスクリプトが実行されないようになった。4時間足らず後に公開された2.1.276は、このバージョンで生じたリグレッションのみを修正している。proxy経由のすべてのリクエストが失敗する400エラーだ。

バージョン番号公開日時(UTC)主な内容
2.1.27517/09 22時33分即時送信、claude.ai skillsの同期、npm --ignore-scripts
2.1.27618/09 02時12分単一の修正:proxy経由の400エラー
2.1.27718/09 18時06分AGENTS.md対応、サブエージェントの分離、TaskOutputの廃止

🔗 バージョン2.1.277のリリースノート


Qwen初のエージェント型オムニモーダルモデル、Qwen3.8-Omni-Flash

9月18日 — Qwenは、エージェント機能を中心に設計された同社初のオムニモーダルモデルとしてQwen3.8-Omni-Flashを公開した。今回強調されている進化は、もはやマルチモーダルコンテンツの理解ではなく、その活用にある。コンテンツを理解し、タスクを計画し、ツールで実行し、結果を提供する。このモデルは、100万トークンのコンテキストウィンドウでテキスト、画像、音声、動画を受け付ける。

Meet Qwen3.8-Omni-Flash, Qwen’s first omni-modal model built around agentic capabilities!

🇯🇵 エージェント機能を中心に構築されたQwen初のオムニモーダルモデル、Qwen3.8-Omni-Flashをご紹介します。Xの@Alibaba_Qwen

Qwenが採用した29件の評価では、平均スコアがQwen3.5-Omni-Plus比で25%以上向上し、特に音声・動画エージェントで大きな伸びを示した。最も大きく改善したのは複数話者の認識だ。

採用された評価Qwen3.8-Omni-FlashQwen3.5-Omni-PlusGemini 3.8 Flash
WildClawBench-MM71,034,558,9
UniClawBench69,667,169,0
AgenticVBench36,814,545,0
OmniVideoBench63,453,865,2
StreamingBench80,857,179,9
AliMeeting DER / cpWER(低いほど良い)3,4 / 17,288,1 / 89,672,6 / 53,1

最も独創的なのは、長時間動画に適用されるエージェント型知覚だ。モデルは録画を最初から最後まで処理するのではなく、提示された質問を起点に、何を見て何を聞くべきかを自ら判断し、粗い探索から細かな探索へと段階的に情報の位置を特定する。OmniVideoBenchでは、このモードによって精度が63,4から67,8へ向上する一方、リクエスト当たりの消費量は145 736から79 117トークンに減少した。約45,7%の削減であり、この数値は公式記事でも明記されている。

料金面もこれに続く。Qwenの算出方法によれば、音声入力1時間当たりの価格はQwen3.5-Omni-Plusと比べて98%以上低下する。同時に2つの構成要素も公開された。Codex、Claude Code、Qwen Code、Gemini CLIのハーネスと互換性があるQwen-MM-Pluginsと、リアルタイム対話向けのQwen-Live Harnessだ。Realtime版は低遅延の連続対話に特化しており、最初のトークンが出るまでの時間は591~981ミリ秒となる。

🔗 Qwen3.8-Omni-Flashに関するQwenの記事


Codex CLI 0.155.0、音声会話を実験的機能として導入

9月17日 — OpenAIはCodex CLI 0.155.0を公開した。これは9月10日の0.154.0以来となる最初の安定版で、npm install -g @openai/codex@0.155.0によりインストールできる。前日にXで発表された音声エージェントについて欠けていたchangelog項目が、ここで追加された。この機能の名称は/voiceで、リアルタイム文字起こしとマイク操作を提供するが、引き続き実験的である。対応ビルド(supported builds)でのみ利用でき、/experimentalで有効化する必要がある。

そのほかの変更は目立たないものの、すぐに役立つ内容だ。ターミナルインターフェースでは、ステータス行に推論の要約がリアルタイムで表示されるようになり、正常に完了した各ターンの後には終了時刻も表示される。エージェント一覧では、タスクを非表示、アーカイブ、削除できるほか、worktreeの所有権の詳細が示され、管理対象のクリーンなworktreeを削除する前には確認が行われる。対応するMacでは、ローカルTUIセッションのMCPリクエストをTouch IDで承認できる。Amazon Bedrockは、設定されたコマンドからAWS認証情報を取得でき、キャッシュ、有効期限切れ時の更新、認証失敗後の再試行にも対応する。

複数の修正はセキュリティに関係する。制限付きWSL sandboxからWindowsプロセスへ脱出する手法が遮断され、仲介されたshell snapshotは認証情報の漏えいに対して強化された。また、アカウントを切り替えると、以前のIDに属するリモート制御セッション、キャッシュされたWebSocketの状態、モデルカタログが無効化される。

バージョンの新機能詳細
/voiceリアルタイム文字起こしとマイク操作、/experimentalによる実験的機能
ターミナルインターフェースステータス行の推論要約、ターン終了時刻の表示
エージェント一覧タスクの非表示、アーカイブ、削除、worktreeの所有権
Touch ID対応MacのローカルセッションでMCPリクエストを承認
Amazon Bedrockコマンドで取得するAWS認証情報、キャッシュおよび更新に対応

🔗 Codex CLI 0.155.0のリリースノート

Codexがタスク、サブエージェント、会話ごとの使用量を詳細表示

9月18日 — OpenAI Developersは、Codexにおける詳細な使用量追跡を発表した。このツールでは、タスク、サブエージェント、個々の会話が総使用量にどのように寄与しているかを確認できる。この情報はデスクトップアプリで確認でき、個人およびBusinessアカウントでは「設定」、続いて「Usage & billing」、対象となるEnterpriseアカウントでは「Usage」にある。利用するには最新版への更新が必要だ。この発表に付随するブログ記事やchangelog項目はない。

重要なのは粒度だ。これまでは、quotaを使い切っても何に消費されたのか分からなかった。サブエージェントごとの内訳があれば、どの委任にコストがかかっているかを把握し、書き直すことができる。これは、コーディングハーネス全般にサブエージェントが普及していく動きに対する、会計面での対応と言える。

🔗 XでのOpenAI Developersの発表


料金据え置きのSpaceXAI音声認識モデル、Grok Voice Transcribe 2.0

9月18日 — SpaceXAIは、新しい音声認識(speech-to-text)モデルGrok Voice Transcribe 2.0を発表した。料金は変わらず、バージョン1.0の2倍の精度を持つと説明されている。このモデルは、すでにGrok Voiceを支える音声基盤を採用している。同社によれば、Grok Voiceは毎日数万件のカスタマーサポート通話を処理し、数百万時間分の動画ナレーションを文字起こししている。

中心となる訴求点は、実験室の音声ではなく現実の音声への対応だ。不安定な電話回線、重なり合う声、地域ごとのアクセント、声に出して読み上げられた電話番号やメールアドレスなどが対象となる。SpaceXAIは、公開ランキングArtificial Analysisのストリーミング部門において32モデル中で精度1位だと主張しており、実稼働トラフィックから抽出した4つの社内データセットを根拠としている。8 kHzの電話音声、Grokとの会話、読み上げられた識別情報、19言語の短い音声コマンドだ。

最も顕著な改善は多言語対応に見られる。言語を特定するための文脈が最も少ない短文データセットでは、単語誤り率が20,6%から6,8%に低下した。このモデルは言語を自動検出し、録音中の言語切り替えにも1回の処理で追従する。

測定指標発表値
Transcribe 1.0比で主張される精度2倍
Artificial Analysisランキング(ストリーミング)32モデル中1位
短文の誤り率(1.0 → 2.0)20,6 % → 6,8 %
バッチ料金音声1時間当たり0,10ドル
ストリーミング料金音声1時間当たり0,20ドル
個別に文字起こしできるチャンネル数最大8
リクエスト当たりの業界用語最大100

このモデルはバッチ処理とストリーミング処理、信頼度スコア付きの単語単位タイムスタンプ、追加料金なしの話者分離(diarization)、発話ターン終了の検出に対応する。既存のAPI連携では、コードを変更せずに精度向上の恩恵を受けられる。Grok Voice Transcribe 2.0は近日中にAPIの既定モデルとなり、1.0は今後数週間で非推奨になる。1.0を使い続けるにはgrok-voice-transcribe-1.0を固定指定する必要がある。

🔗 Grok Voice Transcribe 2.0の発表


AnthropicがAccentureの評価担当者を社内に受け入れ

9月18日 — Anthropicは、フロンティアモデルの独立評価を目的とするAccentureとの提携を発表した。これは、同社CEOが掲げた組み込み型(embedded)評価担当者の受け入れという公約に向けた重要な一歩と位置づけられている。業務はAccentureのAI専門子会社Facultyが担当し、モデルの評価とred-teaming、アラインメント評価、ガードレールのテストを対象とする。

外部評価担当者との違いは明確だ。組み込み型評価担当者は、従業員に近いアクセス権を持ってAI企業の内部で活動する。モデルの訓練中にその様子を観察し、モデルの構築と展開を左右する意思決定を追跡し、従業員と直接話し、安全に関する公約が守られているかを確認し、インシデントを報告し、利点とリスクについてより十分な情報に基づく説明を公表できる。Anthropicは、この仕組みが自社の責任を軽減するのではなく、責任をより検証可能にするものだと説明している。

この発表は、まだ存在しないものについて異例なほど率直だ。組み込み型評価担当者がどの情報にアクセスすべきか、その調査結果をどのように公表すべきかについて基準はなく、独立評価に資金を提供する確立された仕組みもない。Anthropicは、最終的には共同基金や公的資金から拠出されるべきだと考えている。しかし現時点ではそのような仕組みがないため、Accentureの業務に直接資金を提供する。これが、この枠組みの最も目立つ限界となっている。

提携の要素発表内容
実施主体AccentureのAI子会社Faculty
投資各当事者が5年間で少なくとも10億ドル
対象範囲評価、red-teaming、アラインメント、ガードレール
アクセスレベル従業員と同等
資金提供共同基金がないためAnthropicが直接提供
独占性双方ともなし

Anthropicはさらに、METRやその他の非営利評価機関と、それぞれの資金を用いて組み込み型評価の要素を試行するための協議を行っていると説明し、今後数週間で別の提携先も発表するとしている。

🔗 組み込み型評価に関するAnthropicの発表


Antigravity:カスタムエージェントをめぐり2日間で3つのリリース

Googleは、CLIの2つのバージョンとAntigravityアプリケーションの1つのバージョンを立て続けに公開した。3つはいずれも、カスタムエージェントが何を知り、何を拒否でき、監視なしでどこまで動作できるかという同じテーマを、3つの角度から扱っている。これらは9月11日に始まった密度の高い一連のリリースに続くもので、ここではバージョン1.2.1から1.2.4までは取り上げない。

CLI 1.2.6、セッション連動型のRemote Controlを導入し、5分の上限を撤廃

9月18日 — CLIを常駐システムサービスにした1.2.0から8日後、Googleは対照的な、はるかに軽量な第2のRemote Control方式を導入した。これはセッション単位(session-scoped)の接続で、起動時にフラグ--remote-controlを指定するか、実行中にコマンド/remote-controlを使用すると開始される。/remote-control offを入力するかセッションを閉じるとトンネルが解除され、デバイスは一覧から削除される。1.2.0がセッション終了後も存続するデーモンを目指したのに対し、1.2.6はその逆を目指している。

2つ目の変更はヘッドレス(headless)モードに関するものだ。-p--prompt実行時のデフォルトのタイムアウトが、明示的に--print-timeoutを指定しない限り、5分から無制限に変更された。3つ目はエラー報告を構造化するもので、エージェントまたはAPIで障害が発生すると、CLIは標準エラー出力に、正規化されたステータス、HTTPまたはgRPCコード、再試行可能かどうか、エラー識別子を含むJSON行AGY_ERROR: {...}を書き込み、終了コードを1から3に変更する。これにより、オーケストレーションスクリプトは自由形式のテキストを解析せずに、一時的なネットワーク障害と恒久的なエラーを区別できる。

CLI 1.2.5、Markdownエージェントについにサブエージェントの一覧を提供

9月17日 — これまで、Markdownで定義されたカスタムエージェントは、ツールにinvoke_subagentを宣言しても、どのサブエージェントが存在するかを知ることができなかった。つまりツールは持っていても、一覧は持っていなかった。CLIは今後、利用可能なサブエージェントのカタログとその使用方法をシステムプロンプトへ自動的に追加し、実際に委任できるようにする。

変更履歴の表現には注意が必要だ。これは製品自体によるコンテキストの追加であり、セキュリティ上の脆弱性でも修正でもない。2つ目の改善では、バックグラウンドに送られたタスクの明示的な名前が保持されるようになった。以前は通知とタスク一覧の間で名前が失われていた。5件の修正では、無効化された識別子の消去、割り込まれたコマンドの終了コード、停止したままになる思考フレームが対処された。

Antigravity 2.15.0、カスタムエージェントがデフォルトのプロンプトとツールを無効化可能に

9月18日 — 2.14.0から3日後、アプリケーションは7件の改善と16件の修正を公開した。主な変更により、カスタムエージェントは自身のコンテキストを制御できるようになった。デフォルトのプロンプトセクションとデフォルトツールを無効化し、必要なものだけを再導入できる。専門特化したエージェントでは、それだけ強制されるシステムプロンプトを削減できる。

そのほかの変更は、ナビゲーションと永続化に関するものだ。Page Up、Page Down、Home、Endで会話をスクロールでき、Escで入力欄から抜けられるようになり、選択したカスタムエージェントは再読み込み後も記憶される。2件の修正はデータ整合性に関するもので、アプリケーションが状態ファイルの読み取りに失敗した際に保存済み設定とプロジェクト一覧が上書きされる場合があったほか、権限設定に重複が蓄積し、会話ファイルが肥大化していた。

🔗 Antigravityの変更履歴


GitHub Copilot:Sentryキャンバス、6モデルの廃止、カスタマイズ別の指標

2日間に公開された3件の変更履歴からは、同じ関心が浮かび上がる。チームがCopilotを実際にどのように利用しているかを測定し、使用されなくなったものを整理することだ。

9月14日週のまとめで、2つの新機能が明らかに

9月18日 — GitHubは、9月14日週のCopilot週間まとめを公開した。目次の大部分は変更履歴ですでに個別に公開された項目だが、これまで単独では発表されていなかったものが2つだけある。1つ目はCopilotアプリケーション内のSentryキャンバスで、アプリケーションを離れることなく、本番環境のクラッシュレポートを修正につなげる。エラー、スタックトレース(stack traces)、コンテキストを表示し、原因の調査、修正の検証、pull requestの準備が可能になる。9月上旬のJiraに続き、エラー監視ツールがキャンバスに統合された初の事例だ。

2つ目は、VS Code 1.138のエージェント機能群だ。Agentsウィンドウでは、プロジェクトのツールと依存関係を備えたローカルのDev Container内でエージェントを実行できる。段階的な展開で、Dockerが必要だ。非アクティブなセッションは、すべてのpull requestがマージされると自動的に完了扱いにでき、猶予期間後に任意で削除することもできる。この機能はプレビュー版で、明示的な有効化が必要だ。さらに、Agent Hostセッションから直接pull requestを作成できる。

🔗 Copilot週間まとめ

6つのモデルが10月19日にCopilotの全機能から廃止

9月18日 — GitHubは、2026年10月19日に、Copilot Chat、インライン編集、askモードとagentモード、コード補完を含むCopilotの全機能から6つのモデルを廃止すると発表した。これは9月に発表された2回目の廃止対象群となる。

廃止対象モデル廃止日推奨代替モデル
Gemini 3.7 Flash19/10/2026Gemini 3.8 Flash
GPT-5.519/10/2026GPT-5.6 Sol
GPT-5.419/10/2026GPT-5.6 Sol
GPT-5.4 mini19/10/2026GPT-5.6 Luna
GPT-5 mini19/10/2026GPT-5.6 Luna
Grok 4.519/10/2026Grok 4.6

モデルのデフォルト有効化が設定されている場合、Copilot EnterpriseおよびBusinessの利用者には代替モデルが自動的に有効化される。ただし、管理者が全体のデフォルト設定を無効化している場合、または該当モデルを明示的にブロックしている場合を除く。その場合は、設定内のモデルポリシーからアクセスを再び有効にできる。モデルを削除するための操作は必要ない。

🔗 Copilotモデル廃止のお知らせ

指標APIでCLIのskills、agents、MCP servers、pluginsを集計

9月17日 — Copilotの利用状況指標APIは、CLIにおける5種類のエージェント型カスタマイズに対応した。skills、カスタムagents、MCP servers、slash commands、pluginsだ。totals_by_skilltotals_by_custom_agenttotals_by_mcptotals_by_slash_cmdtotals_by_pluginの各配列には、最も活発に利用された5項目とそれぞれのinteraction_countが列挙され、distinct_*_use_countフィールドでは上位5項目以外も含めて、使用された項目の種類数を集計する。

誤解を避けるため、2つの細かな点に注意が必要だ。MCP serversでは、CLIが接続または再接続を試みた場合にのみ、成功・失敗を問わずカウンターが増加し、確立済みの接続でツールが呼び出されるたびに増えるわけではない。pluginsの指標では、pluginに関連付けられたskillsの呼び出しだけを集計する。これはskillsの合計の一部であり、両者を足し合わせてはならない。プライバシー保護のため、GitHubが提供した名前だけが表示され、利用者が定義した名前はotherにまとめられる。

🔗 指標APIにおけるCLIのエージェント型カスタマイズ


ターミナル型コーディングエージェント:MiniMaxが公開、Mistralがハーネスを安定化

無関係な2社が同じ日に同じ市場について発表した。ターミナルで動作するコーディングエージェントは一般化し、差別化の焦点はライセンスとハーネスの安定性へ移っている。

MiniMax、MiniMax Code CLIのコードをMITライセンスで公開

9月18日 — MiniMaxは、ターミナル型コーディングエージェントのソースコードをバージョン0.4.12として公開した。ツールはmcodeという名前でインストールされ、3つの利用方法を提供する。対話型ターミナルインターフェース、シェルスクリプト、継続的インテグレーション、評価向けのヘッドレスモード(mcode exec)、そしてAgent Client Protocol対応エディター向けのACPモードだ。権限管理とサンドボックスのもとで、プロジェクトのファイルを読み取り、差分を調査し、シェルコマンドとテストを実行する。

モデルの選択肢は開かれている。一方ではMiniMaxアカウントとそのToken Plan、もう一方ではOpenAIまたはAnthropic互換のAPI形式を公開しているサードパーティー事業者を利用できる。さらに、組み込み検索、マルチモーダルツール、MCPプロトコル、サブエージェント、pluginシステムも備える。一次ソースのコードはデフォルトでMITライセンスのもと公開されている。リポジトリにはTUI、ヘッドレスCLI、ACPモードが含まれるが、デスクトップアプリケーションは含まれない。ただし、その不具合追跡は同リポジトリで行われる。現時点でコード提案を受け付けているのは、リポジトリの共同作業者からのみだ。

🔗 XでのMiniMaxの発表

Vibe CLIのUnified Harnessが実験段階を終了

9月18日 — Mistralは、2.25.4から6日後にVibe CLI 2.25.5を公開した。構造上の変更はリリースノートの1行に集約されている。Unified Harnessから「experimental」の表示が外れ、旧Pythonハーネスへ戻すために文書化された退避手段は--legacy-harnessとなった。シェル承認のセキュリティを中心とした一連の修正版を経て、新しいハーネスが正式なデフォルトになった。重要なのはこの点であり、バージョン番号ではない。

この移行に伴い、機能の同等性も補われた。Unified Harnessは現在のGitブランチ、リポジトリの状態、最近のコミットをシステム指示へ追加するようになった。これまで暗黙に無視されていたhooksも、サブエージェント内で実行されるようになった。また、ローカルまたはセルフホスト型サーバーのように、APIキーの環境変数なしで構成された事業者も再び動作する。権限の強化も続いている。シェル承認が別のプログラムや環境へ拡大適用されることはなくなり、MCPツール呼び出しは権限システムを迂回せず従うようになった。また、smart approveが利用者のルールを無視しなくなった。

🔗 Vibe CLI 2.25.5リリースノート


ChatGPT plugins、複数アカウントの同時利用に対応

9月18日 — 複数アカウントへの対応が、ChatGPT pluginsの大部分で利用可能になった。個人アカウント、勤務先のアカウント、副次的なプロジェクトのアカウントを接続し、それぞれのコンテキストを同じ会話へ取り込めるようになった。アカウントはchatgpt.com/pluginsのpluginディレクトリから接続する。

OpenAI Developersアカウントの発表は、その1時間前にMax Stoiberが投稿したメッセージを再掲したものだ。plugin開発者側で対応することはない。この機能は変更なしで自動的に有効化される。さらに対応を進めたい場合は、MCP serverにprofileツールを追加することで、ChatGPTが接続済みアカウントにラベルを付けられるようになる。開発者に求められる具体的な作業はこれだけだ。この発表に付随するブログ記事や変更履歴の項目はなく、パリ時間18時10分に公開された。

想定される利用例は、勤務先やプロジェクトごとに自分のIDを分離している開発者だ。これまではコンテキストを切り替えるために、接続先を変更する必要があった。

🔗 Xでの複数アカウント対応の発表

🔗 Max Stoiberによる元のメッセージ


Genspark、PlusとProプランに週間クレジット残高を追加

9月18日 — Gensparkは、プラン価格を変更せず、週間クレジット残高を追加する形でPlusおよびProサブスクリプションの特典を変更した。この残高は、契約済みプランに加えて毎週付与され、プラットフォーム上のすべてのエージェントとツールをStandardモードで利用する際に使用できる。対象はSuper Agent、AI Chat、AI Image、AI Slides、AI Sheets、AI Docs、Deep Researchだ。

同じスレッドの2つ目のメッセージでは、AI ChatとAI Imageでの仕組みを詳しく説明している。既存契約者には現在の保有分に残高が追加され、2026年12月31日までは、Opusなどの主力モデルを含むAI ChatとAI Imageの全モデルをクレジット消費なしで利用できる。9月18日以降に契約する利用者は、AI ChatとAI Imageの基本モデル(core models)を無料で利用できる。Gensparkは、これらの変更がTeamプランとEnterpriseプランには適用されないことを明記し、条件の詳細についてヘルプセンターを案内している。

🔗 XでのGensparkの発表


Google Research:AlphaGenome Atlasが生み出した成果と、自己検証するシミュレーション

同じ日に公開された2件の研究には共通点がある。どちらも示されているのはモデルそのものではなく、第三者がモデルから引き出した成果、または検証ループがモデルに代わって確認する内容だ。

AlphaGenome Atlas、連携先による最初の成果を公開

9月17日 — ヒトDNAで起こり得る90億通りの置換を予測する地図、AlphaGenome Atlasの公開から9日後、Google DeepMindは3つの共同研究について詳述したスレッドを固定表示した。

研究機関・団体報告された成果
Stowers Institute2,500を超える調節モチーフをマッピング
University of Exeter / UK Biobank54,000人超を解析し、希少な遺伝的シグナルの検出数が22%超増加
Broad InstituteDNM1遺伝子の重要な変異を特定し、その後、研究室で確認および検証

調節モチーフとは、遺伝子の活動に対してスイッチや調光器のように働くDNA配列だ。Exeterで行われた研究では、代謝の健康に関連するタンパク質PLA2G7の量に影響を与える新たなバリアントも特定された。Broad Instituteの事例は、3件の中で最も具体的だ。原因不明の希少疾患において考えられる膨大な変異の一覧から、Atlasが該当する変異を示し、その後、実験室で確認する。ただし、全体はX上のスレッドにとどまり、詳細なブログ記事や関連論文は公開されていない。

🔗 XのAlphaGenome Atlasスレッド

生成された教育用シミュレーションを、Chrome 内でエージェントがテスト

9月17日 — Gal Elidan と Yael Haramaty は、生成 UI(generative UI)を教育用シミュレーションの作成に応用する実験を発表した。主導権は教師にある。教師がテーマを提示すると、Google が編集可能な学習目標一式を生成し、教師の承認を経て、それを基に生成が行われる。各インタラクティブ教材は難易度が徐々に上がるレベルに分かれ、ツールボックス、段階的なヒント、詳細な解答が用意されている。

最も興味深い要素は、自己修正ループだ。生成物は教育、仕組み、表示に関する基準で検証され、一部の評価はエージェントによって行われる。解答可能性のテストでは Chrome のインスタンスを開き、ユーザーと同じようにシミュレーションを操作するほか、スライダーを極端な値まで動かすといった敵対的な操作も試す。すべての基準を満たすまでループが繰り返されるため、生成時間は長くなる。Google は英語の STEM インタラクティブ教材を30点以上公開している。40点のコレクションは英国の教師による評価を受け、米国の教師12人を対象とした調査では平均8点(10点満点)を獲得した。

🔗 教育用インタラクティブ教材に関する Google Research の記事


Claude が30以上の生物学モデルを高速化し、タンパク質コンペティションに資金を提供

9月17日 — Anthropic は、Claude が生物学者の使用する30以上の open source モデルについて、推論を4週間弱で最適化した方法を説明する記事を公開した。対象は構造予測、タンパク質設計、タンパク質言語モデル、ゲノムモデルで、平均約4倍の高速化を達成した。すべてのコードが open source で公開されている。

技術的な中心は、時間計算量とメモリ使用量の両方が三次となる三角アテンションと三角乗算だ。Claude は、アテンションにおいて分野標準を2.7~2.9倍上回るカーネル群 FlashPairformer を作成した。「Big」と名付けられた低メモリモードでは、10,000 tokens を超える系を単一の GPU ノード上で高精度に折りたためる。これに対し、AlphaFold3 が予測した 40S リボソームは 7,663 tokens だった。手法上のポイントも同様に重要だ。この作業は、推論最適化の経験がなかった技術スタッフ2人によって監督された。

さらに Anthropic は Adaptyv Bio と共同で、5つの難題を対象とするタンパク質設計コンペティションを主催する。実験による検証対象となるコミュニティ由来の設計は5,000件以上で、Claude のクレジットは最大100万ドル、Modal が提供する計算資源は25万ドル相当に上る。

🔗 Anthropic の研究記事


オープンモデルと研究所:Muse が Mac に登場、Sakana がフロンティア研究グループを公開

Meta がエージェント Muse を macOS に展開

9月18日 — Meta は、9月17日夜から18日にかけて発表した Muse の Mac 版を展開する。@AIatMeta のアカウントは、毎回ユーザーの明示的な許可を得たうえで、そのコンピューターを直接操作できるパーソナルエージェントを紹介する投稿を共有した。用途として、ダウンロードフォルダーの整理、紛失したファイルの検索、メッセージやメモの要約という3つが挙げられている。

今回の発表は、Muse Spark 1.3 を搭載し、それまで iOS、Android、web、WhatsApp で提供されていた Muse の9月8日の公開に続くものだ。Mac への進出により、この種の製品は一段階先へ進む。エージェントは自身の sandbox 内ではなく、ユーザーの個人ファイル上で作業するようになる。Meta は料金、提供国、必要な構成のいずれも明らかにしておらず、Mac 固有のセキュリティ文書も公開に伴っていない。ai.meta.com のブログは7月27日以降、何も公開していない。

🔗 X での Meta の発表

Sakana AI が Frontier Intelligence Group とパラダイムに対する立場を公開

9月18日 — Sakana AI は、創業当初から拡大してきた社内集団 Frontier Intelligence Group(FIG)の存在を発表した。出発点は、Sakana AI の最高技術責任者で Transformer の発明者の一人でもある Llion Jones が投げかけた問いだ。データと計算量を増やし続けながら Transformer アーキテクチャを巨大化するだけで、AGI に到達できるのか。研究所の答えは「否」である。

情報として重要なのは、付随する研究一覧よりもこの点だ。記事は、現在のパラダイムが解決できていない欠点を列挙している。誤った情報を確信ありげに生成し、真に新しい状況に直面すると破綻し、大量のエネルギーを消費するモデルだ。そして、はるかに少ないデータから継続的に学習し、一般化する生物学的知能を対置している。同グループは、benchmark のスコアに対する圧力を受けずに失敗できる自由など、5つの原則を掲げる。紹介された研究のうち、NVIDIA と共同で進めた疎な Transformer は、単語の処理中、feed-forward 層のニューロンの95%以上が活動しないという測定結果を出発点としており、ICML 2026 に採択された TwELL というデータ形式を生み出した。

🔗 Frontier Intelligence Group に関する Sakana AI の記事


生成動画:Runway がクレジットの垣根を撤廃、Pika が初のアプリケーションを公開

Runway が web アプリケーションと Runway Dev の間でクレジットを共通化

9月18日 — Runway は2つの製品間の垣根を取り払う。購入したクレジットは、web アプリケーションと開発者向けの Runway Dev のどちらでも区別なく利用できるようになる。これまで両者は別々のクレジット残高と契約で運用され、プロジェクトをまたいだ利用量を一元的に追跡する場所もなかった。

この変更には4つの要点がある。中央で購入し、単一の請求書にまとめられる共通残高、web アプリケーションで処理フローを構築してから API として公開するまでの連続した経路、Applied AI Architects にアクセスできる Runway Dev 向けの強化されたサポート、そして管理者が web と Dev のワークスペース間でクレジットを移動できる刷新されたワークスペース分析画面だ。2026年12月31日まで、2つの販売特典が利用できる。新規企業には契約時にクレジットを10%追加し、Runway が示す換算では最低でも動画130分または画像12,000枚に相当する。既存顧客には、AI アプリケーションの製品責任者への紹介と引き換えに、5,000クレジットと Applied AI Architect の支援1日分を提供する。

🔗 統一料金体系に関する Runway の記事

Pika が製品写真から広告動画を作る Product Ad を公開

9月18日 — 新しいクリエイティブプラットフォームを発表した翌日、Pika はその最初のアプリケーションである Product Ad を公開した。このアプリケーションは、1枚以上の製品画像と文章による概要を組み合わせ、市場投入可能とされる動画を生成する。

生成パラメーター提示される値
選択可能な長さ6秒、15秒、30秒、60秒、2分
出力形式16:9
必要な入力製品画像と文章による概要
アクセスアカウント作成が必要

Pika は、前日に投稿したプラットフォーム刷新のメッセージを引用してこの発表を行っている。このため Product Ad は、単独の機能ではなく、今後登場する一連のアプリケーションの一つと位置付けられる。モデル名も料金も公表されていない。

🔗 X での Pika の発表


NVIDIA が大規模推論を測定する GenAI-Perf の後継、AIPerf を公開

9月18日 — NVIDIA は、生成推論向けの性能測定ツール AIPerf を発表した。GenAI-Perf の後継と位置付けられ、ゼロから書き直されている。出発点となる問題意識はなじみ深い。モデルの展開後、「これは速いのか」という問いに対し、curl コマンドや即席の負荷生成ツールで検証することが多いが、そこから得られる数値は信頼できない。

大きな違いはアーキテクチャにある。大半のツールが単一プロセスで動作し、同時実行数が増えると Python インタープリターのグローバルロックに突き当たるのに対し、AIPerf は処理を分散する。ワーカープロセスが負荷を生成し、独立したサービスが結果を処理し、全体を ZMQ で連携させる。目的は明確で、測定クライアント自体が決してボトルネックにならないようにすることだ。

報告される指標測定内容
Time to First Tokenリクエスト送信から最初の token までの遅延
Inter-Token Latency生成中の連続する2つの token 間の遅延
リクエストレイテンシ完全な応答が返るまでのエンドツーエンド時間
出力 token スループットすべてのリクエストで1秒間に生成される token 数
報告されるパーセンタイルp25, p50, p75, p90, p95, p99
エンドポイントの種類15以上

このツールは、Mooncake、Baseten、WEKA 形式の実際のトラフィックトレースも再生できる。記事が特に強調するのは分布の有用性だ。最初の token までの平均時間が健全に見えても、p99 が急増するサーバーは、集計値では見過ごされ、本番環境では機能しなくなる。

🔗 AIPerf に関する NVIDIA の記事


Mistral、システムへの不正アクセスの主張を否定

9月18日 — Mistral は 05時48分 UTC、同社システムへの不正アクセスの主張を受け、X のアカウントで短い声明を発表した。同社は、徹底した調査を実施したものの、この主張を裏付ける証拠は見つからず、システムが侵害されていないことを確認したとしている。

We are aware of a claim alleging unauthorized access to our systems. Following a thorough investigation, we have found no evidence to support this claim and can confirm that our systems have not been compromised.

🇯🇵 当社は、当社のシステムへの不正アクセスがあったとする主張を認識しています。徹底した調査の結果、この主張を裏付ける証拠は見つからず、当社のシステムが侵害されていないことを確認できます。@MistralAI の X 投稿

このメッセージは、主張を行った人物、その日付、内容のいずれも明らかにせず、調査範囲の詳細も示していない。ここで伝えているのは Mistral の立場のみであり、元の主張は確認できなかった。この声明は対象期間中、同アカウントで最も閲覧されたメッセージであり、同社サイトでは追加の発表は見つかっていない。


ニュース概要

  • Balyasny Asset Management、Claude Fable 5の管理方法を説明 — 約380億ドルを運用する同社は、合併アービトラージの初期分析を3~5日から1日未満へ短縮した。エージェントを約30分稼働させた後、人間がレビューする。🔗 出典
  • Codex CLI 0.155.1、推論要約を再びデフォルトで無効化 — 0.155.0の翌日に公開された単一修正のバージョン。デフォルトで有効にすると、対応していないプロバイダーにリクエストを拒否されていた。🔗 出典
  • Gemini CLI、更新のなかった1日を経てnightlyシリーズを再開 — 9月18日に4件の変更があり、更新時のOAuth refresh tokenの保持や、認証情報の削除の冪等化などが含まれる。stableとpreviewの各チャンネルに変更はない。🔗 出典
  • Kimi Code 2.0.1、起動とセッション再開を高速化 — 2.0.0から32時間後に公開された修正版。セッションインデックスの圧縮、長い履歴からの高速な再開、指定した環境変数からのAPIキー読み込み、ファイル監視数の制限が盛り込まれた。🔗 出典
  • Qwen Code、PlaywrightブラウザーSDKを備えたv0.24.1のpreview版へ — stable版ではない。Chromeのネイティブメッセージング中継を利用する統合ブラウザー操作と、コンテナ内でのサブエージェント実行を導入した。🔗 出典
  • Zed、修正わずか2件のstable版1.20.2を公開 — サードパーティー製モデルプロバイダーの決済エラーで、元のメッセージの代わりにZed Proへのアップグレード案内が表示されなくなった。また、同じ言語向けの2つのsnippet拡張機能が互いを無効化しなくなった。🔗 出典
  • Replit、Free Modeが「30倍」充実したと主張するも根拠は未公開 — リンクもchangelogもない単独の投稿で、何と比較した倍率なのかも明記されていない。測定結果ではなく、Replitによる主張として捉えるべきだ。🔗 出典
  • Copilotのインパクトダッシュボード、機能別にエンゲージメントを表示 — 28日間にわたる7つの利用面を対象とし、能動的なコードレビューと受動的なコードレビューを区別する。導入段階の対象集団も、今後は移動窓で算出される。🔗 出典
  • GitHub、6言語によるCopilot SDK入門ライブ配信を予定 — セッション、ツール、MCPサーバー、ストリーミングイベントを扱い、.NETとJavaに特化した回も用意される。前提知識は不要。🔗 出典
  • Runway Ruby、HDR変換時にalphaチャンネルを維持 — 素材をHDRへ変換する際、1段階で透明度を損なわず維持する。料金や必要なサブスクリプションプランは明記されていない。🔗 出典
  • MiniMax、シンガポールのSkillsFutureプログラム向けSingtel AI Passに参加 — MiniMax H3、MiniMax Agent、MiniMax Audioが、SWDAの支援を受けた200以上のAI講座に参加する対象学習者向けサービスへ加わる。金額や日程は示されていない。🔗 出典
  • VC-Attention、再学習なしでMiniMax-H3のattentionを高速化 — MiniMaxは、既存モデルに適用できる低精度attentionに関するNunchux AIの研究を紹介した。Nunchux AIはFlashAttention-4との比較で、B200では1.6倍、B300では1.5倍の性能を発表している。🔗 出典
  • Wan3.0、OpenArt Arenaの動画部門で2位 — Alibabaは30秒のショット、ネイティブaudio、あらゆる参照素材への対応を強調している。サードパーティーのランキングにおける順位の紹介であり、製品上の新機能はない。🔗 出典
  • Synthesia、米国本社をニューヨークに開設 — 製品、従業員数、投資日程を伴わない企業ニュース。Interactive Avatar APIの一般提供開始から2日後の発表となった。🔗 出典
  • Grok Imagine、全面的にAIで制作したパイロット版の費用を公開 — PJaccetturoのスタジオは、コンテスト番組「Odyssée」のパイロットエピソードに、9日間の作業、3,627枚の生成画像、3,043本の生成動画、生成費用2,677ドルを要したと発表した。🔗 出典
  • BananaMind 2 Pro、20分の1のtoken数でSmolLM2に迫る — 1,000億tokenとRTX 5070 Tiで学習した1億3,900万parameterのモデルが、HellaSwagで42.78%を記録した。2兆tokenで学習したSmolLM2-135Mは43.22%だった。🔗 出典
  • Optimum-Intel v2.2.0とOpenVINO GenAI 2026.4.0、Intelハードウェア向けexportを拡充 — Hugging FaceとIntelが、IntelのCPU、GPU、NPUに対応する共同バージョンを公開した。Mistral 3もexport可能になった。🔗 出典
  • AmberTrace Labs、検証可能な報酬によるRL下でOlmo 3の推論忠実度を測定 — 学習から除外したprobeでは、忠実度が0.238から0.262へ上昇した。低下ではなく好ましい変化であり、checkpointも公開されている。🔗 出典
  • Together AI、DeepSeek V4.1 Flashで初回tokenまでの時間が最短と主張 — 同社はウォームアップ済みリクエストについて第三者の測定結果を紹介しているが、手法も数値も公開していない。検証可能な結果ではなく、あくまで主張にとどまる。🔗 出典
  • Google Flow、ニューヨーク・ファッションウィークで2人のクリエイターを支援 — Jane WadeとSergio Hudsonと共同開発した専用ツールを活用した事例紹介であり、新しいモデルや提供開始された機能はない。🔗 出典
  • Google AI Educator Series、大学の単位取得対象に — この研修の講座で、大学の単位または継続教育の単位を取得できるようになった。🔗 出典

これが意味すること

この日が何より示しているのは、コーディングエージェントが閉じた製品であることをやめ、形式を共有し始めたということだ。プロジェクトにCLAUDE.mdがない場合、Claude CodeはAGENTS.mdを読み込む。つまりAnthropicは、別の場所で定義された指示ファイルを受け入れ、同じリポジトリを複数のツールで使えるようにした。同じ日に、AntigravityはMarkdownエージェントのsystem promptへ利用可能なサブエージェントのカタログを挿入し、Vibe CLIではついにサブエージェント内でhookが実行されるようになり、Codexは料金をサブエージェント別に内訳表示し、Qwen Codeはサブエージェントをコンテナに隔離した。エージェント間の委任は、設定上の約束にすぎなかった段階から、文書化、隔離、課金が必要な仕組みへと変わりつつある。Claude Codeはさらに、サブエージェントの結果に専用headerを付与し、返されたテキストが指示を装えないようにすることで、不信を前提とした設計を徹底している。

一方、terminalエージェント市場は目に見えてコモディティー化している。MiniMaxはTUI、headless mode、ACP、自由なモデル選択に対応したエージェントをMITライセンスで公開した。MistralはUnified Harnessから「実験的」という表示を外し、出口として--legacy-harnessを文書化した。Kimi Codeはメジャーバージョンから32時間後に性能修正版を公開している。4社が同じ入口を備えた同種の製品を提供するようになると、差別化の軸はライセンス、harnessの安定性、権限管理へ移る。そしてこの日の変更は、MistralでもAnthropicでも、まさにそこに集中している。

モデルでは、audioとvideoが記述的なものからagenticなものへ変わる動きが見られる。Qwen3.8-Omni-Flashは、動画を説明するのではなく、動画の中から答えを探そうとしている。質問を起点に処理することで、token消費を45.7%減らしながらOmniVideoBenchで4.4ポイント向上した。性能と効率が同じ方向へ進む、珍しい結果だ。対するGrok Voice Transcribe 2.0は、研究室での実演ではなく実際のトラフィックに焦点を当て、料金を据え置いたまま短文の誤り率を20.6%から6.8%へ下げた。両者の発表が示す方向性は一致している。価値はもはや対応するmodalitiesから生まれるのではなく、モデルが何を処理すると判断するかによって生まれる。

残る問題は、研究所が何を検証対象として受け入れるかだ。AnthropicはAccentureへ費用を払い、従業員としてのアクセス権を持つ評価者を自社内に配置する。同時に、そのような評価者が何へアクセスすべきか、調査結果をどう公開すべきか、誰が費用を負担すべきかについて、標準が存在しないことも認めている。これは制度であると同時に告白でもある。これに対し、この日最も確かな証拠は、第三者が再現できるものだった。AlphaGenome Atlasに関するExeterとStowers Instituteの結果、open sourceで公開された生体分子最適化コード、AmberTrace Labsのcheckpointである。その逆も同様にはっきり見える。Replitは根拠なく30倍という数字を掲げ、Together AIは手法を示さずランキングを紹介し、Mistralは誰も読むことのできなかった主張を否定している。この状況でAIPerfが登場したのは時宜を得ている。測定者自体が問題であることが多いと認めるところから始まる測定ツールだからだ。


出典