検索

AnthropicがClaude Opus 5.5をリリース、OpenAIがGPT-6 SolとLunaを投入、Claude CodeのProとTeam StandardがOpusへ移行

ai-powered-markdown-translator

gpt-5.6-solを使用してフランス語から日本語に翻訳された記事。

GitHub でプロジェクトを見る ↗

9月22日火曜日、AnthropicとOpenAIは2時間足らずの間隔で、それぞれフロンティアモデルをリリースした。Claude Opus 5より40%低いコストでFable 5.1と同等の水準とされるClaude Opus 5.5、そしてGPT-5.6のプロモーション価格に比べてAPI価格が半額となるGPT-6 SolとGPT-6 Lunaだ。両モデルファミリーは同日中にGitHub Copilot、Devin、Perplexityへ登場し、Claude Code 2.1.280ではProとTeam StandardプランのデフォルトモデルがSonnetからOpusへ切り替わった。Codex CLI 0.156.0、Anthropicにおける利用上限の引き上げ、NVIDIAによる一連の発表もこの日のニュースを彩った。


AnthropicがClaude 5.5ファミリー初のモデル、Claude Opus 5.5をリリース

9月22日 — Anthropicは、新たなClaude 5.5ファミリー初のモデルとなるClaude Opus 5.5claude-opus-5-5)をリリースした。Sonnet 5.5とHaiku 5.5も「今後数週間以内」に続く予定だ。本日からClaude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud、Microsoft Foundryで利用でき、Claude Codeでは有料プランのデフォルトモデルとなる。コンテキストウィンドウは100万トークン、最大出力は128,000トークンで、2026年6月までの信頼できる知識を備える。

Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.

It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.

🇯🇵 新しいClaude 5.5ファミリー初のモデル、Claude Opus 5.5をご紹介します。ほとんどのタスクでClaude Fable 5.1と同等の水準を発揮し、実行コストはOpus 5より40%低くなっています。@claudeaiがXに投稿

Anthropicによると、この40%という数値は典型的なワークロードを「デフォルト設定」で測定したもので、料金の引き下げとタスク当たりのトークン数削減を合わせたものだ。料金は20%引き下げられ、100万トークン当たり入力4ドル、出力20ドルとなった。Opus 5ではそれぞれ5ドルと25ドルだった。キャッシュ読み取り料金は60%引き下げられ、0.20ドルとなる。出力生成速度も30%以上向上し、研究プレビュー版の高速モード(fast mode)では、8ドルと40ドルの料金で最大2.5倍の速度を実現するとしている。

ベンチマーク(Anthropic公表値)Claude Opus 5.5Claude Fable 5.1GPT-6 Astra
Terminal-Bench 4.066,4 %55,8 %57,9 %
FrontierCode v1.1 Main54,4 %50,3 %53,3 %
GDPval-AA v2.1(Elo)184617351542
OSWorld 2.081,8 %80,7 %
AutomationBench40,0 %31,4 %41,4 %
Terminal-Bench-Science 0.158,7 %52,6 %64,6 %

Opus 5.5はエージェント型コーディング、オフィス業務、コンピューター操作で首位に立つが、AutomationBenchとTerminal-Bench-ScienceではGPT-6 Astraが依然として上回っている。Anthropicは、自社のスコアが本番環境のガードレールを有効にした状態で測定されたため、おそらく低めになっていると説明し、ベンチマーク上の差は「以前ほど信頼できる指標ではない」としている。実際の利用ではFable 5.1との差は、これらの数値が示すほど大きくないという。これは、サイバーセキュリティ、生物学、蒸留においてFable 5.1クラスのガードレールを備えてリリースされた初のOpusであり、ほとんどのサイバータスクはOpus 4.8へ切り替えられる。Anthropicは、このモデルが評価されている最中だと疑う傾向が強いことも認めている。

開発者が移行するには調整が必要だ。適応的思考は無効化できなくなり、ツール選択を強制すると(tool_choiceからanyまたはtoolへ)400エラーが返される。また、デフォルトの推論努力はmediumとなり、Opus 5のhighから変更された。2回のツール呼び出しの間に書かれたテキストは、今後は推論ブロック内に戻され、デフォルト表示では空になる。

🔗 Claude Opus 5.5の紹介 · API向けOpus 5.5の新機能


Claude Code 2.1.280がOpus 5.5を導入し、ProとTeam StandardをOpusへ移行

9月22日 — Claude Code 2.1.280は、Opus 5.5の発表から7分後となる16時38分(UTC)に公開された。2.1.279はリリースされておらず、CHANGELOGは9月19日の2.1.278から、114項目を含むこのバージョンへ直接進んでいる。

最も目立つ変更はモデルに関するものだ。Opus 5.5がデフォルトのOpusモデルとなり、ProとTeam StandardプランのデフォルトモデルはSonnetからOpusへ切り替わった。Max、Team Premium、EnterpriseではすでにOpusがデフォルトだった。/effortがモデルごとの設定になる前に保存された推論努力レベルは、Opus 5.5のような新しいモデルには適用されず、各モデルのデフォルト設定で開始される。一方、Opus 4.7、Opus 4.8、Fable 5では、選択した設定よりも起動時の推論努力が優先されることがなくなった。

セキュリティ面では、シンボリックリンクを経由する書き込みが、実際の書き込み先に基づいて判定されるようになった。許可要求には最終的な書き込み先が表示され、acceptEdits、許可ルール、自動モードでは、ツリー外へ到達する書き込みが承認されなくなった。安全性チェックから応答が返らない場合でも、自動モードが休止せずに動作を繰り返し拒否し続けることはなくなった。再試行の間隔が徐々に延び、10回連続で拒否されるとターンが停止する。予約済みの名前を模倣するプラグインマーケットプレイスは拒否されるようになり、CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH変数により、MCPツールの説明に設定されている2,048文字の上限を変更できる。

そのほかは使い勝手に関する変更だ。単独で押されたyまたはnキーではダイアログの確定や終了が行われなくなり、代わりにEnterとEscapeを使用する。ダイアログ内でCtrl+Cを2回押してもClaude Codeが終了しなくなった。プロンプトキャッシュを破壊する2件の不具合が修正され、VS Code拡張機能には入力して実行できる6つのコマンド(/status/sandbox/chrome/export/skills/plan)が追加された。

CHANGELOGの項目カテゴリー項目数
修正(Fixed69
改善(Improved21
追加(Added12
変更(Changed10
差し戻しと削除2
合計114

🔗 Claude Code v2.1.280

Opus 5.5を活用するための2つのガイド

9月22日 — Anthropicは、Addy Osmaniが執筆した2つのガイドも公開した。1つ目の「Opus 5.5でタスクにかかるコスト」(What a task costs on Opus 5.5)では、ターンごとに会話全体が再送信されるため、トークン単価が同じ2つのモデルでも、同じタスクにかかる費用が大きく異なる可能性があると説明している。公開料金に基づく例として、280万入力トークンの費用は、キャッシュなしでは11.20ドル、90%をキャッシュから読み取る場合は1.62ドルとなり、出力トークン1つの価格はキャッシュ読み取りの100倍だとしている。日常的には推論努力mediumを使い、mediumで行き詰まった場合はhighを使い、それでもOpus 5.5が同じ問題で2回失敗した場合はFable 5.1へ切り替えることを推奨している。ただし、推論努力やモデルを変更するとキャッシュは消去される。キャッシュの有効期間は、サブスクリプションでは1時間、APIキーではデフォルトで5分だ。44件のサポートチケットを使った社内ベンチマークでは、Opus 4.8から低推論努力のOpus 5.5へ切り替えることでコストが約18%削減され、/claude-api prompt-auditによってさらに9%削減された。

claude.devで公開された2つ目のガイドでは、まず「完了」が何を意味するかを定義し、その後はモデルに作業を任せるよう勧めている。また、モデルは回答前に常に推論するため、「よく考えて」のような指示は削除するよう勧めている。メッセージがガードレールによって検出された際に旧モデルへ切り替わる仕組みについても説明しており、この動作はアプリケーションまたは/configで設定できる。

🔗 Opus 5.5でタスクにかかるコスト · Opus 5.5を最大限に活用する方法


OpenAIがGPT-5.6のプロモーション価格より50%安いGPT-6 SolとGPT-6 Lunaをリリース

9月22日 — Anthropicの発表から2時間足らずで、OpenAIはGPT-6 SolGPT-6 Lunaを投入し、GPT-6ファミリーを拡充した。両モデルは、同社が依然として最高のモデルと位置付けるGPT-6 Astraと同様の手法で訓練されている。Solは複雑なコーディングとエージェント型ワークフロー、Lunaは大量処理を伴う対象の明確なタスクを目的としており、それぞれGPT-5.6 SolとGPT-5.6 Lunaの後継となる。

We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.

🇯🇵 キャッシュと推論の効率も向上させ、その削減分を直接お客様へ還元します。SolとLunaのAPI価格は、GPT-5.6のプロモーション価格と比べて50%低くなっています。@OpenAIがXに投稿

料金種別(100万トークン当たり)GPT-6 SolGPT-6 Luna記載されたGPT-5.6の料金(Sol / Luna)
入力2ドル0.10ドル4ドル / 0.20ドル
キャッシュ済み入力0.20ドル0.01ドル記載なし
出力10ドル0.50ドル20ドル / 1.20ドル

両モデルは1,050,000トークンのコンテキストを受け付け、最大128,000トークンを出力する。入力が272,000トークンを超える場合、リクエスト全体の料金は入力が2倍、出力が1.5倍になる。

OpenAIのベンチマークでは、SolはOpus 5.5より前のClaudeモデルと比較されている。Solは推論努力xhighでAutomationBenchのスコア33.2%を達成し、タスク当たりの費用は0.27ドルだった。これは、費用が11.1倍高い推論努力maxのClaude Opus 5(26.9%)と、推論努力lowのGPT-6 Astra(30.3%)を上回る。DeepSWE v1.1では68.8%に達し、Claude Fable 5の最高スコアまで1.1ポイントに迫りながら、タスク当たりの費用は約80%低い。Lunaは同ベンチマークで66.6%を記録した。競合モデルのスコアは公開レポートに基づく。アラインメント面では、不正行為を促すよう設計されたコーディングタスクで測定した欺瞞率が、GPT-5.6 Solの10.4%に対し、Solでは1.3%まで低下した。

両モデルは、Plus、Pro、Business、Enterprise、Eduの加入者向けにChatGPT WorkとCodexで段階的に提供される。Enterpriseでは管理者による有効化が必要だ。FreeとGoではデスクトップアプリでLunaを利用できるが、Chatではまだ両モデルとも提供されていない。APIではResponsesとChat Completionsを通じて、gpt-6-solおよびgpt-6-lunaという名前で利用できる。

🔗 GPT-6 SolとLunaの紹介

GPT-6向けに再設計されたプロンプトキャッシュ

9月22日 — リリースに合わせて公開された記事「GPT-6向けのより優れたプロンプトキャッシュ」では、同ファミリーの新しいキャッシュシステムについて詳しく説明している。デフォルトでキャッシュヒット率が向上し、30分以内に再利用された対象となる共有プレフィックスでは、キャッシュ済み入力トークンに最大90%の割引が適用される。キャッシュへの書き込み料金は入力料金の1.25倍だ。開発者向けには、Prompt Cachingダッシュボード、再利用するプレフィックスを固定する明示的なキャッシュブレークポイント(explicit cache breakpoints)、アプリケーション起動時のキャッシュ事前ウォームアップ(prewarming)、キャッシュを破壊せずに応答ごとの推論努力を変更できるconfiguration_updateが提供される。GitHubの最高製品責任者Mario Rodriguezは、再処理が必要なプロンプトトークンの割合を50%以上削減したと述べている。Strawberry Browserはコストが20%削減されたと発表した。

🔗 GPT-6向けのより優れたプロンプトキャッシュ


同日中に各種ツールへ登場:GitHub Copilot、Devin、Perplexity、Cursor、v0

9月22日 — Opus 5.5と2つの新しいGPT-6モデルの導入に時間はかからなかった。数時間のうちに、主要なコーディングおよび検索ツールが、独自の測定結果とともにこれらを追加した。

GitHub CopilotがOpus 5.5、GPT-6 Sol、GPT-6 Lunaを提供開始

GitHubは3モデルすべてをリリース当日に、VS Code、Visual Studio、Copilot CLI、コーディングエージェント、GitHub Copilotアプリ、github.com、GitHub Mobile、JetBrains、Xcode、Eclipseという10の環境へ追加した。すべてプロバイダーの公開料金に基づく従量課金となり、プレミアムリクエスト倍率は適用されない。従来のリクエスト単位の課金を継続している年間契約者には提供されない。自動選択(Auto)には、まだいずれのモデルも含まれていない。

Copilot内のモデル利用可能なプラン100万トークン当たりの入力・出力料金
Claude Opus 5.5Pro+、Max、Business、Enterprise(Proを除く)4ドルと20ドル
GPT-6 SolPro+、Max、Business、Enterprise2ドルと10ドル、272,000トークン超では4ドルと15ドル
GPT-6 LunaPro、Pro+、Max、Business、Enterprise0.10ドルと0.50ドル、272,000トークン超では0.20ドルと0.75ドル

このため、Copilot Proで利用できるGPT-6モデルはLunaだけであり、Opus 5.5は利用できない。GitHubの初期テストによると、Opus 5.5はClaude Opus 5と同水準でタスクを解決しながら、必要なステップ数とトークン数が大幅に少ない。GitHubはまた、Opus 5.5がテキスト出力に電子透かし(watermark)を付加すると報告しているが、GitHubによれば、意味、品質、可読性、トークン数、コストへの影響はない。

🔗 GitHub CopilotのClaude Opus 5.5 · GitHub CopilotのGPT-6 SolとGPT-6 Luna

DevinがFrontierCode 1.1で新モデルを順位付け

CognitionはClaude Opus 5.5のリリース当日にDevin DesktopとDevin CLIで利用可能にし、FrontierCode 1.1ベンチマークのExtended版で65.3%を記録して首位に位置付けた。Claude Fable 5(64.9%)とGPT-6 Astra(64.5%)を上回り、タスク当たりのコストはFable 5の10分の1未満となっている。この65.3%は、Main版で測定されAnthropicが発表した54.4%とは比較できない。その47分後にはGPT-6 SolとLunaも登場した。SolはGPT-5.6 Solと同等の成績(60.7%対60.6%)を、タスク当たりのコストを61%抑え、読み込むコンテキストも約17%少ない状態で達成した。Luna(56.1%)はタスク当たり0.10ドルを下回り、Cognitionによればランキングで最も安価なモデルとなった。

その前日の9月21日午後(太平洋時間)、CognitionはGrok 4.7を利用可能にし、Grok 4.6(61.3%)を下回る59.4%と評価していた。Java、Go、Rubyの難しいバックエンドタスクでは堅実だが、範囲を広げすぎる傾向(over-scope)があり、タスクで求められるよりも大きな差分を生成する。続いてv0もGrok 4.7を利用可能にし、9月27日まで40%割引すると発表したが、何が割引対象かは明らかにしていない。

評価対象モデルFrontierCode 1.1 Extendedスコア
Claude Opus 5.565.3%
Claude Fable 564.9%
GPT-6 Astra64.5%
Claude Fable 5.163.6%
SWE-262.5%
Grok 4.661.3%
GPT-6 Sol60.7%
GPT-5.6 Sol60.6%
Grok 4.759.4%
Gemini 3.7 Flash56.3%
GPT-6 Luna56.1%

太字は9月21日と22日にDevinへ追加されたモデル。スコアはCognitionがExtended版で発表したもの。

🔗 DevinのOpus 5.5 · DevinのGPT-6 SolとLuna · DevinのGrok 4.7 · v0のGrok 4.7

Perplexity:ComputerにOpus 5.5とGPT-6 Sol、Agent APIに4モデル

Perplexityは、マルチステップエージェントComputerへ9月17日に導入した推論努力スライダーに、この2つの新モデルを組み込んだ。Claude Opus 5.5はStandard段階のモデルとなる。Perplexity独自のコスト・性能ベンチマークWANDRでは、タスク当たり4.13ドルで0.610を記録し、Claude Fable 5.1をわずかに上回りながら、タスク当たりのコストを67.6%抑えている。Perplexityアプリでも利用できるGPT-6 Solは、Light段階のデフォルト選択肢となった。どちらの発表も、対象となるプランや置き換えられたモデルについては明記していない。

開発者向けには、2026年9月とのみ記されたAPIの変更履歴で、Agent APIにopenai/gpt-6-solopenai/gpt-6-lunaanthropic/claude-opus-5-5xai/grok-4.7が追加されたが、この項目に料金の記載はない。

🔗 ComputerのOpus 5.5 · ComputerのGPT-6 Sol · Perplexity APIの変更履歴

Cursorとv0がOpus 5.5を提供開始

CursorはこれをCursorBenchの新たな最高性能モデルとして紹介している。最大推論努力(Max)で57.8%を記録し、タスク当たりのコストはOpus 5より40%低い。数値はAnthropicによるもので、推論努力レベルも明記されている。v0は料金の詳細を示さずに利用可能にした。

🔗 X上のCursor · X上のv0


Anthropicが5時間制限を引き上げ、10月22日まで使えるリセットを提供

9月22日 — AnthropicはOpus 5.5の登場に合わせ、Pro、Max、Team、およびライセンス単位(seat-based)のEnterpriseプランについて、5時間単位で算出される制限を引き上げた。@ClaudeDevsによれば、Claude Codeの5時間セッション制限は同日から20%増加する。さらに加入者には、任意のタイミングで実行できる制限リセットが1回分付与される。Pro、Max、Teamでは設定 → 使用量(Settings → Usage)から利用でき、使用期限は10月22日。

さらに価格面の効果もある。Claude CodeではOpus 5.5が有料プランのデフォルトモデルとなり、Opus 5より安価なため、5時間および週間制限で「25%多く」利用できる。同日公開されたコストガイドによると、値下げはキャッシュ済みコンテキストを含む利用制限に反映されるが、キャッシュ読み取り料金の追加値下げはAPIのみに適用される。

🔗 X上の@ClaudeDevs · リセットと利用制限


Codex CLI 0.156.0で音声機能とworktreeがデフォルト有効に

9月22日 — 19時51分(UTC)に公開されたCodex CLI 0.156.0は、9月18日の0.155.1以来初の安定版であり、完全な変更履歴には0.155.0以降の525件のpull requestが記載されている。0.155ではまだ実験的だった2つの機能が一般提供された。LinuxとWindows向けの内蔵オーディオエンジンを備えた音声会話と、エージェントのコマンドセンターからタスクをステータスで絞り込み、セッションとして開けるworktreeである。

バージョンの新機能コマンドまたは設定Codex CLIでの先行導入
音声会話がデフォルトで有効F8、/voice settings実験的な/voice(0.155.0、9月17日)
Worktreeがデフォルトで有効エージェントのコマンドセンター0.154.0(9月9日)以降は実験的機能
全画面インターフェース/tui、次回起動時なし
分析ダッシュボード/usageデスクトップアプリの分析機能(9月18日)
ローカルバックグラウンドサーバー/daemon--no-daemonなし

全画面インターフェースでは、文字起こし内の検索、マウスによる選択、右クリックでのコピーが可能になった。内蔵テーマも6種類追加され、回答内にMermaid図と数式が直接表示される。このバージョンでは、サンドボックス分離に関する複数の脆弱性も修正された。具体的には、Windowsでの受信トラフィック、app-serverのUnix socket、macOSで変更可能なfcntlに関する問題である。リリースノートにGPT-6への言及はないが、SolとLunaは/modelまたは--modelで選択できる。

🔗 Codex CLI 0.156.0


ターミナル向けコーディングエージェント:Vibe CLI、Qwen Code、Amp

Vibe CLI 2.25.6と2.25.7

9月22日 — Mistralは、6件の修正を含むVibe CLI 2.25.7を公開した。その前日の2.25.6はCHANGELOG上では9月21日付だが、GitHub releaseとしては公開されておらず、主要な新機能(追加1件、変更3件、修正17件)はそちらに含まれている。--experimental-harnessオプションを使うと、現在のモデルが画像を読み取れない場合でも画像を添付できる。同じプロバイダーのvision対応モデルがエージェント向けに画像を説明し、config.tomlvision_modelキーで別のモデルを指定できる。この方法で説明された画面キャプチャには、エージェントが画面を再構築できるようレイアウト契約(layout contract)も含まれる。

セキュリティ面では、承認なしで実行されるGitコマンドが強化された。安全なfetchはGit設定のパス上書きを継承しなくなり、信頼されていないcheckoutからSSHクライアントやhookを選択できなくなった。また、読み取り専用コマンドに紛れ込ませた危険なオプションやshellリダイレクトには承認が必要となる。さらに2.25.7では、無料アカウントを含むVibe APIキーとworkspaceキーで/teleportを利用できるようになった。

🔗 Vibe CLI v2.25.7 · Vibe CLIのCHANGELOG

Qwen Code v0.24.4

9月22日 — v0.24.3の翌日、Qwen Codeは破壊的変更なしで、13件の機能と15件の修正を含むv0.24.4へ更新された。qwen serveサーバーから、対象マシンにdaemonをインストールせず、SSH経由でリモートworkspaceを開けるようになった。また、v0.24.0でLinuxに導入されたbubblewrap(bwrap)サンドボックスが、各ツールの実行単位で適用されるようになった。Web Shellでは、認証済みサーバーがloopback以外で待ち受けている場合、QRコードによるペアリングがデフォルトで利用可能になった。招待は1回限りで、60秒後に期限切れとなるほか、編集差分が承認前に表示される。Javaでは、管理対象のツール実行がJDBC経由でデータベースに保持される。同日には、2件の修正のみを含むv0.24.5-preview.0も公開された。

🔗 Qwen Code v0.24.4

Amp runnerがGit worktreeを作成

9月22日 — 1つのrunnerで複数のディレクトリを扱えるようにしてから5日後、AmpはrunnerにGit worktreeの作成機能を追加した。選択画面では、提供されている各リポジトリにNew Worktreeオプションが表示される。Tabを押してbranch名を付けると、リポジトリの隣に作成された新しいcheckout(~/code/ampから~/code/amp-fix-flaky-login-testが作られる)でスレッドが開始され、メインのcheckoutには影響しない。その後、専用アクションでスレッドをアーカイブし、worktreeとbranchを削除できる。runnerは、ampcode.comで設定されたシークレットと環境変数(Secrets & Env Vars)も受け取れる。デフォルトでは無効だが、--amp-envで有効にできる。変更した変数は、再起動やSSHなしで次のスレッドから反映される。

🔗 1つのrunnerと多数のworktree


第三者評価:OpenAIが規則を策定、英国AISIが結果を公開

9月22日 — 同日、研究所外の組織によるモデル評価について、2件の発表が行われた。

OpenAI:独立評価機関向けの4つの優先分野と7つの原則

Lama Ahmad名義の記事で、OpenAIは民間または非営利の独立評価機関に対し、モデルの学習、評価、展開について詳細なアクセスを提供すると表明した。これにより、評価機関はOpenAIの前提に異議を唱え、見落とされたリスクを特定し、安全対策を独自に判断できる。政府との取り組みとは別のこうした評価は、数週間から数か月かけて行われ、特定のリリースとは連動しない。

優先分野調査対象
安全性ケース(safety cases学習から外部展開まで、モデルのリスクが管理されていることを示す論拠
重要な安全対策jailbreakへの耐性、サイバー防御、ミスアラインメント監視、思考連鎖の監視に関する信頼性
Preparedness Framework能力テスト(化学・生物学的リスク、サイバーセキュリティ、AIの自己改善)とアラインメント
ミスアラインメント事案重大事案に対する独立調査。7月のHugging Face事案が例として挙げられている

全体を規定する原則は7つある。合意された範囲と主張の事前登録、範囲に応じたアクセス、透明な手法、専門性と独立性(利益相反の開示)、安全性と機密保持、公開前に修正期間を設けた実行可能な調査結果、そして編集による非公開化を管理する責任ある公開である。OpenAIは複数の組織と協議しているとしているが、組織名は明かしていない。

🔗 効果的な第三者評価のための優先事項と原則

英国AI Security InstituteがEvalEvalで検証済み結果を公開

EvalEval CoalitionはHugging Faceのブログで、先進的なAIのリスク研究を担う英国の公的機関UK AI Security Institute(AISI)が、EvalEvalのオープンプラットフォームEvaluation Cardsで、評価結果をその背景や設定とともに、共通形式Every Eval Everで公開するようになったと発表した。最初の公開では、5つのベンチマーク(HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro、Terminal-Bench 2.0)を6つのモデル(Claude Opus 4、4.5、4.6、GPT-5、GPT-5.2、GPT-5.4)で測定した結果に加え、2件のサイバー評価が対象となっている。目的は再現性の確保である。設定とともに公開された検証済みの基準があれば、一見比較可能に見える2つのスコアがなぜ異なるのかを理解しやすくなる。

🔗 UK AISIとEvalEvalがベンチマーク結果を再現可能にする方法


ChatGPTで米国のExperianクレジットスコアを追跡可能に

9月21日 — @ChatGPTアカウントが9月21日に発表した新機能により、ChatGPT内でクレジットスコアを追跡できるようになった。米国のPlusおよびPro加入者は、ファイナンス画面からExperianの信用報告書とVantageScore 3.0スコアを接続し、スコアに影響する要因について個別の説明を受け、スコアが変化した際に通知を受け取れる。この機能はウェブ版と、最新版のiOSおよびAndroidアプリで利用できる。

OpenAIは具体的な用途として、賃貸申請に信用状況が与える影響の把握、優先的に返済すべきクレジットカードの選択、長期的な信用の構築、信用状況と予算が自動車リースや住宅ローンに与える影響の確認を挙げている。この機能は、米国のPro加入者向けに5月からプレビュー提供されている、Plaidによる銀行口座接続を含む個人向け金融ツールを補完するものとなる。

🔗 X上のChatGPTによる発表


Google:ColabがGoogle AIプランに追加、Gemini APIがGemini 2.5を制限

ColabがGoogle AIプランに追加

9月22日 — Google AI加入者は、より高速なアクセラレーターや高性能なマシンへの優先アクセスなど、Colabのプレミアム特典を利用できるようになる。Ultra加入者はさらに、中断のないバックグラウンド実行とPremium GPUへのアクセスが解放され、タブを開いたままにしなくても長時間の学習を完了できる。記事では「本日から」の提供開始としているが、特典はColabを利用できる国で今後数週間かけて導入されるとも説明している。ColabのFAQによると、Google AIプランとColab ProまたはPro+サブスクリプションの計算ユニットは、同じ残高に加算される。ストレージのみのGoogle Oneプランと無料トライアルは対象外となる。記事にもFAQにも、各プランへ付与されるユニット数の記載はない。

🔗 ColabがGoogle AIプランの一部に · ColabのFAQ

Gemini APIがGemini 2.5へのアクセスを制限

9月18日 — Gemini APIのリリースノートは、9月18日付の注記でGemini 2.5モデルへのアクセスを、過去にこれらのモデルを積極的に利用していたユーザーに限定した。信頼性の高い性能を保証し、容量を確保することが目的である。これらのモデルは非推奨になったわけではなく、追って通知があるまで引き続き提供される。廃止予定ページでは、gemini-2.5-progemini-2.5-flashgemini-2.5-flash-liteに提供終了日は示されておらず、2026年10月2日に終了するのはgemini-2.5-flash-imageのみである。Googleはすべての新規プロジェクトに対し、Gemini 3.5 Flash-LiteまたはGemini 3.8 Flashの利用を案内している。

🔗 Gemini APIのリリースノート · Geminiの廃止予定ページ


Hugging Face、Transformersでllama.cppのGGUFを実行可能に

9月22日 — Hugging Faceは、llama.cppの量子化形式であるGGUFファイルをTransformersで効率的に実行できるようにした。ファイルをfrom_pretrained(パラメーターgguf_file)に渡すだけで、重みはメモリ内で圧縮されたまま維持され、計算はggmlのMetalカーネルを使用する。これらはライブラリkernelsによってHubから配布される。その後、コマンドtransformers serveを使用すると、OpenAI互換APIを通じてモデルを利用できる。

当初の対応範囲は限定的だ。Apple Silicon搭載Macのみを対象とし、アーキテクチャはdense版とMoE版のQwen3.5(および互換性のあるQwen3.8チェックポイント)に限られ、一度に処理できる会話は1件のみで、ブランチmainからインストールする必要がある。4つのカーネルはggml由来で、5つ目はHugging Faceが開発したものであり、エキスパートのルーティングを処理する。MacBook Pro M2 Maxでは、Hugging FaceはTransformersがllama.cppに「近い」と評価しているが、数値はグラフでのみ示され、測定条件も同一ではない(一方はプリフィルを含み、他方はデコードのみ)。チームは、効率的なローカル推論には引き続きllama.cppを推奨している。利点は別のところにあり、通常のPyTorchツールでGGUFを操作したり、逆量子化したGGUFを出発点としてファインチューニングしたりできることだ。

GGUFバリアント(Qwen3.5-4B、Unsloth)ファイルサイズ示されているトレードオフ
BF168,42 Go非量子化リファレンス
Q6_K3,53 Goより高い精度
Q5_K_M3,14 Goサイズと精度のバランス
Q4_K_M2,74 Goローカル利用で推奨される出発点

🔗 Transformersがllama.cppの量子化モデルを実行可能に


Kimi:Amazon BedrockでのK3提供と名称変更されたブラウザー拡張機能

Kimi K3がAmazon Bedrockに登場

9月22日 — Moonshot AIはKimi K3がAmazon Bedrockで利用可能になったと発表したが、AWSの製品ページでは提供開始日が9月18日となっている。7月末に公開され、100万tokensのコンテキストを備えるオープンウェイトモデルで、Bedrockのアクセス制御、暗号化、監査機能を利用できる。米国およびグローバルのクロスリージョン推論(cross-Region inference)として提供され(us.moonshotai.kimi-k3global.moonshotai.kimi-k3)、明示的キャッシュはキャッシュポイントごとに1,024 tokensから利用でき、少なくとも30分間維持される。Priorityレベル(料金は1.75倍)とFlexレベル(0.5倍)は、基本料金に対して適用される。

推論オプション(Standardレベル)100万tokens当たりの入力料金100万tokens当たりの出力料金キャッシュ読み取り
グローバル推論3,00ドル15,00ドル0,30ドル
米国推論3,30ドル16,50ドル0,33ドル

🔗 Amazon BedrockのKimi K3製品ページ · BedrockでのKimi K3提供に関するX上の発表

Kimi WebBridgeがKimi Browser Extensionに改称

9月22日 — 6月にKimi Workとともに登場したブラウザー拡張機能が名称を変更し、サイドバーを追加した。ここからKimiと対話し、ウェブサイトの閲覧、フォームへの入力、タスクの完遂を依頼できる。反復的なタスクは一度記録するとskillとして保存され、Kimiが次回以降に再利用する。また、この拡張機能はウェブページをコマンドに分解する。ローカルサービスがChrome DevTools Protocolを介して、すでに開いているChromeまたはEdgeを操作する。Moonshotは、ログインセッションとページ内容がデバイス外に送信されることはないとしている。Kimiアカウントが必要なのはサイドバーのみだ。

🔗 Kimi Browser Extension · Kimi Browser Extensionに関するX上の発表


SpaceXAI:Grok Botがサポートチケットの急増に対応

9月22日 — SpaceXAIは、社内ツール上で動作するエージェントGrok Botを中心に再構築した自社カスタマーサポートについて、導入事例を公開した。8月14日にCursorがSpaceXAIに加わって以降、両社のサポートチームは統合され、はるかに多くの製品を担当している。記事によると、採用を一切増やさずにチケット件数が175%増加した。そうでなければ200人を採用する必要があった可能性があるという。ただし、測定期間は明記されていない。

導入は段階的に進められた。チケット管理にはPlain、インシデント管理にはLinearを接続し、当初Grok Botの利用は内部メモに限定され、書き込み操作はすべて人間が承認していた。その後、簡単なチケットを処理するようになり、初日の終わりには顧客へ直接回答するようになった。現在では、受信したすべてのチケットについて事前調査を行い、エンジニアリングチーム向けに問題を動画で再現し、毎日20,000件を超える製品フィードバックを要約している。

SpaceXAIが公表した指標公表値
サポートチケットの増加+175 %
回避できた採用人数(推定)200
従来型ツールの解決1件当たりのコスト1~4ドル
Grok Botによるチケット1件当たりの最低コスト0,20~0,30ドル
人間を介さず処理された返金99 %

🔗 SpaceXAIがGrok Botを活用してカスタマーサポートを拡大する方法


Cognition:ラテンアメリカへの展開とDevinの新しいリリースノート

Cognition、サンパウロを拠点にラテンアメリカへ進出

9月22日 — Cognitionのラテンアメリカチームは記事の中で、前週にサンパウロ美術館MASPで行った発表を振り返った。同社はサンパウロを拠点とするチームを設け、この地域で事業を拡大し、顧客先に配置されるエンジニア(deployed engineers)などを採用する。すでにItaú、Nubank、Santander、Natura、EBANXなどの顧客基盤がある。Cognitionによると、Itaúではテクノロジーチームの75%超がDevinを利用しており、Devinは300,000件を超えるリポジトリを文書化し、脆弱性の約70%を自動的に解決したという。Nubankでは、数百万行からなるモノリスの移行が数年から数週間に短縮され、コストも20分の1未満になったとされる。これらはCognitionが公表した成果であり、第三者の情報源はない。

🔗 ラテンアメリカにおけるソフトウェアエンジニアリングの未来の構築

9月21日付Devinリリースノート

9月21日 — 前号の発行後に公開されたDevinのリリースノートでは、9月10日に登場したCognitionのコードモデルSWE-2が、エージェント選択画面でリサーチプレビュー(research preview)として利用可能になった。セッションの開始時または進行中にSWE-2と作業量(Medium、High、Maxのいずれか)を選択でき、Slackでは!swe2で同じ設定を行える。Microsoft 365のMCPサーバー(MailとContacts、Calendar、To Do、OneDriveとSharePoint、Teams、Entra IDディレクトリ)がMCPマーケットプレイスに加わり、OAuthのスコープが設定されていない場合はデフォルトで読み取り専用となる。Devin ReviewはBitbucket Data Centerに対応し、プラグインの上限は20 Mioおよび2,500ファイルに拡大された。また、独立型CLIのnpx devin-reviewは廃止され、すでにインストール済みのものも動作しなくなった。

🔗 9月21日付Devinリリースノート


GensparkのプレゼンテーションベンチマークがFireworks AIのSIIインデックスに採用

9月22日 — Fireworks AIはSpecialized Intelligence Index(SII)を発表した。これは、実務を対象とする20のベンチマークを7分野(セキュリティ、法務、金融、カスタマーサポート、ソフトウェア、医療、生産性)に分類したインデックスで、実務家によって構築されている。参加する12社にはHarvey、Doximity、Mercor、Sierra、Decagon、Gensparkが含まれる。生産性カテゴリーで唯一のベンチマークであるGenspark Slides Benchmarkでは、Genspark Slidesエージェントのハーネス上で11のモデルに200件の実際のタスクに基づくプレゼンテーションを作成させ、Gensparkの社内評価システムが採点する。Gensparkは、自社モデルGen-1 Slidesの入力料金がClaude Opus 5のおよそ17分の1だという主張も改めて示している。

評価対象モデルSIIインデックスのスコア9月10日付Genspark記事のスコアインデックス上のプレゼンテーション当たりのコスト
Claude Fable 5.183,6 %表にはなく、本文ではGen-1 Slidesを0,003上回る非表示
Gen-1 Slides82,2 %0,8210,44ドル
Claude Opus 581,0 %0,8104,16ドル
Claude Fable 579,9 %表には記載なし非表示
GPT-6 Astra78,0 %表には記載なし非表示
Kimi K372,6 %0,7232,00ドル
GPT-5.6 Sol67,0 %0,6682,01ドル
MiniMax M356,1 %0,5630,34ドル

🔗 Specialized Intelligence Index · Gensparkの発表


Runway、AIに習熟したクリエイター向け採用プラットフォームDIFFUSEを開始

9月22日 — RunwayはDIFFUSE(diffuse.runway.com)を開始した。これは、ブランド、代理店、スタジオが生成AIツールに習熟した人材(AI-native talent)を探し、連絡し、採用できるオープンプラットフォームだ。クリエイター、フリーランサー、小規模スタジオ、制作会社はプロフィールを作成し、ポートフォリオを掲載できる。料金は公表されていない。

Runwayは、約400社が公開した1,000件を超えるクリエイティブ職の求人を対象とした独自調査を根拠としている。そのうち17%がAIスキルまたは生成ツールに言及しており、同社によればRunwayは他を大きく引き離して最も需要の高い動画ツールだった。Runwayは、AIがクリエイティブ職の一部を置き換えていることを認める一方、これらのツールを中心とする新たなクリエイティブ人材層が形成され、その需要が加速していると主張している。

🔗 DIFFUSEの紹介 · X上のRunway


開発者向けNVIDIA:Isaac ROS 5.0、DLSS 5、RTX Mega Geometry 2.0

Isaac ROS 5.0はエージェントに注力

9月22日 — トロントで開催されたROSConで発表されたIsaac ROS 5.0は、NVIDIAによる無料かつオープンソースのGPU高速化ROSパッケージ集で、ROS LyricalとUbuntu 24.04をサポートし、Jetson Orin NanoからJetson ThorまでJetson製品群全体に対応する。主な新機能はエージェントを対象としている。インストールと操作に使用できる再利用可能なIsaac skills、エージェントが読めるドキュメント、エージェントによるステレオビジョンモデルFoundationStereoの各自のカメラ向けファインチューニングを支援するskill、そして自律的なピックアンドプレース(pick and place)skillが用意されている。FoundationPoseには、物体の位置と向きを最大5.5倍高速に追跡する推論ライブラリが追加されたが、NVIDIAは比較対象を明示していない。

🔗 Isaac ROS 5.0

スタジオ向けにDLSS 5の詳細を公開、RTX Mega Geometry 2.0も提供開始

9月22日 — すでにNBA 2K27で利用可能なDLSS 5について、開発者向けの詳細が公開された。3Dガイド付きニューラルレンダリング(3D-Guided Neural Rendering)はパイプラインの最終段階に組み込まれ、ゲームエンジンがレンダリングした画像を起点として、色とモーションベクトルを利用し、フレームごとに照明とマテリアルの詳細を決定論的に追加する。単一のGeForce RTX 50シリーズで最大4Kに対応する。スタジオ側は構造強度(Structure Intensity)とトーン強度(Tone Intensity)を調整でき、AIによるセマンティックマスキングも利用できる。同じ記事では、ACEに6億パラメーターの2つのモデル、Nemotron Speech 3.5 Streaming(音声認識)とQwen3 TTS(音声合成)が追加されたほか、RTX Kit 2026.3が公開され、非常に高密度なメッシュ向けの連続的な詳細度によるクラスターストリーミングを備えたRTX Mega Geometry 2.0が利用可能になった。

🔗 ゲーム開発者向けの新機能


NVIDIAと推論:マルチGPU対応Dynamo-TritonとB200上のコンフィデンシャルコンピューティング

Dynamo-Triton 26.07、8基のGPUに分散したモデルを提供

9月21日 — NVIDIAは、複数のGPUに分散したTensorRTモデルを通常のモデルと同じように提供する方法を紹介した。TensorRT 11.0以降で完全にサポートされるTensorRTのマルチGPU推論(multi-device inference)はNCCLを利用する。旧Triton Inference ServerであるDynamo-Triton 26.07はTensorRTバックエンドでこれを有効化し、アプリケーションは単一のgRPCエンドポイントを呼び出すだけでよい。Cosmos 3 Nanoによる動画生成(1280×720、189フレーム、35ステップ)では、エンドツーエンドのレイテンシがGPU 1基の156,6秒から8基の34,2秒へと短縮され、4,58分の1になった。NVIDIAは、このテストでは同時リクエスト時のスループットも動画1本当たりのコストも測定していないと説明している。

テスト構成GPU数エンドツーエンドの平均レイテンシ
単一GPU1156,595 s
CP2287,999 s
CP4453,093 s
CP8834,183 s

🔗 Dynamo-TritonとマルチGPU TensorRT

B200上のコンフィデンシャル推論、スループットの96%超を維持

9月22日 — NVIDIAは、暗号化メモリを備えた仮想マシン内でワークロードを実行し、コンフィデンシャルGPUと暗号化されたNVLinkを使用するBlackwell上のConfidential Computingについて、その性能コストを測定した。DGX B200(GPU 8基、Intel TDXプラットフォーム)でTensorRT LLMを使用し、DeepSeek-R1をNVFP4で提供した場合、入力32,000 tokens、出力1,000 tokens、同時リクエスト数1~16という条件で、コンフィデンシャルモードはスループットの96,1~98,2%を維持し、出力token当たりの平均時間の増加はわずか1,2~4,3%だった。フレームワークには3つの変更が必要だった。一部の転送で固定メモリではなくページング可能メモリを使用すること、カーネルのオートチューナーにGPU内部カウンターを使用すること、そしてこのモードではNVLink SHARPマルチキャストが利用できないため別の通信アルゴリズムを採用することだ。ワークロードはオーバーヘッドが明確に現れるように選定された。NVIDIAは、利用者自身のワークロードで両モードを比較することを推奨している。

🔗 コンフィデンシャルコンピューティングとTensorRT LLM


短報

  • Zed、Deltaを準備 — Zedは、エージェントを備えたマルチプレイヤー・コーディング環境Deltaについて、スレッドをまとめるための色分けと、コンテキストが自動圧縮されるまでの残量を示すゲージを今週導入すると発表したが、まだ利用できない。🔗 出典
  • ReplitとHandshake — ReplitはHandshakeのAI Skills Studioの創設パートナーとなった。45分間の無料ミッションを3つ完了すると、Handshakeプロフィールに掲載されるプロジェクトを作成できる。ほかのパートナーにはOpenAI(10ミッション)、Google、Figma、Vercelが含まれる。🔗 出典
  • oMLXがHugging Faceに参加 — AppleのMLXエコシステムに属するプロジェクトoMLXの開発者Jun KimがHugging Faceに参加する。プロジェクトはApache 2.0のままで、引き続き本人が指揮し、保守と資金提供を受けるようになる。まずはTransformersモデルからMLXへの移行高速化を目指す。🔗 出典
  • SnowLLM — コミュニティ投稿によると、Ryzen AI MaxのGPU向けに開発されたこのApache-2.0推論エンジン(カーネルはバイナリで提供)は、開発者の測定でllama.cppよりデコードが最大2.3倍高速(投機的デコードなしでは1.9倍)、プリフィルが最大9.4倍高速だという。🔗 出典
  • DecisionBenchとBosun v3.1 — Hanno LabsがDecisionBench 1.0(43タスク、28分野)と、Qwen3を基盤とする2つのオープンウェイト意思決定モデル(6億および17億パラメータ)を公開した。独自の応用評価スイートではそれぞれ83.20%と87.29%を記録したが、推論部門ではJevが上回っている。🔗 出典
  • 6億パラメータのMoshi — ある開発者が、Qwen3-0.6B-Baseを基盤とする全二重音声モデルへの挑戦を報告した。B200上での試行1回当たりの学習費用は2~15ドルで、テキストは収束したものの音声は不明瞭なままであり、細粒度の音響codebookに問題が特定された。プロジェクトは休止中で、ウェイトは公開されていない。🔗 出典
  • Together AIとGLM-5.2 — 9月18日付で公開され、21日にXへ再投稿された事例研究で、Together AIは、あるフィンテック企業が56基のB200を使い、256KコンテキストのGLM-5.2上でコーディングエージェントを提供していると説明した。待ち時間が1~3分に達するキュー障害は、ルーティングの再設定によって同日中に解消された。🔗 出典
  • Gemini CLI — 9月19日以来初めて新しいコードを含む9月22日版nightlyでは、プロキシ経由でVertex AIを使用した際に発生するHttpsProxyAgent is not a constructorのクラッシュが修正され、ACPモードでは権限要求より前にtool_callの更新が送信されるようになった。🔗 出典
  • Google Flow — 公式アカウントは月間ユーザー数が2,500万人を超えたと発表し、全ユーザーを対象に、1日当たり50クレジットを追加する措置を延長した。この特典は7月時点ではGoogle AI加入者に限定され、8月31日までの予定だった。🔗 出典
  • JigsawとSensemaking AI — Googleのインキュベーターは、Geminiを活用したオープンソースの市民協議スイートを30の都市、州、国へ展開するPartner Programを開始した。金額非公表の基金にはGoogle.org、Bloomberg Philanthropies、Packard Foundationが参加している。🔗 出典
  • 10万件の研修奨学金 — 国連総会に合わせ、Googleは80か国以上を対象に、AI認定研修の奨学金10万件へ資金を提供する。国際電気通信連合のAI for Goodプログラムに属するAI Skills Coalitionを通じ、各国政府とGigaネットワークが配布する。🔗 出典
  • Googleのコードを保護するエージェント — Googleは9月19日付の投稿で、オープンソースのMantisハーネスを基盤とするエージェントを使い、インフラストラクチャのコード変更を提出前にすべて分析していると説明した。これにより毎月数百件の脆弱性を阻止しており、トリアージエージェントは1分未満で92%を超える精度を達成するという。🔗 出典
  • Copilot CLI 1.0.88 — 企業管理設定が、これまでMCPポリシー、権限、プラグインの適用対象外だった--acp--ahp-host--serverのセッションにも適用されるようになり、/forkは1ターンの間動作するようになった。9月21日公開の1.0.87では、Autoルーティングレベル向けの管理設定が追加されていた。🔗 出典
  • PikaとSeedance 2.5 — Seedance 2.5のDraftモードがPikaとPika API Clubに登場した。1秒当たり10セントからクリップの下書きを作成し、その後、高品質版として仕上げられる。🔗 出典
  • Pika Swap Anything — 動画のリズム、動き、元の映像の物語性を保ちながら、俳優、衣装、背景、小道具を置き換えるPikaの新アプリ。料金は発表されていない。🔗 出典
  • Suno Studio — Sunoの音楽制作ワークステーションに、コンプレッサー(スレッショルド、レシオ、アタック、リリース、サイドチェイン)などのオーディオエフェクト一式が統合された。Premierプランに含まれる。🔗 出典
  • SluiceboxとNemotron 3 Ultra — NVIDIAの事例研究によると、サプライチェーンの炭素分析を手がけるこの新興企業は、Nemotron 3 Ultraへの移行によって推論コストを51~80%削減し、サプライヤーデータ抽出で87.7%を達成した。従来モデルの成績は84%だった。🔗 出典
  • Topograph — GPUクラスターのネットワークトポロジーを検出し、Kubernetes、Slurm、Slinkyに公開するNVIDIAのオープンソース・ツールキット。分散ワークロードを可能な限り互いに近く配置できる。Crusoe、Google Cloud、Lambda、Nebius、Nscale、Oracle CloudのAPIを読み取る。🔗 出典
  • エージェントを評価する — NVIDIAは9月21日付の方法論記事で、ツール呼び出しからタスク完了までを対象とする6つの指標を提案し、Nemotron 3.5 LightningがPinchBenchで86%を記録し、Qwen3.6 35Bより30%高速だとしている。🔗 出典
  • Intel上のQwen-Image-2.1 — 9月21日にIntelが発表し、22日にQwenが紹介した初日対応では、OpenVINOを通じてArc Pro B70 GPUとCore Ultra Series 3の統合GPUを対象とし、専用notebookも用意されている。🔗 出典
  • BoxとGrok 4.7 — Grok 4.7が公開された9月21日、Boxは200万ドル規模の損害事例を使い、Box Agentのプレビューで同モデルを試験した。重複する8万2,000ドルの請求書と、欠落していた6万4,000ドルのクレジットノートを検出したが、提供日も料金も発表されていない。🔗 出典
  • 外科医とCodex — OpenAI Developersは、手外科医のBrian PridgenがCodexを使って独自ツールを構築し、PubMed上の科学文献をレビューする様子を紹介する動画を公開した。数値や書面による研究は示されていない。🔗 出典
  • WordのChatGPT — 9月17日に発表された単一のMicrosoftアドインにより、世界中のWord、Excel、PowerPointでChatGPTを利用できる。Freeを含む全プランが対象だが、使用量に制限がある。BusinessとEnterpriseでは、9月30日までWord上のGPT-5.6 Solを無料でプレビューできる。🔗 出典
  • AIリテラシー — Perplexityは、回答を評価する能力を中核的な技能と位置づけ、「研修という見せかけ」を批判するガイドを公開した。Gallupの調査として、2025年第4四半期には導入を申告した割合が38%だった一方、日常的に利用していた割合は12%だったと紹介している。🔗 出典

これが意味すること

同じ日にAnthropicとOpenAIは、何としてもより強力なモデルを提供するのではなく、はるかに低い費用で最上位モデルに近い性能を実現するという同じ主張を打ち出した。Opus 5.5はFable 5.1と同等の水準をOpus 5より40%低い費用で提供するとされ、GPT-6 SolはAstraの強みの多くを引き継ぎながら、100万tokens当たり2ドルと10ドルの価格に設定されている。両社は今やtoken単価ではなくタスク当たりの費用を軸に考え、cacheを真の要点としている。Anthropicでは読み取りが0.20ドル、OpenAIでは最大90%の割引と明示的なブレークポイントが用意されている。

統合に要する時間は、数時間単位で測られるようになった。GitHub Copilot、Devin、Perplexity、Cursor、v0は同日中に新モデルを利用可能にし、それぞれ独自の指標を示した。CognitionではFrontierCode 1.1 Extended、PerplexityではWANDR、CursorではCursorBenchが使われている。これらの数値は直接比較できず、Opus 5.5はExtended版で65.3%、Main版で54.4%となっている。また、どちらの開発元も、まだ自社の新モデルを相手側のモデルと比較していない。開発者にとって適切な選択は、発表時の表よりも、自分が使うツールと実際のタスクの中で判断される傾向がますます強まっている。

プランも差別化の舞台になっている。Anthropicは5時間当たりの上限を引き上げ、上限のリセットを提供し、Claude CodeのProとTeam StandardをOpusへ移行する。GitHubはOpus 5.5を上位プランに限定する一方、GPT-6 LunaはCopilot Proから利用可能にする。GoogleはColabをGoogle AIプランへ統合しながら、処理能力を確保するためGemini 2.5を制限している。プラン間で計算資源をどう配分するかは、表示価格と同じくらい重要になった。

最後に、測定方法そのものも変化している。Anthropicは、benchmarkの僅かな差が以前ほど判断材料にならず、Opus 5.5が評価されていることをしばしば認識しているように見えると認めている。OpenAIは、独立評価者にモデルを開放するための規則を定めた。英国のAISIはEvalEvalによって結果を再現可能にし、NVIDIAは個々のツール呼び出しではなく、完了したタスクに基づいてエージェントを評価することを提案している。モデルが実際に何を行うかを確かめることは、今やスコアと同じくらい重要だ。


出典