ai-powered-markdown-translatorgpt-5.6-solを使用してフランス語から日本語に翻訳された記事。
9月21日月曜日の主役はxAIだ。Grok 4.7が公開され、モデル発表からツールへの導入まで間を置かず、同日中にCursorとGitHub Copilotで利用可能になった。OpenAIも同じ日に、8月28日から訓練してきた社内モデルが100件を超える未解決の数学問題を解決したと明かし、Fields Medal受賞者27人が署名した声明を受けて数学者の諮問グループを設置した。GoogleはGooglebookの予約注文を開始し、ElevenLabsは動画エディターの中核に編集エージェントを据え、Hugging Faceは3倍から30倍高速化したトークン化ライブラリを改めて公開した。
Grok 4.7がxAIから登場し、同日中にCursorとGitHub Copilotへ
9月21日 — xAIは、コードと知識作業において同社で最も高性能なモデル、Grok 4.7を公開した。ベースモデルはGrok 4.6より大きく、強化学習(reinforcement learning)の段階も、数時間を要する問題を重視して配分したタスク群で延長された。xAIは、これにより自身の作業をより適切に検証し、長いコンテキストをより安定して扱えるモデルになるとしている。
数値が示すのは圧倒的な優位性ではなく、強弱のある性能特性だ。一方、料金は変わらない。入力100万tokens当たり2ドル、出力100万tokens当たり6ドルでGrok 4.6と同額、GPT-5.6 Solの入力料金の半分、Fable 5.1の5分の1に当たる。主張の軸となるのは、この価格性能比だ。
| 公開された指標 | Grok 4.7 (xHigh) | Grok 4.6 (High) | GPT-5.6 Sol (Max) | Fable 5.1 (Max) |
|---|---|---|---|---|
| CursorBench 4.0 | 46,3 % | 40,4 % | 41,7 % | 51,8 % |
| Terminal-Bench 4.0 | 38,0 % | 20,3 % | 37,3 % | 57,9 % |
| EEBench(電気工学) | 64,0 % | 53,0 % | 39,4 % | 56,4 % |
| 入力料金(ドル / 100万tokens) | 2 | 2 | 4 | 10 |
| 出力料金(ドル / 100万tokens) | 6 | 6 | 20 | 50 |
APIでは、500,000 tokensのコンテキストと、lowからxhighまで4段階の推論努力レベルを備えたgrok-4.7が提供される。promptが200,000 tokensを超えると料金は2倍になる。xAIは、全面的に刷新した安全対策も強調している。LatchBioのバイオセキュリティbenchmarkで62.4%を記録して首位となり、HackerBench v0.3では危険なデュアルユースのサイバーpromptを通過させた割合が3.3%だった。
2つの統合サービスで直ちに展開された。Cursorは初日からモデルを提供している。これは8月14日に完了したSpaceXによるAnysphere買収の結果だ。モデル自体は引き続きxAIのものであり、同日にCursorのブログへ掲載された記事は一文だけで、x.aiの完全な発表へ誘導している。xAIが特に強調するのは、Cursorによる長時間タスクのbenchmarkであるCursorBench 4.0だ。Grok 4.7は料金据え置きで46.3%を記録した。一方、GitHub CopilotもVS CodeからXcodeまで、ProからEnterpriseまでの全環境とプランに展開している。そこで注意すべきなのが課金方式だ。Grok 4.7にはリクエスト倍率の仕組みが適用されず、利用量に応じてプロバイダーの公開料金がそのまま請求される。新しいモデルは初期設定で有効になるため、支出を管理するには放置するのではなく、モデルポリシーでの操作が必要になる。
🔗 Grok 4.7 — xAI 🔗 Grok 4.7がGitHub Copilotで利用可能に
OpenAIが数学者の諮問グループを設置し、100件を超える未解決問題の解決を発表
9月21日 — OpenAIは、9人の数学者が自主的に組織し、PrincetonのInstitute for Advanced Studyを拠点とする独立諮問グループと協力していると発表した。発表そのものよりも、その背景のほうが重要だ。
On August 28, we began training a new internal model. In addition to resolving the Navier–Stokes Millennium Prize problem, this model has now resolved more than 100 long-standing open problems across most areas of mathematics.
🇯🇵 8月28日、私たちは新しい社内モデルの訓練を開始しました。ミレニアム懸賞問題であるNavier-Stokes問題の解決に加え、このモデルは現在、数学のほぼすべての分野にわたる、長年未解決だった100件以上の問題を解決しています。 — OpenAI、数学と人工知能に関する諮問グループ
モデル名は公表されておらず、OpenAIは、この進歩の速さが自社の数学者たちをも驚かせたと記している。この加速は正面からの反発を招いた。9月11日、「数学におけるAIの深刻なミスアラインメント」と題する声明がZenodoのDOI付きで公開され、Terence Tao、Peter Scholze、Cédric Villaniを含むFields Medal受賞者27人が署名した。彼らの主張は、モデルが間違えるというものではない。大きな問題の解決は常に新たな理解の証しであり、その後、共同体が検討を重ねることで教育可能な知識へと変わってきた。署名者たちは、真偽の入り交じった命題が大量生産されれば、この土壌を育むどころか破壊しかねず、性急な発表によって適切に論文を執筆する時間も失われると懸念している。
仕組みは独立性を明確に重視している。グループは求められていない意見も表明でき、OpenAIが数学に及ぼす影響について公に論評でき、企業の承認なしに構成員を変更できる。メンバーはOpenAIから報酬を受け取らない。ただし、同じ段落の末尾にはOpenAIによる次の一文がある。グループは、同社の社内研究の進展速度について助言しない。したがって対象範囲は成果の公開であって、その生産ではない。抗議のきっかけとなった部分だけが除外されている。Martin Hairerは、声明への署名者であると同時にグループのメンバーでもあり、両方の名簿に名を連ねている。
Geminiを中心に設計されたGoogleのノートパソコン製品群、Googlebook
9月21日 — GoogleはGooglebookの予約注文を開始し、これを独立した製品カテゴリーとして位置づけている。Androidの技術基盤に、ChromeOSから受け継いだdesktopの基礎を組み合わせ、全体をGemini中心に設計したものだ。Acer、ASUS、Dell、HP、Lenovoが製造する5モデルが、899ドルから同時に発売される。出荷は米国で10月4日、Canada、英国、Ireland、France、Germany、Australiaで10月5日に始まる。
| 発表された仕様 | 値 |
|---|---|
| 開始価格 | 899ドル |
| プロセッサ | Intel Core Ultra Series 3またはSnapdragon X Elite |
| NPU | 45 TOPS超 |
| メモリ | 標準16 GB、最大32 GB |
| バッテリー駆動時間 | 動画再生で最大14時間、ウェブ閲覧で16時間 |
| ソフトウェアサポート | 最大10年間の更新 |
3つのGemini機能がこの端末専用に用意されている。カーソルを振ると起動するMagic Pointerは、画面に表示されている要素へGeminiを呼び出し、不審なメールの分析や複数画像の合成などを行う。Googleによると、これは要求された場合にのみ起動し、無効化もできる。Ramblerは、まとまりのない音声入力を、見出しやタスクリストを備えた構造化テキストへ変換する。文の途中で言語を切り替えた場合にも対応する。Create My Widgetは、自然言語による説明からdesktop用widgetを生成する。
開発者向けには、すべての端末にGoogleの開発エージェント基盤であるAntigravityと、完全なterminalを備えた隔離Linux環境が同梱される。ドキュメントでは、そこでClaude CodeやAntigravity CLIを実行できることが明記されている。この隔離はLevel 5認証のpKVM hypervisorを基盤としており、Googleは同カテゴリーで初めてだとしている。さらにTitanのhardware root of trustがこれを補完する。Androidスマートフォンとの連携も充実しており、モバイルで始めたタスクを引き継いだり、モバイルアプリをdesktop上のウィンドウへストリーミングしたりできる。各Googlebookには、5 TBのストレージを備えたGoogle AI Proの12か月分、YouTube PremiumとPhotoshopの3か月分、GeForce NOWの1年分が含まれる。
ElevenLabsがStudio 4.0に編集エージェントを導入
9月21日 — ElevenLabsは、動画エディターを更新したStudio 4.0をElevenCreativeで公開した。基本思想は一文に集約できる。すべてを同じ場所で行うということだ。動画、画像、音声、音楽、効果音の生成をプロジェクト内から直接実行でき、エディターを離れることなくElevenCreativeの全モデルを呼び出せる。編集、字幕付け、書き出しまでが同じインターフェースで連続して行われる。全体を再生成せずに1つのショットだけを作り直せるほか、字幕も編集timeline上のほかのclipと同様に操作できる。
最も構造的な新機能は、各プロジェクトに常駐する共同編集者、Studio Agentだ。
Studio Agent is your AI co-editor, built into every project. Describe the change you want and it makes the edit. Step in and make cuts whenever you like, then hand the timeline back to the agent.
🇯🇵 Studio Agentは、すべてのプロジェクトに組み込まれたAI共同編集者です。希望する変更を説明すれば、編集を実行します。好きなときに介入して自分でカットし、その後timelineをエージェントへ戻せます。 — @ElevenLabsのXへの投稿
この往復こそが、不透明な生成処理との違いだ。編集者は望むときに主導権を取り戻し、その後timelineを再びエージェントへ渡せる。このtimeline自体も、広告キャンペーン、チュートリアル、短編シリーズなど、複数シーン・複数トラックのプロジェクト向けに再構築された。フレーム単位のズーム、clipのスナップ、ほかの部分との同期を崩さずにclip群を移動する機能を備える。チームのコメントは別々のスレッドに散らばらず、特定のclipやassetへ直接付けられる。
経過を追ううえで注意すべき点として、調査時点では発表は6件の投稿からなるXのスレッドにしか存在しなかった。ElevenLabsのブログは9月10日の記事で、ドキュメントのchangelogは14日の項目で止まっていた。
Hugging Faceが同一の識別子を保ったまま3倍から30倍高速化したtokenizers v1を公開
9月21日 — Hugging Faceは、モデルがテキストを読み込む前に整数列へ変換するRustライブラリ、tokenizers v1のリリース候補版を公開した。出発点となる認識は単純だ。トークン化が機械学習pipelineのボトルネックになったことはなかったが、モデルの高速化に伴って均衡が変化している。CPUを待っているGPUは、稼働していないGPUだ。
| 指標 | 測定値 |
|---|---|
| v0.23比のencode高速化、単一thread | 3倍から30倍 |
| 測定機 | Apple M4 Max |
| 範囲の下限と上限 | t5-baseとgpt2 |
| 8 workersでのscale | 線形比76% |
| 生成されるtoken識別子 | v0.23と同一 |
| リリース候補版のインストール | cargo add tokenizers --pre |
チームが自らに課した制約は、性能向上そのものより興味深い。v1はv0.23とまったく同じtoken識別子を生成し、API、語彙、merge rankにも変更がない。また、BPEに特化せず汎用ライブラリであり続ける。そのため、更新に必要なのはインストールするversionの変更だけだ。
作業の大部分は6つの変更によるもので、最も珍しいものはbitcannonと呼ばれる。テキストをpre-tokenへ分割する正規表現は、tokenizerに同梱される固定parameterだ。encodeのたびに汎用engineで解釈させる理由はない。そこでHugging Faceは分割関数を手作業で実装し、SIMDのbit stream上で処理させている。レジスター操作1回につき64 bytesを判定する。代償も明確だ。恩恵を受けるのは認識済みのpattern(GPT-2、cl100k、o200k、Tekken、DeepSeek)のみで、それ以外は従来のregex経路を維持する。これが3倍から30倍という差を生む理由だ。これに、allocationもbranchもないmerge loop、thread-localの単語cache、native parallelismが加わる。ExecuTorchとllama.cpp向けの推論専用CおよびC++ bindingは、1.0.0より前に提供される予定だ。
🔗 tokenizers v1:測定で示すencode、decode、scaling
Devin Cloudがterminalに登場し、エージェントのマシンへSSH接続可能に
9月21日 — CognitionはDevin Cloudをterminalへ開放した。devin --cloud、または進行中のsessionから/cloudを実行すると、CLIを離れずにcloud sessionを作成、操作、再開できる。この仕組みは双方向のcommandに基づく。/handoffは進行中のタスクをDevinのvirtual machine(Mac、Linux、Windows)へ転送し、cloud側から実行すると逆方向に処理してpull requestのbranchを取得する。cloud sessionは、起動元のterminalを終了しても存続する。
And for the first time, SSH into Devin’s dedicated VM, then /handoff the work back to your own device.
🇯🇵 そして今回初めて、Devin専用のvirtual machineへSSH接続し、/handoffを使って作業を自分の端末へ持ち帰れます。 — @cognitionのXへの投稿
devin sshにより、エージェントが構築した環境へ完全にアクセスできる。コードの変更、開発serverの起動、port forwarding、scpによるファイル取得が可能だ。実行環境はもはやblack boxではない。SWE-2 sessionは10月8日までDevin Cloudで無料となる。
Qwen Code v0.24.3、Web Shellを計測可能にし、セッションをJDBCで永続化
9月21日 — Qwen Codeはv0.24.2の翌日にv0.24.3へ更新された。31件のpull requestが含まれ、互換性を損なう変更はない。目に見える作業の中心はWeb Shellで、実行結果は単なるプレーンテキストではなく、コマンド、出力、実行の詳細、経過時間を分離した構造になった。デフォルトでは無効なtrajectoryタブでは、ターンごとの所要時間、最初のtokenが返るまでの時間、token数、各ツール呼び出しの所要時間を確認できる。
目立たない部分の変更こそ、最も基盤に関わるものかもしれない。runtimeには接続とセッションをJDBCで永続化する機能が追加され、複数のbrokerプロセス間で状態を共有し、再起動後もセッションの所有権を維持できるようになった。また、runtimeのツールはbwrap経由でルーティングされ、workspaceを変更不可とするポリシーが適用される。これは前日に導入されたsandboxを直接発展させたものだが、その設定は引き続き公開されていない。同日、TypeScript SDK v0.1.14にはこのCLIが組み込まれ、Qwen Code Desktop v0.24.3も追随した。
Hugging Face、コードエージェント向けのリポジトリ記憶機能reloreを公開
9月21日 — Hugging Faceは、コードエージェントにリポジトリの記憶を与えるツールreloreをApache-2.0ライセンスで公開した。出発点となったのは、ある問題だった。9月8日に作成されたTransformersのissue #48630では、すでに2つの修正案が提出されていたにもかかわらず、同社の継続的インテグレーションエージェントが3つ目を書こうとしていた。情報はすべてGitHub上にあったものの、issue、pull request、開始地点のissueからは見えないコメントへと分散していた。
reloreは、誰が何を述べたかを記録しながら、この履歴をindex化する。maintainerの決定とcontributorの仮説は同じ重みでは扱われず、機械生成コンテンツはデフォルトで除外される。作業用cloneはindexの隣に維持され、同じHTTP APIから提供される。クエリはローカルで処理され、GitHubへ接続するのは取り込み時だけだ。各コマンドの役割も明確だ。inflightはissueを解決したと主張するthreadを一覧表示し、search --trust authoritativeはregressionの原因となったPR #39847を突き止め、whyはコードの1行を起点に、その周辺のreviewコメントを探し出す。実地テストでは、エージェントはdefsを使うと、全文を読む場合の5%のtokenだけでファイルの全体像をより適切に把握できたと報告した。
Perplexity、ユーザーのエラーからComputerをpost-trainingし、動画機能も追加
9月21日 — Perplexity Researchは、Computerエージェントを支えるモデル(記事中でGLM 5.2であることも明らかにされた)を、実際のユーザーセッションからどのようにpost-trainingしているかを詳述した。合成環境では、制御しやすく検証も容易なタスクを生成できる。一方、実際のセッションには合成環境では得られない2つのシグナル、すなわちユーザーによる修正とツールが返したエラーが含まれる。個人データを含むセッションと、trainingを拒否したユーザーのセッションは、サンプリング前に除外される。
その後、各ターンには3種類の処理のいずれかが適用される。成功したセッションのうちエラーのないターンには交差entropyによる模倣、有効なヒントが付いた誤りのあるターンにはKullback-Leibler divergenceによる修正、それ以外には単にcontext内へ保持する処理が行われる。同じ重みの組が教師と生徒の両方を担うが、ヒントを見られるのは教師だけだ。3つの自動判定器が原因と考えられるターンを提示し、少なくとも2つが一致しなければならない。苦情の直前にある最後のターンが実際の原因である割合は、およそ半分にすぎないためだ。
| ツールエラー率 | 測定値 |
|---|---|
| オフライン、元のGLM 5.2 | 2,79 % |
| オフライン、rejection samplingのみ | 1,35 % |
| オフライン、self-distillationあり | 0,87 % |
| オンライン、2つのcheckpoint間 | 2,24 %から1,77 %へ、相対値で21,2 %減少 |
著者らは、これらの数値で証明できないことも明記している。オフラインで比較したcheckpointは同じデータでtrainingされておらず、タスク別の結果には依然としてばらつきがある。また、各群約10万人を対象としたA/B testでも、ユーザーの不満足率は2,58 %に対して2,54 %で、有意な変化はなかった。
同日、Computerには動画生成機能も追加され、2つのサードパーティ製モデル、MiniMax H3とByteDance Seedance 2.5が採用された。キャンペーン用clip、製品demo、social向けvisualなど、完成した動画は同じ依頼から生成されたテキストや画像と同じthreadに表示される。ProおよびMaxの契約者が利用でき、無料アクセスやAPIでの提供については言及されていない。
🔗 現実世界の失敗から学ぶ 🔗 Perplexity Computerと動画モデル
Gemini Notebook、Live ChatとInteractive Learning Overviewsを全面展開
9月21日 — Gemini Notebookは同日、展開における2つの節目を迎えた。Live Chatはモバイル版のUltra契約者全員に提供されるようになった。約100言語に対応したnotebookとのリアルタイム音声会話で、Googleの最新audioモデルを基盤とし、ほぼ完全にハンズフリーで段階的な案内を受けられる。その数時間後、Interactive Learning Overviewsも段階的な展開を終え、契約条件なしですべてのユーザーが利用できるようになった。Reports内に配置され、sourceの要約とstudioの成果物を1つの対話型空間にまとめる。
両機能は、新しい学習ツールの発表時に9月15日付ですでに紹介されていた。21日の投稿で追加された機能はなく、前者が完全に、後者が全ユーザー向けに実際に利用可能になったことを正式に示すものだ。
🔗 Live Chatを100 %展開 🔗 Interactive Learning Overviewsを全ユーザーに公開
Google.org、教師向けAI研修に400万ドルを拠出
9月21日 — Google.orgは、国連総会に合わせてNew Yorkで発表されたDigital Promiseへの400万ドルの拠出を決定した。この資金提供は、年初に発表された無料研修Google AI Educator Seriesを拡充するものだ。この研修は、米国の初等・中等・高等教育に携わる600万人の教師を対象としている。ISTEと共同で、教師がほかの教師を育成する方式に基づいて設計され、特定の製品ではなく、ツールをまたいで応用できるスキルを扱う。各自のペースで進められるmodule形式で、修了するとdigital badgeが付与される。
Digital Promiseは3つの領域を担当する。州の教育機関や学区に合わせて研修を調整すること、短期大学課程の教師に向けてcommunity collegeのnetworkと連携すること、そして高等教育の教師を実際に支援する要素について2年間の研究を実施することだ。研究成果は、無料の公開guideとして発表される。
Runway、Workflowsをcompositing、透明度、depth mapへ拡張
9月21日 — Runwayは、アプリケーション内で操作を組み合わせるWorkflowsに、post-production向けの5つの構成要素、Compositing、Alpha、HDR、Depth Map、RGB Depthを追加した。発表で示された主張は一文に集約される。途中の工程で別のツールへ移ることなく、制作工程(pipeline)のより多くの部分を同じ場所で構築できるというものだ。compositingとalpha channelの管理は複数の画像layerを合成するためのもので、2種類のdepth mapは、cameraからの距離に応じて変化する効果を制御する幾何学的シグナルとして利用される。発表は31秒のdemoとともにXで行われ、調査時点ではRunwayのnewsページに対応する記事は掲載されていなかった。
NVIDIA、AI factoryの電力供給と冷却を認定するDSX Readyを開始
9月21日 — NVIDIAは、AI factory向けreference architectureであるDSXの要件に照らしてpartner製品を認定するprogram、DSX Readyを開始した。出発点となる認識は現実的だ。現在、電力供給、冷却、水、敷地、電力網が、事業者が実際に展開できるものを左右している。設備が設計全体と適切に整合していなければ、演算能力を有用な生産力へ変えることはできない。
| 認定カテゴリー | 開始時のpartner | 認定手順 |
|---|---|---|
| battery energy storage | Hitachi Energy, LG Energy Solution, Tesla | partnerによるtest、NVIDIAによるreviewと承認 |
| cooling distribution unit | LG Electronics, LiquidStack, Vertiv | self-qualification一式 |
NVIDIAは、このlabelが意味する範囲を明確に限定している。認定に合格しても、site単位のengineeringが不要になるわけではなく、siteの安定性を保証するものでもない。今後は、infrastructureやsoftwareに関するカテゴリーも段階的に追加される予定だ。
NVIDIA、エージェントのセキュリティを層ごとのengineering課題として扱う
9月21日 — NVIDIAは、agentic systemのセキュリティに関する見解を発表した。これはengineering上の課題であり、明確に定義された要件、適用可能なcontrol、指名された責任者、そして保護策が機能していることを示す証拠が必要だという。stackは3つのlevelに分解される。modelが能力を提供し、harnessがcontext、tool、workflowを編成し、実行環境がactionの行われるinfrastructureを提供する。それぞれが独自のcontrolを担う。
採用された例は分かりやすい。あるエージェントが顧客記録を更新し、添付文書内の悪意ある指示に遭遇した後、許可されていない送信先へデータをexportしようとする。この場合、NVIDIAは転送を遮断するnetwork policyと、試行されたtool call、認可判断、結果を保存する保護済みlogを求める。顧客記録を更新する権限は、それをexportする権限にまで及ばない。また、エージェントはアクセスを要求できても、自らに権限を付与することは決してできない。ツール面では、OpenShellがエージェントの手の届かない場所でpolicyを適用し、Ciscoはその上にDefenseClawを重ね、JFrogはエージェントがアクセスするskillを検証する。
同日、2本目の記事では同じ考え方をphysical AIに適用し、Halos基盤と結び付けている。この記事は、2つの市場予測とともに以下の短報に掲載されている。
Earth-2、地域観測を同化して天気予報を更新
9月21日 — NVIDIAは、すでに独自の測定データを持つ分野を対象とした、Earth-2のAIデータ同化ツールに関するtutorialを公開した。対象には、風力・太陽光発電所、地域のradarやsensor、衛星観測などが含まれる。最初の手法であるSDAは、CorrDiffやStormCastのようなdiffusion modelに適用される。各denoising段階で中間結果を観測値と比較し、再trainingせずに次の段階を誘導する。
| 測定対象の手法 | 範囲と解像度 | 例で報告された改善 |
|---|---|---|
| CorrDiff-SDA | Europe、0,25度から2,2 kmへ | 除外したstationで風速RMSEが54 %低下 |
| StormCast-SDA | 米国本土、3 km、HRRRで初期化 | 6つのtime stepで風速RMSEが7,2 %低下 |
| HealDA | 全球、1度のHEALPix grid | 全球の大気状態を数秒で推定 |
利点は第一に運用面にある。数値解析には多大な計算時間が必要で、決まった時刻にしか出力されない。一方、SDAは観測データを継続的に取り込み、現在時刻までの空白を埋める。HealDAは各データstreamを空間・時間上のpoint cloudとして扱い、対象grid上で集約した後、vision transformer型の基幹network(backbone)へ渡す。
Multiverse Computing、blockをIsing spin glassとして枝刈りし、MMLUを23ポイント改善
9月21日 — transformerのblockを丸ごと削除することは、大規模言語モデルを高速化する最も低コストな方法の1つであり、同時に最も荒々しい方法の1つでもある。モデルは文字どおり短くなるが、誤ったblockを削除すれば性能は崩壊する。Multiverse Computingは、そもそも問題の立て方が間違っていると主張する。既存の手法は、magnitude、sensitivity、block influenceなどを基準に各blockを個別に評価する。著者らはこれをmean fieldと呼ぶが、実際には、あるblockを削除した際の影響は、同時に削除するほかのblockによって変わる。
そこで選択問題は制約付き二値最適化問題となり、Ising spin glassへ写像される。これは、全結合の相互作用を持つ無秩序なspin系で、上向きspinの数が固定されている。実用上の利点は一文で説明できる。この系のenergyは、枝刈り後のモデルが得るscoreの低コストな代替指標となるため、benchmarkで一つも評価することなく、非常に多数の候補構成を順位付けできる。Llama-3.3-70B-Instructを50 %圧縮した場合、著者らは最良の競合手法と比べ、MMLUで約23percentage pointの改善を達成したとしている。
短報
NVIDIA は9月21日に7件の記事と投稿を公開した。そのうち3件は上で扱っており、技術発表を伴わない残り4件をここに掲載する。
- NVIDIA、フィジカル AI の全レイヤーにおけるセキュリティを提唱 — 2つの市場予測に基づく見解記事。ABI Research によれば、2035年までにレベル3~5の自動運転車が4,900万台導入され、Omdia によれば、2026年から2035年の間に約6,000万台の産業用ロボットが配備されるという。4つのセキュリティ要件を NVIDIA Halos 基盤に結び付けている。🔗 出典
- NVIDIA、エジプトの AI エコシステムの規模拡大を紹介 — Grand Egyptian Museum でのレセプションで、EMEA 担当副社長 Paolo Guglielmini が開会挨拶を行った。前文で特に強調されているのは、南アフリカ、モロッコ、ナイジェリアで AI ファクトリーが稼働を開始していることだ。🔗 出典
- NVIDIA、低炭素エネルギーに AI を応用する5社を紹介 — New York Climate Week に合わせて公開された概観で、核融合の加速から、リサイクルされた電気自動車用バッテリーの再利用までを扱う。ThinkLabs AI は CUDA 上でデジタルツインとエージェントを構築し、送電網への接続期間を短縮している。🔗 出典
- NVIDIA、GTC Berlin の Golden Tickets 当選者を発表 — 2026年10月20日から22日まで開催されるカンファレンスに向け、審査員が6組の当選者を選出した。技術的な内容はない。🔗 出典
- Qwen-Image-2.1、初日から vLLM、SGLang、ComfyUI、Hugging Face で提供 — SGLang-Diffusion は CPU オフロードを利用し、24 GB の RTX 4090 1基でモデルを実行する。1024×1024の画像生成に18.7秒を要し、使用量は22.7 GiB。vLLM は、Qwen3-VL-8B と組み合わせた71億パラメータの拡散 Transformer と説明している。🔗 出典
- OpenAI Academy、4つの学習コースを追加 — Build with AI、Lead AI Adoption、AI for Educators、AI for College Students が Apply AI at Work に加わる。各コースの最後にはバッジを獲得できる評価があり、開発者向けコースでは Codex の操作と API 上での構築を分けて扱う。🔗 出典
- Runway、API をテーマにサンフランシスコでハッカソンを開催 — Runway AI Summit に合わせ、9月30日に Masonic で1日限定で開催される。エージェント、アプリケーション、クリエイティブなワークフローを構築するもので、プレゼンテーション資料も承認プロセスも必要ない。🔗 出典
- HeyGen、Google DeepMind および Kaggle と構築したベンチマーク Code2Video を紹介 — コードを書く能力とは別の問い、すなわち、そのコードが見る価値のある動画を生成できるかを測る。コード生成に基づくエージェント型動画スタックについての投稿へのコメントとして公開された。🔗 出典
- Suno、説明だけで適用できる効果音を披露 — 温かみのあるサチュレーションから、より実験的な仕上がりまでを収めた1分間のデモ。機能名、対象プラン、関連記事はいずれもなく、ローンチというより製品紹介だ。🔗 出典
- Discord で Gemini のショッピング機能をライブ実演 — 公式 Discord サーバーで9月22日火曜日の太平洋時間午前11時に開催予定のセッションで、購入の準備、選択肢の比較、写真を使った検索を扱う。新機能はない。🔗 出典
- Together AI と Ollama、オープンなコーディングエージェントに関するセッションを発表 — Ollama の Parth Sareen と Together AI の Zain Hasan が、オープンモデルに基づくコーディングエージェントの本番導入についてセッションを行う。投稿に日時や場所の記載はない。🔗 出典
- 中止された2件の Boris-2 学習結果をオープンウェイトで公開 — 1件目は Muon と AdamW の勾配の非互換性により、300億トークン時点で損失3.100から改善しなかった。2件目は約70億トークンで中止された。モデルそのものより有益な失敗談だ。🔗 出典
- 判定モデルの方向性バイアスを検証する事前登録済みプロトコル — 仮説は、物語文における誤りが、感情の符号化よりも感情を明示的に述べる方向へ偏るというものだ。データ収集前にプロトコルが公開され、構成概念を撤回する条件となる結果と、著者による利益相反も明記されている。🔗 出典
- オープンな構成要素による Jev の再現、0.6ポイント差で失敗 — プログラミング経験がないと述べるユーザーが、CPU のみで動作するオープンなスタック上に Jev を再構築するため、Claude Code に1日分の実験を任せた。失敗した8つの手法は、成功した手法より有益だったと評価している。🔗 出典
- Jevini、意思決定の設計と実行を分離 — 大規模な推論モデルが、型付き判断からなるバージョン管理されたグラフを設計し、小規模な意思決定モデルが新しい状況ごとにそれを実行する。ベンダーによる宣伝コンテンツであり、その前提で扱う必要がある。🔗 出典
- Cohere、製品発表なしのブランド発信を継続 — 9月20日の投稿では、共同創業者 Aidan Gomez の意図とされる内容を言い換えて AI for Empowerment キャンペーンを継続。21日の2つのビジュアルでは、Waterloo で開催された学生ハッカソン Hack The North への同社の参加を紹介している。モデル、機能、価格の発表はいずれもない。🔗 キャンペーン · 🔗 ハッカソン
これが意味すること
リリース当日の提供が標準になりつつある。Grok 4.7 は待たせることなく、発表当日から Cursor と GitHub Copilot で利用でき、Qwen-Image-2.1 もリリース直後から vLLM、SGLang、ComfyUI、Hugging Face で提供された。モデルの公開から日常的なツールで利用可能になるまで、かつては数週間単位だった時間差がゼロに近づいている。Cursor では8月14日以降、エディターと研究所が同じグループに属しているためであり、ほかでは発表前から統合作業が進められているためだ。興味深い問いは、モデルがいつ登場するかではなく、登場後にいくらかかるかへ移っている。
まさにそこを変えるのが Copilot の課金方針だ。Grok 4.7 はリクエスト倍率の仕組みから外れ、xAI の公開料金に基づく従量課金となる。新モデルの自動有効化と組み合わさることで、コストに関する判断がプラットフォーム管理側へ移る。何もしなければ、第三者プロバイダーの料金表に連動する支出項目を開放することになる。xAI 側の主張は表裏一体だ。入力料金は Grok 4.6 と同じ2ドルで、Terminal-Bench では実際に向上しているが、長時間のコーディングタスクでは Fable 5.1 に次ぐ位置にとどまる。ここで売られているのは首位の座ではなく、価格性能比だ。
エージェントについては、互いに離れた3つの発表が同じ転換を物語っている。実行環境がブラックボックスではなくなりつつある。devin ssh はエージェントの仮想マシンを対話型セッションに開放し、relore はコードの現在の状態だけでなく、リポジトリにおける過去の意思決定をエージェントに記憶させる。Perplexity は、ユーザー環境で失敗した特定のターンを使ってモデルを事後学習し、Qwen Code は bwrap を介してツールをルーティングする。NVIDIA はこの動きに理論的な枠組みを与え、エージェントのセキュリティはその手の届かない場所でレイヤーごとに確保され、証拠となるログを備える必要があると主張する。検査可能なエージェントと制約されたエージェントは、同じニーズの表裏だ。
残るのは、OpenAI の発表が提起しながら扱っていない問いだ。1か月足らずで100件を超える未解決問題を解いた社内モデルに対し、組織として示された回答は、独立した無報酬の諮問グループであり、意見を自由に述べられるものだった。しかし、その任務からは社内における進歩の速度、つまり27人の Fields Medal 受賞者による抗議の核心そのものが明示的に除外されている。この日のほかの動きとの対比は示唆に富む。華々しい成果のペースが議論される一方で、あるトークナイゼーションライブラリは同一の識別子を保証しながら3倍から30倍高速化し、ある圧縮手法はスピングラスの知見を取り入れ、圧縮率50%で MMLU を23ポイント向上させた。こうした仕事は見出しにはならないが、明日の推論コストを決めるのはこの仕事だ。
出典
- Grok 4.7 — xAI
- @SpaceXAI の X 投稿、Grok 4.7 の発表
- Grok 4.7 が GitHub Copilot で利用可能に
- 数学と人工知能に関する諮問グループ
- 数学における AI の深刻な不整合
- Googlebook の予約注文
- ElevenLabs の X 投稿、Studio 4.0
- ElevenLabs の X 投稿、Studio Agent
- tokenizers v1:計測されたエンコード、デコード、スケーリング
- ターミナルで使える Devin Cloud
- Cognition の X 投稿、devin ssh
- Qwen Code v0.24.3 リリースノート
- relore、コーディングエージェント向けリポジトリ記憶
- 現実世界の失敗から学ぶ
- Perplexity の X 投稿、Computer の動画モデル
- Gemini Notebook の X 投稿、Live Chat
- Gemini Notebook の X 投稿、Interactive Learning Overviews
- Google.org と Digital Promise
- Runway の X 投稿、拡張された Workflows
- NVIDIA DSX Ready
- エージェントスタックの保護
- NVIDIA、フィジカル AI のセキュリティと Halos 基盤
- Earth-2 におけるデータ同化
- 物理学者のように LLM をプルーニングする
- NVIDIA、エジプトの AI エコシステム
- NVIDIA、5社と低炭素エネルギー
- NVIDIA AI の X 投稿、GTC Berlin の Golden Tickets
- Alibaba Qwen の X 投稿、Qwen-Image-2.1 のサポート
- 新しい学習コースによる OpenAI Academy の拡充
- Runway の X 投稿、API ハッカソン
- HeyGen の X 投稿、Code2Video ベンチマーク
- Suno の X 投稿、自然言語で説明した効果音
- Gemini App の X 投稿、ショッピングのデモ
- Together AI の X 投稿、Ollama とのセッション
- Boris-2-0907 と Boris-2-0917
- 要約バイアス:LLM 判定モデルの方向性を持つ失敗に関する事前登録済みテスト
- Jev とオープンな CPU 専用スタックを比較検証した結果
- 意思決定回路エンジニアリング
- Cohere の X 投稿、AI for Empowerment キャンペーン
- Cohere の X 投稿、Hack The North