検索

Demis Hassabis、フロンティアモデル向けの Standards Body を提案、NVIDIA は 1ワットあたり25倍の性能を主張、GPT-5.6 が Bedrock で一般提供に

Demis Hassabis、フロンティアモデル向けの Standards Body を提案、NVIDIA は 1ワットあたり25倍の性能を主張、GPT-5.6 が Bedrock で一般提供に

ai-powered-markdown-translator

gpt-5.4-miniを使用してfrからjaへ翻訳された記事。

GitHub でプロジェクトを見る ↗

今週は、フロンティア AI のガバナンスに関する Demis Hassabis の見解表明、Blackwell の効率改善とエージェント駆動の新しい探索手法を数値で示した NVIDIA の2本の発表、そして Amazon Bedrock での GPT-5.6 一般提供開始が大きな話題となった。その他のニュースとしては、オープンモデルの波(OCR、視覚言語、三値量子化)、GitHub と Manus のツール面での複数の新機能、さらに Perplexity によるベンチマーク WANDR のオープンソース公開がある。


Demis Hassabis がフロンティア AI の枠組みと Standards Body を提案

7月14日 — Google DeepMind の共同創業者兼 CEO である Demis Hassabis は、X に投稿した長文記事で、汎用人工知能(AGI)へ向かう軌道について自身の見解を示した。人間の脳が持つすべての認知能力を備えたシステムが実現するのは、おそらくあと数年にすぎないとし、この転換の規模を電気や火の発見になぞらえ、その影響は産業革命の10倍、しかも10倍の速さになり得ると述べている。

ただし彼は警鐘も鳴らしている。現在の商業的・地政学的競争は非常に激しく、サイバーセキュリティ、将来的には核・生物学的リスクまで含めて危険を十分に理解する時間も、ますます自律化し自己改善まで可能になりつつあるシステムの制御を保つ時間も足りないという。

彼の中心提案は、フロンティアモデル評価専用の Standards Body を設けることだ。構想は、米連邦政府が監督する官民パートナーシップをモデルにし、金融における FINRA のように、独立した技術専門家とオープンソース代表を含む理事会を置くというもの。資金は主に民間が負担し、最前線の技術人材の確保と、大規模テストに必要な計算資源の確保を目指す。Hassabis は、米国がこの取り組みを始動するのに最も適した国だと位置づけつつ、安全性の論点については国際協力を呼びかけている。

If you stop to think about it, we’ve essentially found a way to make sand think. It’s miraculous. The magnitude of this technology’s impact will be unprecedented, perhaps 10x of the Industrial Revolution at 10x the speed.

🇯🇵 少し考えてみると、私たちは本質的に砂に思考させる方法を見つけたということになる。これは驚異的だ。この技術の影響の大きさは前例がないだろう。産業革命の10倍、しかも10倍の速さになるかもしれない。@demishassabis on X

🔗 X での記事全文


NVIDIA — 1ワットあたり性能は、AI インフラ効率の重要指標

7月14日 — NVIDIA は、1ワットあたり性能を AI インフラ効率の基準指標として位置づけている。電力供給が最も厳しい制約である状況では、この比率が、固定された電力枠の中で AI ファクトリーが何 token を生み出せるか、ひいては売上と収益性を左右する。

同社は、Hopper 世代に対する Blackwell NVL72 プラットフォームの性能向上を次のように数値化している。

評価モデル1ワットあたり性能向上(Blackwell NVL72 vs Hopper)
DeepSeek V4 Pro最大25倍
GLM 5.1最大20倍
Kimi K2.6(長時間の agentic workload)最大10倍

これらの向上の一部は、8 GPU の GPU ドメイン(Hopper)から、72 GPU を統合したラックへ移行したことに由来し、6世代目の NVLink Switch がネットワーク内計算(SHARP 技術)を統合している。ハードウェアだけでなく、ソフトウェア最適化も引き続き大きな改善を生んでおり、TensorRT-LLM、Dynamo、SGLang、vLLM のスタックを通じて、DeepSeek V4 では1か月でさらに最大5倍の性能向上が得られたという。

電力インフラ面では、DSX MaxLPS 技術により、温水冷却と動的電力制御によって、同じ電力予算で最大40%多くの GPU を稼働できる可能性があるとされる。なお現状では、ネットワークから引いた電力のうち、実際に有用な AI 作業へ変換されているのは AI ファクトリー全体でおよそ60%にすぎない。NVIDIA はこのアプローチを次期プラットフォーム Vera Rubin の文脈で位置づけ、Anthropic、OpenAI、CoreWeave、Perplexity、Fireworks AI での本番導入を挙げている。

🔗 NVIDIA の記事


NVIDIA — Nemotron Labs:エージェント能力で駆動する自律 RL 探索

7月14日 — NVIDIA は、NeMo RL、NeMo Gym、再利用可能なスキル群を活用した、エージェント駆動の強化学習研究デモ「RL Autoresearch」を公開した。仕組みは、コーディングエージェントに目的と時間予算を与え、あとはエージェント自身に学習環境の構築、モデルの訓練、評価まで行わせ、研究者は全体方針の監督に徹するというものだ。

公開された例では、エージェントは視覚モデルに色付きの星を数えさせる必要があった。Qwen3-VL-2B は精度 25% から 96.9% に向上し、さらにエージェント自身が、次に行うべき実験を研究者から指示されることなく提案した。

2つ目の例は、自律研究というより post-training にあたるが、近い用途を示している。Cosmos 3 Nano は、ゼロショット評価では目に見えているはずの信号機を検出できなかったが、WTS 検証タスク(天候・交通・信号を含む運転シナリオ)向けに LoRA で再学習された。その結果、精度は LoRA 後に 54.41% から 87.14% へ、さらに NVIDIA TAO AutoML を加えると 93.35% まで上昇し、しかも全工程は1日未満で完了した。

We gave a coding agent a goal and a time budget: build a training environment and teach a vision model to count colored stars.

🇯🇵 私たちはコーディングエージェントに、学習環境を構築し、視覚モデルに色付きの星を数えさせるという目的と時間予算を与えました。@NVIDIAAI on X

🔗 Nemotron Labs の発表


オープンモデル & 研究

今週は、Hugging Face、Together AI、Sakana AI などを中心に、オープンモデルと研究の分野で7件の発表があった。

評価モデル発行元パラメータ数ライセンス主要ベンチマーク
OvisOCR2独立著者(HF)0.9億Apache 2.0OmniDocBench v1.6 で 96.58
MOSS-VL-RealtimeOpen_MOSS110億Apache 2.0256,000 token のコンテキスト
Ternary Bonsai 27BPrismML約273億(三値)Together AI で無料MATH-500 で 99.20

OvisOCR2:9億パラメータの文書認識

OvisOCR2 は OmniDocBench v1.6 で 96.58 を主張し、処理を OCR、レイアウト検出、解析に分けたパイプライン型システムを上回る、初のエンドツーエンドモデルだとしている。著者は、Hugging Face Jobs を使って任意のデータセットを OCR 経由で markdown に変換するレシピを提案しており、ローカル GPU は不要とされる。なお、このスコアと「初のエンドツーエンドモデル」という位置づけは発表ツイートに基づくもので、完全なモデルカードでは未検証である点に注意が必要だ。

🔗 X での OvisOCR2 発表

MOSS-VL-Realtime:リアルタイム動画向けのオープンな視覚言語モデル

Open_MOSS チームは、静止画ではなく動画ストリームの継続的な解析を目的とした110億パラメータの視覚言語モデルを公開した。動画を観察しながら応答を生成し続け、画面上の状況が変われば応答を修正でき、十分な証拠がない場合は静かにしていることも選べる。Base、Instruct、Realtime の各バリエーションはいずれも Apache 2.0 で公開され、SGLang と LMSYS のチームによる day-0 サポートがある。

🔗 X での MOSS-VL-Realtime 発表

LeRobot v0.6.0:深度のネイティブ対応

Hugging Face のオープンソース・ロボティクスライブラリは、深度(depth)に対するエンドツーエンドのネイティブ対応を追加した。Intel RealSense カメラを接続し use_depth: true を有効にすると、深度マップは RGB ストリームと自動同期され、12ビットに量子化され、可逆 HEVC でエンコードされる。この機能は SO-100/101、Koch、OpenArm、reBot、Unitree G1 を対象とする。

🔗 X での LeRobot v0.6.0 発表

Sakana Marlin:戦略研究のための「Virtual CSO」

Sakana AI は、AB-MCTS エンジンと AI Scientist 型のフローを用いて約8時間にわたる深い推論を行い、要約ではなく構造化された戦略オプションへと導く自律研究エージェントを発表した。成果物には、レポート、付録、参考文献、スライドが含まれる。製品はベータ版で、従量課金(1クレジット98円)または見積もり制の Enterprise 提供となっている。

Ternary Bonsai 27B:携帯端末向けの三値量子化

PrismML は、Qwen3.6 27B を三値量子化した派生モデル(g128 形式、重みあたり 1.71 bit、FP16 ベースと比べて約9.4倍コンパクト)を公開し、全精度版の品質の95%を維持していると主張している。

評価ベンチマークスコア
MATH-50099.20
AIME 202590.84
HumanEval+93.90
平均(thinking ベンチマーク15件)80.49

このモデルは 262,000 token のコンテキストと視覚入力をサポートし、Together AI の serverless インフラで無料提供されている。

🔗 X での Ternary Bonsai 27B 発表

Flash-BoN:diffusion 向けに再解釈された best-of-N

Sayak Paul(Hugging Face)は、推論時の diffusion におけるスケーリングについて、関数評価回数だけでなく実際の実行時間も測るなら、best-of-N が思われていたよりも強力な基準であることを示した。チームは Flash-BoN を導入し、反復的な中間検証よりも、サンプルのより広い探索を優先する。

🔗 X での Flash-BoN 発表

Hugging Face が ZeroGPU を全ユーザーに開放

ZeroGPU デモ(オンデマンドの無料 GPU)へのアクセスが、すべての Hugging Face ユーザーに提供されるようになった。自然言語のプロンプトから直接デモを構築できる agent skill も用意されている。


GitHub、Copilot & Manus

コードスキャンが pull request 上で AI によるセキュリティ検出を表示

7月14日 — GitHub code scanning は、AI 支援によるセキュリティ検出を pull request 上で直接表示するようになり、CodeQL で未対応の言語やフレームワークにも対象を広げた。機能は public preview であり、あくまで情報提供のみ。マージをブロックすることはなく、default setup の CodeQL が有効であること、Copilot ライセンスがあることが必要で、AI クレジットは検出が発生したときにのみ消費される。

🔗 GitHub Changelog

Dependabot がデフォルトで待機期間を導入

7月14日 — Dependabot は、新しいバージョンの公開後、更新 pull request を開くまでデフォルトで3日待機するようになった。供給網攻撃への露出を抑えるためだ。この遅延は cooldown.github/dependabot.yml オプションで設定可能で、セキュリティ更新は従来どおり即時に行われる。この機能は GitHub Enterprise Server では 3.23 以降で提供予定。

🔗 GitHub Changelog

GitHub Copilot アプリの /security-review

7月14日/security-review コマンドが GitHub Copilot アプリで public preview として利用可能になった。進行中のコード変更を解析し、重大度と信頼度で分類された結果を返し、アプリを離れずにそのまま適用できる提案も提示する。injection、cross-site scripting、path traversal などをカバーし、Free、Pro、Business、Enterprise の各プランで利用できる。

🔗 GitHub Changelog

Manus が .pptx をネイティブ生成するように

7月14日 — Manus はこれまでスライドを生成してから .pptx に変換していたが、これからは PowerPoint ファイルを直接ネイティブ生成する。グラフは実際に編集可能で、値が変わると再描画され、ラベル、グリッド、凡例のオン・オフも切り替えられる。

🔗 Manus の発表

Manus が生成サイトの自動公開を開始

7月13日 — 新しい auto-publish オプションにより、成功した各ビルドのサイトがオンライン URL へ自動デプロイされる。初期設定では無効。変更待ちのキューと組み合わせることで、構築から本番反映までの最後の手作業をなくす。

🔗 Manus の発表


画像生成 & 動画

Wan-Dancer-14B:オープンソースのダンス動画生成

7月14日 — Alibaba は Wan-Dancer-14B をオープンソース化した。これはローカル実行可能なモデルで、長尺のリズミカルなダンス動画生成に特化し、短いクリップではなく、長いシーケンスにおける動きと音楽の同期を狙っている。

🔗 Alibaba Wan の発表

HeyGen:リアルタイムアバター向けの単語単位タイムスタンプ

7月14日 — HeyGen は、同社の Avatar Realtime API の非公開フローを文書化した。単語ごとのタイムスタンプ・チャネル({mot, début, fin})により、ジェスチャーと発話を正確に同期できる。テキスト送信の確認は約70msで届くが、単語が実際に発話されるまでには数秒かかるため、1秒あたり約4回の再計算でアンカーを付け直す必要がある。この仕組みは 24時間配信の Twitch 番組で検証され、ライブで 9,269 件の verdict が下された。

🔗 HeyGen の記事

HeyGen — Figma → HyperFrames、9/30日目

7月14日/figma スキルは、Figma ファイルからアセット、ブランドトークン、コンポーネント、motion タイムライン、ストーリーボードを直接取り込む。デモでは、27の色と名前付きスタイルを取り込み、8フレームのストーリーボードを、ライブで解釈された撮影スクリプトのように再構築した。

🔗 HyperFrames リポジトリ

NVIDIA — Nemotron:顧客企業の数値化されたフィードバック

7月14日 — NVIDIA は、オープンモデル Nemotron をめぐる複数の顧客事例を数値付きで公開した。H Company は Holotron 3 Nano で OSWorld-Verified の精度 76%超を達成し、Harvey は閉鎖型代替手段と比べて1実行あたり少なくとも10倍低いコストで Nemotron 3 Ultra を post-training した。Arcee AI は、同等の閉鎖型モデルと比べて約20倍安く、PinchBench では2位だったと主張している。Abridge と YTL AI Labs は、それぞれ臨床対話と言語マレー語向けにカスタマイズした。

🔗 NVIDIA の記事


Anthropic

Claude for Teachers:米国の K-12 教師向け無料アクセス

7月14日 — Anthropic は、米国の確認済み K-12 教師向けに Claude のプレミアム機能への無料アクセスを開始した。50州の標準に沿った教育用スキルのライブラリと、Learning Commons 経由で検証済みのプログラムへの接続が含まれる。会話内容はモデル学習には一切使用されず、学生データは FERPA に準拠したデータ処理契約で保護される。

🔗 Anthropic の発表

Artifacts:公開共有、マルチプレイヤー編集、Claude Tag による作成

7月13日 — Artifacts に公開共有(リンクを持つ人なら誰でも閲覧可能)、同時マルチプレイヤー編集(Team および Enterprise プラン)、さらに Slack の Claude Tag からスレッド内で依頼するだけで作成できる機能が追加されました。

🔗 Anthropic の発表


OpenAI

GPT-5.6 が Amazon Bedrock で一般提供に

7月13日 — 7月9日に公開された 3 つの GPT-5.6 モデル — Sol(フラッグシップ推論)、Terra(中間)、Luna(高速推論) — が、パフォーマンス、セキュリティ、スケール向けに設計された新しい Bedrock 推論エンジン上で、Amazon Bedrock で一般提供になりました。これにより、ChatGPT、OpenAI 直接 API、そしてサードパーティ統合(Copilot、M365、Warp、Cursor、Devin)に加えて、GPT-5.6 へのアクセス手段が広がります。

🔗 AWS の発表

JetBrains AI の既定推奨エージェントに Codex

7月14日 — JetBrains は Codex を JetBrains AI(IntelliJ IDEA、PyCharm、WebStorm)における既定の推奨エージェントにします。これは排他的な選択ではなく、ユーザーはいつでも別のエージェントに切り替え可能で、モデルの進化に応じて毎月見直されます。

🔗 JetBrains の発表


Gemini

Google Chrome の Gemini が英国で提供開始

7月14日 — Gemini は、英国で開いている Chrome のどのタブからでも、コンテキストを切り替えることなく利用できるようになります。ページの要約、タブ間の内容比較、画面に表示されている内容についての質問への回答が可能です。

🔗 Google UK の発表

初の Gemini 東南アジアレポート:記録的な採用率と Gemini Spark

7月14日 — Google は初の「Gemini Southeast Asia Report」を公開しました。主要 6 市場(インドネシア、マレーシア、フィリピン、シンガポール、タイ、ベトナム)でアクティブユーザーが 1 年で 2 倍以上に増え、クエリの約 70 % が現地語で送信され、過去 1 年で Nano Banana を通じて 50 億枚の画像が生成されました。あわせて Google は、地域の Advanced 加入者向けに現地語で Workspace タスクを処理できるプロアクティブなエージェント Gemini Spark を展開します。

🔗 Google のレポート


開発ツールとエージェント

Devin Fusion:Fable 5 にルーティングする preview エージェント

7月13日 — Cognition は Devin Cloud で利用可能なプレビュー版エージェント Devin Fusion を発表しました。ここでは、1 つのモデルがすべてを単独で実行するのではなく、より低コストなモデルにタスクを委任するマネージャーの役割を果たします。チームによると、Fable 5 は完全な仕様を書き上げて委任するマネージャーのように振る舞う一方、Opus 4.8 のような他のモデルはマイクロマネジメントに陥りがちで、コンテキストを圧迫する傾向があります。結果として、Fable 5 の単価は高いにもかかわらず、Opus 4.8 よりもタスクあたりのコストは低くなります。ただし、逐次デバッグでは、依然として節約を得るのが難しいままです。

🔗 Cognition の発表

Perplexity が WANDR ベンチマークをオープンソース化

7月14日 — Perplexity は、広範で深いリサーチタスクにおける検索エージェントを評価するために設計された社内ベンチマーク WANDR(Wide ANd Deep Research)を公開しました。500 タスク、個別に検証可能な 170,495 件のレコード、3 段階の難易度で構成されています。採点器は引用された各ページを再取得し、すべての主張が根拠となる証拠で裏付けられているかを確認します。6 つの本番システムをテストした結果は控えめで、ソフト F1 は 0.363、厳密 F1 は 0.133 にとどまり、設定によって 1 タスクあたり 0.03 ドルから 324.83 ドルのコストがかかりました。

🔗 Perplexity の X での発表 · GitHub のベンチマーク


ブリーフ

  • Anthropic は、カナダの AI 研究に関する新たな研究を資金援助するため、地元機関との連携のもと 1,000 万カナダドルを拠出します。🔗 出典
  • Cognition は Windsurf 買収から 1 年を迎えました。年換算売上高は 7,300 万ドルから 5 億ドル超に増加し、2,000 万行以上のコードが書かれ、ブランドは Devin Desktop に統合されました。🔗 出典
  • Amp(Sourcegraph)は、内部チーム向けだけでなく全ユーザー向けに、エージェントモードの使用状況をリアルタイムで示す公開ダッシュボードを公開しました。🔗 出典
  • Warp は MCP 経由で Sentry を統合し、ターミナルを離れずに原因分析(Seer)と pull request 作成を連続して行えるようにしました。🔗 出典
  • Composio が Warp に登場し、エージェントを 1,000 以上のアプリケーション(Gmail、Slack、Linear、Google Calendar)に接続します。🔗 出典
  • Zach Lloyd(Warp の CEO)は、対話型エージェントから、ソフトウェアのライフサイクル全体を自動化する「cloud software factories」への移行についてのエッセイを公開しました。🔗 出典
  • Hugging Face Jobs では、事前にリポジトリへアップロードすることなく、-v dossier:/chemin を使ってローカルフォルダを Job に直接マウントできるようになりました。🔗 出典
  • llama.cpp は 10,000 回目の公開(release)を迎えましたが、追加の技術詳細はありません。🔗 出典
  • LlamaCoder v4(Together AI)は、1 回のプロンプトで完全なアプリケーションを生成し、GLM 5.2 を基盤に新しい WebAssembly レンダリングエンジンで再構築され、無料かつオープンソースです。🔗 出典
  • NotebookLM は、今後詳細未発表の新しい発表を控える中、最近の機能(Drive の自動同期、ノートブックのピン留め、スライドの再整理、モバイル共有)をまとめました。🔗 出典
  • GitHub は、Code Quality ライセンスのコスト見積もり(アクティブコミッター、月次予測)を、2026 年 7 月 20 日に予定されているアクティブコミッター 1 人あたり月 10 ドルへの移行前に事前確認できるようにしました。🔗 出典
  • NVIDIA は、モデルサイズと GPU 性能のシナジーに関する新シリーズ「AI Model Co-Design」を開始しました。🔗 出典
  • Kling AI は、Ash Koosha が監督した Fountain 0 の第 2 作 AI 長編『ODYSEEUS: The Fall』のトレーラーを公開しました。🔗 出典
  • OpenAI は、エージェント時代における AI 投資の運用に関する Enterprise 向けガイドを公開し、投じた 1 ドルあたりの有用な作業量の測定に焦点を当てています。🔗 出典
  • OpenAI は、営業チームが ChatGPT Work をパイプラインメモ、会議準備、停滞した案件の診断にどう使っているかを詳述しました。🔗 出典
  • OpenAI は、データサイエンスチームが ChatGPT Work を原因分析メモ、影響の要約、ダッシュボード仕様にどう使っているかを詳述しました。🔗 出典
  • Cohere は Hugging Face のハッカソンを共同スポンサーし、2 つのプロジェクトを表彰しました:Tiny Army(2 位、Thousand-Token Wood トラック)と、監視カメラエージェント Eyas(最優秀エージェント賞)。🔗 出典

それが意味すること

ハードウェア面では、NVIDIA は自社の発信を 1 つの考え方に集約しています。もはや制約はシリコンではなく電力であり、それが AI ファクトリーの採算性を決める、ということです。Blackwell のワット当たり性能向上(DeepSeek V4 Pro で最大 25 倍)と、Nemotron の顧客事例で示された数十倍安いコストは、同じ物語を語っています。すなわち、総合的な演算性能よりも、エネルギー効率と 1 トークンあたりのコストが主な売りになるということです。RL Autoresearch のデモも同じ方向を向いており、これまで大半が手作業だった研究・学習・評価のループそのものを自動化しようとしています。

オープンモデル側では、この 1 週間はニッチの急速な多様化を示しました。超軽量文書認識(OvisOCR2)、連続動画理解(MOSS-VL-Realtime)、ネイティブな深度を備えたロボティクス(LeRobot)、そして特に Bonsai 27B の ternary 量子化は、27 億パラメータ級のマルチモーダル性能を、スマートフォン並みのメモリ占有で実現しています。これらの公開は Hugging Face、Together AI、Sakana AI、そして独立チームによって支えられており、オープンソースのエコシステムが、推論コストを大幅に下げながらも、閉じたモデルの能力にかなり近いところまで追随し続けていることを示しています。

ガバナンスの面では、Demis Hassabis の介入は通常の製品発表のトーンとは一線を画します。現在の商業競争がリスクに対する集合的理解を先行してしまっていることを明示し、単なる注意喚起ではなく、FINRA を参考にした Standards Body という具体的な仕組みを提示しているからです。ちょうど他方で製品発表が相次ぐ週に、Google DeepMind の CEO からこの提案が出たことは、業界全体を貫く商業ペースと規制的予見との緊張関係を象徴しています。

最後に、開発者向けツールは、単一のより強力なモデルへの競争ではなく、モデル間の委任を中心に再編され続けています。Devin Fusion は、実行役モデルにより安価なモデルを委任するマネージャーモデルに賭け、GitHub は AI 支援のセキュリティスキャンを pull request に直接拡張し、Perplexity は WANDR ベンチマークを公開して検索エージェントの実際の限界を可視化しました。これは、現時点の優秀なシステムであっても、大規模な事実確認タスクにおいては完全な信頼性からはまだ遠い、という有益なリマインダーです。


ソース