搜索

Demis Hassabis 提议为前沿模型设立标准机构,NVIDIA 宣称每瓦性能提升 25 倍,GPT-5.6 在 Bedrock 上正式可用

Demis Hassabis 提议为前沿模型设立标准机构,NVIDIA 宣称每瓦性能提升 25 倍,GPT-5.6 在 Bedrock 上正式可用

ai-powered-markdown-translator

使用 gpt-5.4-mini 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

本周的焦点是 Demis Hassabis 对前沿 AI 治理的表态、两篇量化 Blackwell 能效提升的 NVIDIA 公告以及一项由智能体驱动的新型研究方法,同时还有 GPT-5.6 在 Amazon Bedrock 上正式可用。其余新闻覆盖了一波开放模型(OCR、视觉-语言、三元量化)、GitHub 和 Manus 在工具链方面的多项新功能,以及 Perplexity 将 WANDR 基准开源。


Demis Hassabis 提议为前沿 AI 制定框架并设立标准机构

7月14日 —— 在 X 上发布的一篇长文中,Google DeepMind 联合创始人兼 CEO Demis Hassabis 就通往通用人工智能(AGI)的路径表明了立场。他认为,具有人类大脑全部认知能力的系统距离现实可能只剩几年,并将这种突破的规模比作发现电力或火,潜在影响可能比工业革命大十倍,而且速度也快十倍。

不过他也警告:当前商业与地缘政治竞争极其激烈,已经没有足够时间去真正理解风险(网络安全,以及最终的核风险和生物风险),也没有足够时间去控制越来越自主、且具备自我改进能力的系统。

他的核心提议是:建立一个专门评估前沿模型的 Standards Body,采用由美国联邦政府监督的公私合营模式——类似金融领域的 FINRA——并由独立技术专家和开源代表组成董事会。其资金主要来自私营部门,目标是吸引顶尖技术人才,并为大规模测试所需的算力提供资金。Hassabis 认为美国最适合率先推动这一举措,同时也呼吁在安全议题上开展国际合作。

If you stop to think about it, we’ve essentially found a way to make sand think. It’s miraculous. The magnitude of this technology’s impact will be unprecedented, perhaps 10x of the Industrial Revolution at 10x the speed.

🇨🇳 如果仔细想想,我们本质上已经找到了一种让沙子思考的方法。这是奇迹。此项技术的影响规模将前所未有,也许是工业革命的十倍,而且速度还是十倍。@demishassabis 在 X 上

🔗 X 上的完整文章


NVIDIA —— 每瓦性能:AI 基础设施效率的关键指标

7月14日 —— NVIDIA 将每瓦性能定义为 AI 基础设施效率的基准指标:在电力供给是最严峻约束的环境中,这一比率决定了一个 AI 工厂在固定功率预算内能产出多少 token,因此也决定了其营收与盈利能力。

公司量化了其 Blackwell NVL72 平台相较 Hopper 代际的提升:

评测模型每瓦性能提升(Blackwell NVL72 vs Hopper)
DeepSeek V4 Pro最高 25x
GLM 5.1最高 20x
Kimi K2.6(长时 agentic 负载)最高 10x

这些提升的一部分来自从 8 单元 GPU 域(Hopper)转向集成 72 GPU 机架,并配备第六代 NVLink Switch,集成网络内计算(SHARP 技术)。除了硬件之外,软件优化也持续带来显著收益:仅用一个月,通过 TensorRT-LLM、Dynamo、SGLang 和 vLLM 这一技术栈,DeepSeek V4 的性能又提升了最高 5x。

在电力基础设施方面,DSX MaxLPS 技术据称可在相同功率预算下多运行最多 40% 的 GPU,这得益于温水冷却与动态功率管理——要知道,如今从电网获取的电力中,只有约 60% 真正转化为工厂中有用的 AI 工作。NVIDIA 将这一思路放在其下一代 Vera Rubin 平台的背景下进行定位,并提及了 Anthropic、OpenAI、CoreWeave、Perplexity 和 Fireworks AI 的生产部署。

🔗 NVIDIA 文章


NVIDIA —— Nemotron Labs:由智能体能力驱动的自主 RL 研究

7月14日 —— NVIDIA 发布了“RL Autoresearch”演示,这是一个由智能体驱动的强化学习研究流程,基于 NeMo RL、NeMo Gym 和可复用技能构建。其思路是:给定一个编码智能体一个目标和时间预算,然后让它自己构建训练环境、训练模型并进行评估,研究者只需监督整体研究方向。

在演示示例中,智能体需要教一个视觉模型数彩色星星。Qwen3-VL-2B 模型的准确率从 25% 提升到 96.9%,而且智能体还自行提出了下一步该做的实验,而不是由研究者指派。

第二个示例属于后训练而非自主研究,但展示了类似用途:一个 Cosmos 3 Nano 模型在零样本评估中明明能看到红绿灯却无法检测,随后通过 LoRA 针对 WTS 验证任务(整合天气、交通与交通信号的驾驶场景)进行了后训练。经过 LoRA 后准确率从 54.41% 提升到 87.14%,再加入 NVIDIA TAO AutoML 后提升到 93.35%——整个过程不到一天。

We gave a coding agent a goal and a time budget: build a training environment and teach a vision model to count colored stars.

🇨🇳 我们给了一个编码智能体一个目标和时间预算:构建一个训练环境,并教会一个视觉模型数彩色星星。@NVIDIAAI 在 X 上

🔗 Nemotron Labs 公告


开放模型与研究

本周在开放模型与研究方面共有七篇发布,主要由 Hugging Face、Together AI 和 Sakana AI 推动。

评测模型发布方参数量许可证关键基准
OvisOCR2独立作者(HF)9亿Apache 2.0OmniDocBench v1.6 上 96.58
MOSS-VL-RealtimeOpen_MOSS110亿Apache 2.0256,000 token 上下文
Ternary Bonsai 27BPrismML约273亿(三元)Together AI 上免费MATH-500 上 99.20

OvisOCR2:9 亿参数的文档识别

OvisOCR2 宣称在 OmniDocBench v1.6 上取得 96.58 分,并表示自己是首个端到端模型,超过了分开处理的流水线系统(OCR、版面检测与分析)。作者提供了一套利用 Hugging Face Jobs 将任意数据集通过 OCR 转成 markdown 的方案,无需本地 GPU。需要注意的限制是:该分数以及“首个端到端模型”的说法都来自公告推文,尚未经过完整模型卡验证。

🔗 X 上的 OvisOCR2 公告

MOSS-VL-Realtime:面向实时视频的开放视觉-语言模型

Open_MOSS 团队发布了一款 110 亿参数的视觉-语言模型,专为持续分析视频流而非孤立图像而设计:它在生成回答的同时持续观察视频;若屏幕中的情况发生变化,还可以修正答案;如果证据不足,则选择保持沉默。Base、Instruct 和 Realtime 三个版本均以 Apache 2.0 发布,并获得 SGLang 和 LMSYS 团队的 day-0 支持。

🔗 X 上的 MOSS-VL-Realtime 公告

LeRobot v0.6.0:原生深度支持

Hugging Face 的开源机器人库新增了端到端原生深度(depth)支持:只需接入 Intel RealSense 摄像头并启用 use_depth: true,深度图就会自动与 RGB 流同步,以 12 位量化并通过无损 HEVC 编码。该功能覆盖 SO-100/101、Koch、OpenArm、reBot 和 Unitree G1。

🔗 X 上的 LeRobot v0.6.0 公告

Sakana Marlin:用于战略研究的“Virtual CSO”

Sakana AI 推出了一款自主研究智能体,它通过 AB-MCTS 引擎和类似 AI Scientist 的流程进行约 8 小时的深入推理,最终产出结构化的战略选项,而不是摘要。交付物包括报告、附录、参考文献和幻灯片。该产品处于 beta 阶段,按用量计费(每个 credit 98 日元),或可提供企业版定制定价。

Ternary Bonsai 27B:手机级格式的三元量化

PrismML 发布了一个基于 Qwen3.6 27B 的三元量化衍生模型(g128 格式,每个权重 1.71 bit,约比 FP16 基线小 9.4 倍),据称可保留全精度质量的 95%。

评测基准分数
MATH-50099.20
AIME 202590.84
HumanEval+93.90
平均值(15 个 thinking 基准)80.49

该模型支持 262,000 token 上下文和视觉输入,并在 Together AI 的无服务器基础设施上免费提供。

🔗 X 上的 Ternary Bonsai 27B 公告

Flash-BoN:为扩散模型重新审视 best-of-N

Hugging Face 的 Sayak Paul 表明,在推理阶段扩展扩散模型时,best-of-N 比此前认为的更稳健的基准,但前提是要同时衡量真实执行时间,而不仅仅是函数评估次数。团队引入了 Flash-BoN,它更强调更广范围的样本探索,而不是反复进行中间验证。

🔗 X 上的 Flash-BoN 公告

Hugging Face 向所有用户开放 ZeroGPU

ZeroGPU 演示(按需免费 GPU)现已向所有 Hugging Face 用户开放,并配有一个 agent skill,可通过自然语言提示直接构建演示。


GitHub、Copilot 与 Manus

代码扫描在 pull request 上显示 AI 安全检测

7月14日 —— GitHub code scanning 现在会将 AI 辅助的安全检测结果直接展示在 pull request 中,把覆盖范围扩展到 CodeQL 不支持的语言和框架。该功能处于公开预览阶段,仍仅供参考:它不会阻止合并,需要启用 default setup CodeQL、Copilot 许可证,并且只在发生检测时消耗 AI credits。

🔗 GitHub Changelog

Dependabot 默认增加等待期

7月14日 —— Dependabot 现在在发布新版本后会默认等待三天,再打开更新 pull request,以减少供应链攻击面。该延迟可通过 cooldown.github/dependabot.yml 选项进行配置;安全更新仍然会立即执行。该功能将从 3.23 版本开始进入 GitHub Enterprise Server。

🔗 GitHub Changelog

GitHub Copilot 应用中的 /security-review

7月14日 —— /security-review 命令已在 GitHub Copilot 应用中进入公开预览:它会分析正在进行的代码变更,并按严重程度和置信度返回结果,同时给出无需离开应用即可直接应用的建议。它覆盖注入、跨站脚本和路径遍历等问题,并可供 Free、Pro、Business 和 Enterprise 方案使用。

🔗 GitHub Changelog

Manus 现在可直接生成原生 .pptx

7月14日 —— 过去 Manus 会先生成幻灯片再转换为 .pptx;现在它可以直接生成原生 PowerPoint 文件,并且图表是真正可编辑的(数值变动时会重新绘制),还能选择是否启用标签、网格线和图例。

🔗 Manus 公告

Manus 推出生成网站的自动发布功能

7月13日 —— 新的 auto-publish 选项会自动将某个网站每次成功构建后的版本部署到其线上 URL,默认关闭。配合变更队列使用后,它消除了从构建到上线之间最后一道手动步骤。

🔗 Manus 公告


图像与视频生成

Wan-Dancer-14B:开源舞蹈视频生成

7月14日 —— 阿里巴巴开源了 Wan-Dancer-14B,这是一个可本地运行的模型,专注于生成长时长、节奏感强的舞蹈视频,目标是让动作与音乐在长序列中保持同步,而不仅仅是生成短片段。

🔗 阿里巴巴 Wan 公告

HeyGen:实时头像的逐词时间戳

7月14日 —— HeyGen 记录了其 Avatar Realtime API 的一个非公开流程:一个逐词时间戳通道({mot, début, fin}),可精确同步动作和语音。文本发送确认大约在 70 毫秒内返回,但真正说出某个词通常要几秒后,因此需要每秒约四次重新计算锚点。该机制已通过一档 24 小时直播的 Twitch 节目验证,共作出 9,269 次实时裁决。

🔗 HeyGen 文章

HeyGen —— Figma → HyperFrames,第 9/30 天

7月14日 —— /figma 技能可直接从 Figma 文件中导入素材、品牌 token、组件、动效时间线和 storyboard。演示中,团队导入了 27 种命名颜色和样式,并将一个由 8 个画面组成的 storyboard 还原为一份实时演绎的拍摄脚本。

🔗 HyperFrames 仓库

NVIDIA —— Nemotron:客户企业的量化反馈

7月14日 —— NVIDIA 公布了围绕 Nemotron 开放模型的多项量化客户案例:H Company 使用 Holotron 3 Nano 在 OSWorld-Verified 上超过 76% 准确率;Harvey 将 Nemotron 3 Ultra 进行后训练,其单次运行成本至少比封闭替代方案低 10 倍;Arcee AI 声称其成本约为可比封闭模型的 1/20,同时在 PinchBench 上排名第二;Abridge 和 YTL AI Labs 则分别将其定制用于临床对话和马来语。

🔗 NVIDIA 文章


Anthropic

Claude for Teachers:面向美国 K-12 教师的免费访问

7月14日 —— Anthropic 为经验证的美国 K-12 教师推出 Claude 高级能力的免费访问,并提供教学技能库,以及通过 Learning Commons 连接经审核的课程项目,这些项目与 50 个州的标准一致。对话内容绝不会用于模型训练,而学生数据则受符合 FERPA 的数据处理协议保护。

🔗 Anthropic 公告

Artifacts:公共分享、多用户协作编辑与通过 Claude Tag 创建

7月13日 — Artifacts 新增公共分享功能(任何持有链接的人都可查看)、同步多用户编辑(Team 和 Enterprise 方案),以及可在 Slack 中通过 Claude Tag 在讨论串里一句请求直接创建内容。

🔗 Anthropic 公告


OpenAI

GPT-5.6 在 Amazon Bedrock 上全面可用

7月13日 — 7月9日发布的三款 GPT-5.6 模型——Sol(旗舰推理)、Terra(中间层)和 Luna(快速推理)——现已在 Amazon Bedrock 上全面可用,运行在为性能、安全性和规模而设计的全新 Bedrock 推理引擎上。这进一步扩展了 GPT-5.6 的访问入口,除了 ChatGPT、OpenAI 直接 API 以及第三方集成(Copilot、M365、Warp、Cursor、Devin)之外。

🔗 AWS 公告

Codex 成为 JetBrains AI 的默认推荐代理

7月14日 — JetBrains 将 Codex 设为 JetBrains AI(IntelliJ IDEA、PyCharm、WebStorm)中的默认推荐代理,这是一个非排他性选择——用户可随时切换到其他代理——并会随着模型演进每月重新评估。

🔗 JetBrains 公告


Gemini

Gemini 在英国上线 Google Chrome

7月14日 — Gemini 现在可从英国境内打开的任意 Chrome 标签页直接调用,无需切换上下文:可总结页面、比较不同标签页中的内容,并回答关于屏幕所示内容的问题。

🔗 Google 英国公告

首份 Gemini 东南亚报告:创纪录采用率与 Gemini Spark

7月14日 — Google 发布了首份《Gemini Southeast Asia Report》:在六个主要市场(印度尼西亚、马来西亚、菲律宾、新加坡、泰国、越南),活跃用户数在一年内增长超过一倍;近 70% 的请求以本地语言提交;过去一年通过 Nano Banana 生成了 50 亿张图片。借此,Google 面向该地区 Advanced 订阅用户推出 Gemini Spark,这是一款可用本地语言处理 Workspace 任务的主动式代理。

🔗 Google 报告


开发工具与代理

Devin Fusion:一款路由到 Fable 5 的预览代理

7月13日 — Cognition 推出 Devin Fusion,这是一款在 Devin Cloud 中提供的预览代理,其中一个模型扮演管理者角色,把任务委派给更经济的模型,而不是全部由单一高级模型执行。团队表示,Fable 5 的行为更像一位会通过撰写完整规格来委派工作的管理者,而像 Opus 4.8 这样的其他模型则更倾向于微观管理并耗尽上下文。因此,单任务成本低于 Opus 4.8,尽管 Fable 5 的单价更高——但在串行调试场景下,节省仍然更难实现。

🔗 Cognition 公告

Perplexity 将其 WANDR 基准开源

7月14日 — Perplexity 发布 WANDR(Wide ANd Deep Research),这是一个用于评估研究代理在广泛且深入任务上的内部基准:包含 500 个任务、170,495 条可逐条验证的记录,覆盖三个难度等级。评分器会重新获取每个被引用页面,以验证每个断言都由底层证据支持。在对六个生产系统的测试中,结果依然有限:宽松 F1 仅 0.363,严格 F1 只有 0.133,而单任务成本则因设置不同在 0.03 美元到 324.83 美元之间。

🔗 Perplexity 在 X 上的公告 · GitHub 基准


简讯

  • Anthropic 投入 1,000 万加元,用于资助加拿大的新 AI 研究工作,并与当地机构合作。 🔗 来源
  • Cognition 庆祝收购 Windsurf 满一周年:年化收入从 7,300 万美元增长到超过 5 亿美元,已编写超过 2,000 万行代码,并统一到 Devin Desktop 品牌之下。 🔗 来源
  • Amp(Sourcegraph)发布了一个公共仪表板,可为所有用户及内部团队实时展示其代理模式的使用情况。 🔗 来源
  • Warp 通过 MCP 集成 Sentry,可在终端内完成根因分析(Seer)并创建拉取请求,无需离开终端。 🔗 来源
  • Composio 登陆 Warp,将代理连接到 1,000 多个应用(Gmail、Slack、Linear、Google Calendar)。 🔗 来源
  • Zach Lloyd(Warp CEO)发表文章,讨论代理如何从交互式工具演进为自动化整个软件生命周期的“cloud software factories”。 🔗 来源
  • Hugging Face Jobs 现在允许在 Job 中直接挂载本地目录,使用 -v dossier:/chemin,无需先上传到仓库。 🔗 来源
  • llama.cpp 庆祝第 10,000 个发布版本(release),未提供额外技术细节。 🔗 来源
  • LlamaCoder v4(Together AI)可通过单个提示生成完整应用,以 GLM 5.2 为核心重构,并配备新的 WebAssembly 渲染引擎,免费且开源。 🔗 来源
  • NotebookLM 总结其近期功能(Drive 自动同步、笔记本固定、幻灯片重排、移动端分享),并预告一项尚未展开说明的后续公告。 🔗 来源
  • GitHub 现在允许在 Code Quality 许可费用上调至每位活跃贡献者每月 10 美元之前,先估算其许可成本(活跃提交者、月度预测),上调计划定于 2026 年 7 月 20 日生效。 🔗 来源
  • NVIDIA 推出“AI Model Co-Design”新系列,聚焦模型维度与 GPU 性能之间的协同。 🔗 来源
  • Kling AI 公开了《ODYSEEUS: The Fall》的预告片,这是由 Ash Koosha 执导、来自 Fountain 0 工作室的第二部长片 AI 作品。 🔗 来源
  • OpenAI 发布了一份 Enterprise 指南,讨论在代理时代如何指导 AI 投资,重点是衡量每花一美元所产生的有效工作量。 🔗 来源
  • OpenAI 详细说明销售团队如何使用 ChatGPT Work 来处理管道记录、会议准备以及停滞交易的诊断。 🔗 来源
  • OpenAI 详细说明数据科学团队如何使用 ChatGPT Work 来编写根因笔记、影响说明以及仪表盘规格。 🔗 来源
  • Cohere 联合赞助 Hugging Face 黑客松,并奖励两个项目:Tiny Army(第二名,Thousand-Token Wood 赛道)和 Eyas,一个视频监控代理(最佳代理奖)。 🔗 来源

这意味着什么

在硬件层面,NVIDIA 的传播围绕一个核心观点展开:如今限制 AI 工厂盈利能力的,不再是硅,而是电力。Blackwell 在每瓦性能上的提升(在 DeepSeek V4 Pro 上最高达 25 倍),以及 Nemotron 客户案例中按数量级降低的成本,讲述的是同一件事:能效与每个 token 的成本,正成为主要卖点,而不再只是裸性能。RL Autoresearch 的演示也朝着同一方向推进,目标是把研究—训练—评估这一此前高度依赖人工的循环本身自动化。

在开放模型领域,这一周展示了细分方向的快速分化:超轻量文档识别(OvisOCR2)、连续视频理解(MOSS-VL-Realtime)、带原生深度感知的机器人技术(LeRobot),以及最引人注目的 Bonsai 27B 三值量化——它让具备 270 亿参数级别的多模态能力,装进了堪比手机的内存占用。由 Hugging Face、Together AI、Sakana AI 以及独立团队推动的这些发布,说明开源生态仍在紧跟闭源模型的能力,同时大幅降低推理成本。

在治理层面,Demis Hassabis 的介入与常规产品公告的语气截然不同:他明确指出,当前商业竞赛的速度已经超越了社会对风险的集体理解,并提出一个具体机制——一个受 FINRA 启发的 Standards Body——而不是仅仅呼吁谨慎。该提议来自 Google DeepMind 的 CEO,且正值这一周其他产品集中发布之际,说明整个行业始终处在商业节奏与监管前瞻之间的张力之中。

最后,开发者工具仍在围绕模型之间的分工而非单一更强模型的竞赛重新组合:Devin Fusion 采用由管理模型向更便宜的执行模型分派任务的策略,GitHub 将 AI 辅助安全扫描直接扩展到拉取请求中,而 Perplexity 则开放其 WANDR 基准,用以客观衡量研究代理的真实边界——这也提醒我们,即便是当前最优秀的系统,在大规模事实核验任务上也仍远未达到完全可靠。


来源