搜索

Grok 4.7 当日登陆 Cursor 和 Copilot,OpenAI 公布已解决逾 100 道数学难题,Googlebook 开启预购

ai-powered-markdown-translator

使用 gpt-5.6-sol 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

9 月 21 日星期一,这一天属于 xAI:Grok 4.7 正式发布,并于当天登陆 Cursor 和 GitHub Copilot,从模型官宣到进入工具没有任何延迟。OpenAI 也选择在同一天披露,一个自 8 月 28 日起训练的内部模型已经解决了一百多个数学开放问题;此外,在一份由 27 位 Fields Medal 得主联署的声明发布后,该公司还成立了一个数学家咨询小组。Google 开启 Googlebook 预购,ElevenLabs 将剪辑代理置于其视频编辑器的核心,而 Hugging Face 则重新发布了速度提高 3 至 30 倍的 tokenization 库。


Grok 4.7 由 xAI 发布,并于当天登陆 Cursor 和 GitHub Copilot

9 月 21 日 — xAI 发布 Grok 4.7,这是其在代码和知识工作方面能力最强的模型。其基础模型比 Grok 4.6 更大,强化学习(reinforcement learning)阶段也有所延长,所用任务组合更侧重需要数小时解决的问题。xAI 希望由此得到一个更善于检查自身工作、也更能驾驭长上下文的模型。

数据呈现出的是一幅优势各异的图景,而非全面领先。不过定价没有变化:每百万输入 tokens 2 美元、输出 tokens 6 美元,与 Grok 4.6 相同;其输入价格仅为 GPT-5.6 Sol 的一半、Fable 5.1 的五分之一。这正是其性价比论点的核心。

已公布指标Grok 4.7 (xHigh)Grok 4.6 (High)GPT-5.6 Sol (Max)Fable 5.1 (Max)
CursorBench 4.046,3 %40,4 %41,7 %51,8 %
Terminal-Bench 4.038,0 %20,3 %37,3 %57,9 %
EEBench(电气工程)64,0 %53,0 %39,4 %56,4 %
输入价格(美元/百万 tokens)22410
输出价格(美元/百万 tokens)662050

API 提供 grok-4.7,上下文容量为 500,000 tokens,并设有从 lowxhigh 的四档推理强度;当 prompt 超过 200,000 tokens 时,价格翻倍。xAI 还重点宣传了一套全新的安全防护体系:在 LatchBio 生物安全 benchmark 中以 62.4% 位居第一;在 HackerBench v0.3 中,仅有 3.3% 的高风险军民两用网络 prompt 未被拦截。

两家集成商均立即完成部署。Cursor 从首日就开始提供该模型——这是 SpaceX 收购 Anysphere 所带来的结果,该交易已于 8 月 14 日完成。模型仍归 xAI 所有:Cursor 博客当天发布的文章只有一句话,并链接至 x.ai 上的完整公告。重点宣传 CursorBench 4.0 的也是 xAI;这是 Cursor 面向长时任务的 benchmark,Grok 4.7 在价格不变的情况下取得了 46.3% 的成绩。GitHub Copilot 则将其部署到从 VS Code 到 Xcode 的全部平台,覆盖 Pro 至 Enterprise 套餐。这里的计费方式值得关注:Grok 4.7 不采用请求倍数机制,而是根据使用量按供应商的公开价格计费。由于新模型会默认启用,要控制开支就必须调整模型策略,不能只是放任不管。

🔗 Grok 4.7 — xAI 🔗 Grok 4.7 现已登陆 GitHub Copilot


OpenAI 成立数学家咨询小组,并披露已解决逾百个开放问题

9 月 21 日 — OpenAI 宣布与一个由九位数学家自行组建、设于 Princeton Institute for Advanced Study 的独立咨询小组展开合作。其背景比公告本身更为重要。

On August 28, we began training a new internal model. In addition to resolving the Navier–Stokes Millennium Prize problem, this model has now resolved more than 100 long-standing open problems across most areas of mathematics.

🇨🇳 8 月 28 日,我们开始训练一个新的内部模型。除了攻克千禧年难题 Navier-Stokes 问题外,该模型如今还解决了数学大多数领域中超过 100 个长期悬而未决的开放问题。 — OpenAI,数学与人工智能咨询小组

该模型尚未公开命名,OpenAI 表示,这一进展速度甚至令公司自己的数学家感到惊讶。这种加速引发了直接反弹:9 月 11 日,一份题为《数学领域人工智能的严重失调》的声明发布,并获得 Zenodo DOI;共有 27 位 Fields Medal 得主署名,包括 Terence Tao、Peter Scholze 和 Cédric Villani。他们的观点并非模型会犯错。解决重大问题一直意味着获得新的理解,随后由学术界持续研究,直至转化为可以传授的知识;签署者担忧,大量生产真伪难辨的命题会摧毁而非滋养这种土壤,同时仓促发布公告也不会为正确撰写成果留下足够时间。

这套机制确实以独立性为基础:小组可以主动提出意见,可以公开评论 OpenAI 对数学领域的影响,也可以在无须公司批准的情况下调整成员组成,其成员也不从 OpenAI 获得报酬。不过,OpenAI 在同一段末尾还写下了一句话:该小组不会就公司内部进展的速度提供建议。因此,其权限范围涵盖成果发布,却不涉及成果生产——唯独没有触及引发抗议的核心。Martin Hairer 同时出现在两个名单上,既是声明的签署者,也是该小组成员。

🔗 数学领域人工智能的严重失调


Googlebook,以 Gemini 为核心设计的 Google 笔记本电脑产品线

9 月 21 日 — Google 开启 Googlebook 预购,并将其定位为一个独立品类:采用 Android 技术栈,继承 ChromeOS 的 desktop 基础,同时围绕 Gemini 进行整体设计。由 Acer、ASUS、Dell、HP 和 Lenovo 制造的五款机型同步推出,起售价为 899 美元。美国将于 10 月 4 日开始交付,加拿大、英国、爱尔兰、法国、德国和澳大利亚则于 10 月 5 日开始交付。

已公布规格参数
起售价899 美元
处理器Intel Core Ultra Series 3 或 Snapdragon X Elite
NPU超过 45 TOPS
内存标配 16 GB,最高 32 GB
续航时间视频播放最长 14 小时,网页浏览最长 16 小时
软件支持最长 10 年更新

其中三项 Gemini 功能为该设备独有。Magic Pointer 可通过晃动光标触发,让 Gemini 处理屏幕上显示的元素,例如分析可疑电子邮件或组合多张图片;Google 强调,该功能仅会在用户主动要求时启动,并且可以关闭。Rambler 能把零散的口述内容整理成带有标题和任务列表的结构化文本,即使说话者在句子中途切换语言也能处理。Create My Widget 则可根据自然语言描述生成桌面 widgets。

对于开发者,每台设备均预装 Google 的开发代理平台 Antigravity,并提供带完整终端的隔离 Linux 环境——文档明确提到,可在其中运行 Claude Code 或 Antigravity CLI。这种隔离依托通过 Level 5 认证的 pKVM hypervisor,Google 称其为该品类中的首创,另有 Titan 硬件信任根作为补充。与 Android 手机的连续体验则构成了剩余部分:用户可以接续从移动端开始的任务,也可以在桌面窗口中串流运行移动应用。每台 Googlebook 均附带 12 个月的 Google AI Pro 和 5 TB 存储空间、3 个月的 YouTube Premium 和 Photoshop,以及一年 GeForce NOW 服务。

🔗 Googlebook 预购


ElevenLabs 在 Studio 4.0 中加入剪辑代理

9 月 21 日 — ElevenLabs 在 ElevenCreative 中发布 Studio 4.0,这是其视频编辑器的一次更新。其核心理念可以概括为一句话:所有操作都在同一处完成。用户可以直接在项目中生成视频、图像、语音、音乐和音效,无须离开编辑器即可调用 ElevenCreative 的全部模型,并在同一界面中依次完成剪辑、字幕制作和导出。用户可以重新制作单个镜头,无须重新执行完整生成流程;字幕也可以像时间线(timeline)中的其他任何 clip 一样进行操作。

最具结构性的新功能是 Studio Agent,这是一位存在于每个项目中的协作剪辑助手。

Studio Agent is your AI co-editor, built into every project. Describe the change you want and it makes the edit. Step in and make cuts whenever you like, then hand the timeline back to the agent.

🇨🇳 Studio Agent 是集成到每个项目中的 AI 协作剪辑助手。只需描述你想要的改动,它便会完成剪辑。你可以随时介入并自行裁剪,之后再把时间线交还给代理。@ElevenLabs 在 X 上

这种来回交接正是该工具与不透明生成方式的区别:剪辑师可以随时接管,之后再把时间线交还给代理。时间线本身也已针对多场景、多轨道项目重新构建,例如广告活动、教程和系列短视频;它支持逐帧缩放、clips 吸附,以及移动一组 clips 而不让其余内容失去同步。团队评论可以直接附加到特定 clip 或 asset 上,而不必分散在不同的讨论串中。

值得持续关注的是:在扫描时,该公告仅以六条消息组成的帖子形式发布于 X。ElevenLabs 博客的最新文章仍停留在 9 月 10 日,文档 changelog 的最新条目则是 9 月 14 日。

🔗 ElevenCreative 中的 Studio 4.0


Hugging Face 发布 tokenizers v1,在标识符完全相同的情况下提速 3 至 30 倍

9 月 21 日 — Hugging Face 发布 tokenizers v1 候选版本。这是一个 Rust 库,负责在模型读取文本之前将其转换为整数序列。其出发点很简单:tokenization 从来不是机器学习流程的瓶颈,但随着模型速度提高,平衡正在发生变化,而等待处理器的 GPU 就是一块闲置的 GPU。

指标实测值
相较 v0.23 的单线程编码提速3 至 30 倍
测试机器Apple M4 Max
区间下限和上限t5-base 和 gpt2
扩展至八个 workers 时达到线性扩展的 76%
生成的 token 标识符与 v0.23 完全相同
候选版本安装方式cargo add tokenizers --pre

团队为自己设定的约束比性能提升本身更有意思:v1 生成的 token 标识符与 v0.23 完全一致,API、词表和合并排名(merge ranks)均保持不变;该库也继续保持通用性,而非专门针对 BPE 优化。因此,升级时除了更改安装版本外,无须进行任何其他调整。

六项改动承担了大部分优化工作,其中最不同寻常的一项名为 bitcannon。用于将文本切分为预 tokens 的正则表达式是随 tokenizer 一同提供的固定参数,因此没有理由在每次编码时都让通用引擎对其进行解释。Hugging Face 因而手工编写切分函数,使其通过 SIMD 在位流上运行,每次寄存器操作处理 64 字节。其代价也很明确:只有已识别的模式(GPT-2、cl100k、o200k、Tekken、DeepSeek)能够获益,其他模式仍沿用 regex 路径——这也解释了提速幅度为何介于 3 倍和 30 倍之间。其他改进还包括无分配、无分支的合并循环、线程本地单词缓存,以及原生并行处理。面向 ExecuTorch 和 llama.cpp、仅用于推理的 C 与 C++ bindings 预计将在 1.0.0 之前推出。

🔗 tokenizers v1:编码、解码与扩展的实测表现


Devin Cloud 登陆终端,并开放代理机器的 SSH 访问

9 月 21 日 — Cognition 将 Devin Cloud 引入终端:通过 devin --cloud,或在进行中的 session 内使用 /cloud,即可在不离开 CLI 的情况下创建、控制和恢复 cloud session。该机制依赖一条双向命令:/handoff 可将当前任务转移至 Devin 的 virtual machine——支持 Mac、Linux 或 Windows;而在 cloud 中执行该命令时,则会反向传输,取回 pull request 的 branch。cloud sessions 不会随着启动它们的终端关闭而消失。

And for the first time, SSH into Devin’s dedicated VM, then /handoff the work back to your own device.

🇨🇳 此外,你首次可以通过 SSH 连接至 Devin 的专用 virtual machine,再使用 /handoff 将工作带回自己的设备。@cognition 在 X 上

devin ssh 提供对代理所构建环境的完整访问权限:修改代码、启动开发服务器、转发 ports,以及通过 scp 取回文件。运行环境由此不再是黑箱。Devin Cloud 中的 SWE-2 sessions 在 10 月 8 日前免费。

🔗 终端中的 Devin Cloud


Qwen Code v0.24.3 为 Web Shell 添加遥测,并通过 JDBC 持久化会话

9 月 21 日 — Qwen Code 在 v0.24.2 发布次日升级至 v0.24.3:包含三十一项 pull request,没有不兼容变更。最明显的工作集中在 Web Shell 上,其执行结果不再是纯文本,而是将命令、输出、执行详情和耗时分离的结构化数据。一个默认禁用的 trajectory 标签页会显示每轮耗时、首个 token 响应时间、token 数量以及每次工具调用的持续时间。

不太显眼的部分可能更具结构性意义。runtime 新增了基于 JDBC 的绑定与会话持久化功能,使多个 broker 进程能够共享状态,并在重启后保留会话所有权。此外,runtime 工具通过 bwrap 路由,并采用不可变 workspace 策略——这是前一天引入的沙箱机制的直接延续,其配置仍未开放。同一天,TypeScript SDK v0.1.14 集成了此 CLI,Qwen Code Desktop v0.24.3 也随之发布。

🔗 Qwen Code v0.24.3 版本说明


Hugging Face 开源 relore,为代码智能体提供代码库记忆

9 月 21 日 — Hugging Face 以 Apache-2.0 许可证发布 relore,这款工具能让代码智能体拥有代码库记忆。它源于一次事故:在 9 月 8 日创建的 Transformers #48630 工单中,已有两个修复方案被提出,而公司的持续集成智能体却准备再编写第三个。所有相关信息其实都在 GitHub 上,但分散在工单、pull request 和从原始工单中无法看到的评论里。

relore 在索引这些历史记录时会保留发言者身份:维护者的决定与贡献者的假设权重不同,而机器生成的内容默认会被排除。系统会在索引旁维护一个工作 clone,由同一个 HTTP API 提供服务,并在本地处理查询——只有数据摄取过程会连接 GitHub。其操作包括:inflight 列出声称已解决某个工单的讨论串;search --trust authoritative 找出了导致回归问题的 PR #39847;why 则从一行代码出发,查找围绕它的代码审查评论。在一次实际测试中,智能体报告称,与完整读取文件相比,defs 仅使用 5% 的 token 就能让它更全面地了解该文件。

🔗 relore:代码智能体的代码库记忆


Perplexity 利用用户错误对 Computer 进行后训练,并为其增加视频功能

9 月 21 日 — Perplexity Research 详细介绍了公司如何利用用户的真实会话,对其 Computer 智能体所使用的模型进行后训练——文章同时透露该模型为 GLM 5.2。合成环境能够生成可控且易于验证的任务;真实会话则提供合成环境无法产生的两类信号:用户作出的纠正,以及工具返回的错误。包含个人数据的会话,以及拒绝将数据用于训练的用户会话,都会在任何采样之前被排除。

随后,每一轮会接受三种处理之一:对成功会话中没有错误的轮次进行交叉熵模仿;对附有有效提示的错误轮次进行 Kullback-Leibler 散度纠正;或仅将其保留在上下文中。同一组权重同时充当教师与学生,但只有教师能看到提示。三个自动评审器会找出可能导致问题的轮次,且至少两个必须得出一致结论,因为用户投诉前的最后一轮只有约一半概率是真正原因。

工具错误率测量值
离线,原始 GLM 5.22.79%
离线,仅使用拒绝采样1.35%
离线,使用自蒸馏0.87%
在线,两个 checkpoint 之间先为 2.24%,后为 1.77%,相对下降 21.2%

作者明确说明了这些数字不能证明什么:离线比较的 checkpoint 并非使用相同数据训练,各任务的结果仍然好坏参半,而且在每个实验组约十万名用户的 A/B 测试中,用户不满意率并未显著变化,分别为 2.58% 和 2.54%。

同一天,Computer 新增了视频生成功能,由两个第三方模型提供支持:MiniMax H3 和 ByteDance Seedance 2.5。无论是营销短片、产品演示还是社交媒体视觉素材,最终生成的视频都会与同一请求所产生的文本和图片出现在同一个对话串中。该功能面向 Pro 和 Max 订阅用户开放,未提及免费访问或通过 API 提供。

🔗 从现实世界的错误中学习 🔗 Perplexity Computer 与视频模型


Gemini Notebook 全面开放 Live Chat 和 Interactive Learning Overviews

9 月 21 日 — Gemini Notebook 在同一天完成了两项功能的部署。Live Chat 已覆盖 100% 的 Ultra 移动端订阅用户:用户可以通过约 100 种语言与 notebook 进行实时语音对话;该功能由 Google 最新音频模型提供支持,可在几乎完全免手动操作的情况下提供逐步指导。数小时后,Interactive Learning Overviews 结束渐进式部署,向所有用户开放,不再要求订阅;它位于 Reports 下方,将来源摘要与 studio 产物汇集到同一个交互空间中。

这两项功能均于 9 月 15 日在新学习工具公告中首次亮相。21 日发布的消息并未增加任何功能,只是确认它们已经真正可用:前者完成全面部署,后者向所有用户开放。

🔗 Live Chat 已完成 100% 部署 🔗 Interactive Learning Overviews 向所有用户开放


Google.org 投入 400 万美元用于教师 AI 培训

9 月 21 日 — Google.org 宣布向 Digital Promise 投入 400 万美元,该消息于纽约联合国大会期间公布。这笔资金将用于扩展 Google AI Educator Series,这是一项于今年早些时候公布的免费培训计划,面向美国 600 万名小学、中学和高等教育教师。该课程与 ISTE 共同设计,采用教师培训教师的方式,重点培养可在不同工具之间迁移的技能,而非教授某一特定产品;课程由可自主安排进度的模块组成,并通过数字徽章进行认证。

Digital Promise 将从三个方面开展工作:帮助各州教育机构和学区调整培训内容;与 community college 网络合作,为低年级本科生教师提供支持;以及开展一项为期两年的研究,调查哪些措施真正有助于高等教育教师,研究结果将发布在一份免费公开指南中。

🔗 Google.org 与 Digital Promise


Runway 将 Workflows 扩展至合成、透明度与深度图处理

9 月 21 日 — Runway 扩展了其 Workflows,也就是可在应用程序中组合的一系列操作,新增五个面向后期制作的模块:Compositing、Alpha、HDR、Depth Map 和 RGB Depth。公告用一句话概括其价值——在同一处构建制作流程(pipeline)的更多环节,无需在不同步骤之间切换至其他工具。合成与 alpha 通道管理用于组合多个图像图层;两种形式的深度图则作为几何信号,用于控制依赖相机距离的效果。该公告在 X 上发布,并附有一段 31 秒的演示;扫描时,Runway 新闻页面上尚无对应文章。

🔗 Runway 扩展 Workflows


NVIDIA 推出 DSX Ready,为 AI 工厂供电与冷却设备建立认证计划

9 月 21 日 — NVIDIA 推出 DSX Ready,该计划依据其 AI 工厂 DSX 参考架构的要求,对合作伙伴产品进行认证。其出发点非常务实:供电、冷却、水资源、场地和电网如今决定了建设方实际能够部署什么,而与整体设计不匹配的设备无法将算力转化为有效产能。

认证类别首发合作伙伴认证流程
电池储能Hitachi Energy、LG Energy Solution、Tesla合作伙伴测试、NVIDIA 审查与批准
冷却液分配单元LG Electronics、LiquidStack、Vertiv自我认证套件

NVIDIA 明确限定了该标签的含义:通过认证不能替代场地层面的工程设计,也不代表对场地稳定性作出任何保证。未来还将逐步增加涉及基础设施和软件的其他类别。

🔗 NVIDIA DSX Ready


NVIDIA 将智能体安全视为逐层解决的工程问题

9 月 21 日 — NVIDIA 发布了关于智能体系统安全的立场:这是一个工程问题,因此需要明确的要求、可执行的控制措施、指定的负责人,以及保护机制确实有效的证据。整个技术栈被划分为三个层级——模型提供能力,harness 组织上下文、工具和工作流,运行环境提供执行操作所需的基础设施——每一层都有各自的控制措施。

其示例颇具代表性:一个智能体在更新客户记录时,在附件文档中遇到恶意指令,并试图将数据导出至未经授权的目的地。NVIDIA 期望此时由网络策略阻止传输,并由受保护的日志记录尝试发起的工具调用、授权决定及其结果。更新记录的权限不包含导出记录的权限,而且智能体可以请求访问权限,却绝不能自行授予权限。在工具方面,OpenShell 会在智能体无法触及的范围内执行策略;Cisco 在其上叠加 DefenseClaw,JFrog 则验证智能体可以访问的 skills。

同一天发布的另一篇文章将相同思路应用于物理 AI,并将其与 Halos 基础体系关联起来;该文及其中两项市场预测列于下方简讯中。

🔗 保护智能体技术栈


Earth-2 融合本地观测数据以刷新天气预报

9 月 21 日 — NVIDIA 发布了一篇关于 Earth-2 AI 数据同化工具的教程,这些工具面向已经拥有自有测量数据的行业,包括风电场和太阳能电站、本地雷达与传感器,以及卫星观测。第一种技术 SDA 适用于 CorrDiff 和 StormCast 等 diffusion 模型:在每个去噪步骤中,它都会将中间结果与观测数据进行比较,并据此引导下一步,无需重新训练。

测量技术覆盖范围与分辨率示例中报告的改进
CorrDiff-SDA欧洲,从 0.25 度提升至 2.2 km被排除站点的风速 RMSE 降低 54%
StormCast-SDA美国本土,3 km,使用 HRRR 初始化六个时间步内的风速 RMSE 降低 7.2%
HealDA全球,1 度 HEALPix 网格数秒内估算全球大气状态

其价值首先体现在运营层面:数值分析需要大量计算时间,并按固定时刻发布;SDA 则能持续融合观测数据,弥合与当前时刻之间的差距。HealDA 会将每个数据流视为时空中的点云,将其聚合至目标网格,然后传入 vision transformer 类型的主干网络(backbone)。

🔗 Earth-2 中的数据同化


Multiverse Computing 像处理 Ising 自旋玻璃一样剪除模块,MMLU 提升 23 个百分点

9 月 21 日 — 删除整个 transformer 模块,是加速大型语言模型成本最低的方法之一,也是最激进的方法之一:模型在字面意义上变得更短,但删除错误的模块会使其彻底崩溃。Multiverse Computing 认为,问题的提出方式有误。现有方法会孤立地评估每个模块——magnitude、sensitivity、block influence——作者将这种方式称为平均场方法,但删除某个模块的影响其实取决于同时删除了哪些其他模块。

因此,选择过程变成了一个带约束的二元优化问题,并被映射为 Ising 自旋玻璃:这是一个具有全连接相互作用的无序自旋系统,其中朝上的自旋数量固定。其实际价值可概括为一句话:该系统的能量可以低成本替代剪枝后模型的得分,从而无需在 benchmark 上实际评估,就能对大量候选配置进行排序。在将 Llama-3.3-70B-Instruct 压缩 50% 时,作者声称其 MMLU 得分比表现最佳的竞争方法高出近 23 个百分点。

🔗 像物理学家一样剪枝 LLM


简讯

NVIDIA 于 9 月 21 日发布了七篇博文和消息:其中三篇已在上文介绍,其余四篇列于此处,均不含技术公告。

  • NVIDIA 呼吁为物理 AI 的每一层提供安全保障——这篇立场文章引用了两项市场预测:ABI Research 预计,到 2035 年将有 4900 万辆配备 3 至 5 级自动驾驶功能的汽车投入使用;Omdia 预计,2026 至 2035 年间将部署约 6000 万台工业机器人。文章提出四项安全要求,并将其与 NVIDIA Halos 基础体系相联系。🔗 来源
  • NVIDIA 强调埃及 AI 生态系统的规模化发展——活动在 Grand Egyptian Museum 举行,由 EMEA 副总裁 Paolo Guglielmini 致开幕词。导语主要指出,AI 工厂正在南非、摩洛哥和尼日利亚投入运营。🔗 来源
  • NVIDIA 盘点五家将 AI 应用于低碳能源的企业——这篇为 New York Climate Week 发布的综述涵盖了从加速核聚变到再利用回收电动汽车电池等领域。ThinkLabs AI 基于 CUDA 构建数字孪生和智能体,以缩短并网周期。🔗 来源
  • NVIDIA 公布 GTC Berlin Golden Tickets 获奖者——评审团为 2026 年 10 月 20 日至 22 日举行的会议选出了六名获奖者。不含技术内容。🔗 来源
  • vLLM、SGLang、ComfyUI 和 Hugging Face 首日即支持部署 Qwen-Image-2.1——借助 CPU 卸载,SGLang-Diffusion 可在一张配备 24 GB 显存的 RTX 4090 上运行该模型,生成一张 1024×1024 图像需要 18.7 秒,占用 22.7 GiB。vLLM 将其描述为一个拥有 71 亿参数、与 Qwen3-VL-8B 搭配使用的扩散 Transformer。🔗 来源
  • OpenAI Academy 新增四条学习路径——Build with AI、Lead AI Adoption、AI for Educators 和 AI for College Students 加入 Apply AI at Work。每门课程最后都有一项评估,通过后可获得徽章;开发者路径将 Codex 的操控与基于 API 的构建分开教授。🔗 来源
  • Runway 在旧金山举办围绕其 API 的黑客松——这场单日活动将于 9 月 30 日在 Masonic 举行,作为 Runway AI Summit 的配套活动,参与者可构建智能体、应用程序或创意工作流,无须准备演示文稿,也没有审批流程。🔗 来源
  • HeyGen 重点介绍与 Google DeepMind 和 Kaggle 共同构建的基准测试 Code2Video——它衡量的并非代码编写能力,而是另一个问题:这些代码能否生成值得观看的视频。该内容发布在一条介绍基于代码生成的智能体视频技术栈的消息评论中。🔗 来源
  • Suno 展示通过简单描述应用音效——这段一分钟的演示从温暖的饱和效果延伸至更具实验性的呈现。没有功能名称、适用套餐或配套博文:这是一次产品展示,而非正式发布。🔗 来源
  • Gemini 在 Discord 上进行购物功能直播演示——该活动定于 9 月 22 日星期二太平洋时间 11 时在官方 Discord 服务器举行,内容包括购买规划、选项比较以及根据照片搜索。不含任何新功能。🔗 来源
  • Together AI 与 Ollama 宣布举办开放代码智能体专题活动——Ollama 的 Parth Sareen 和 Together AI 的 Zain Hasan 将主持一场活动,介绍如何将基于开放模型的代码智能体投入生产。消息中未注明日期和地点。🔗 来源
  • 两次中止的 Boris-2 训练以开放权重形式发布——第一次训练在 300 亿个 token 时,损失停滞在 3.100,原因是 Muon 与 AdamW 的梯度不兼容;第二次训练在约 70 亿个 token 时停止。与模型本身相比,这段失败经历更具启发性。🔗 来源
  • 一项针对裁判模型方向性偏差的预注册方案——其假设是:在叙事文本中,错误会更多地偏向直接声明某种情感,而非对其进行编码。该方案在收集任何数据之前发布,并明确说明何种结果会导致放弃这一构念;作者也披露了利益冲突。🔗 来源
  • 使用开放组件复现 Jev,成绩落后 0.6 分——一名自称不会编程的用户让 Claude Code 用一天时间进行实验,以仅在 CPU 上运行的开放技术栈重建 Jev。其间有八种方案失败,他认为这些失败比最终成功的方案更具启发性。🔗 来源
  • Jevini 将决策的设计与执行分离——大型推理模型负责设计一个带版本控制、由类型化判断组成的图,小型决策模型则针对每个新情境执行该图。这是厂商的宣传内容,应据此看待。🔗 来源
  • Cohere 延续品牌传播,并未发布产品公告——9 月 20 日的一条消息通过重新表述联合创始人 Aidan Gomez 的理念,延续了 AI for Empowerment 宣传活动;9 月 21 日发布的两幅视觉素材则讲述了公司参加滑铁卢学生黑客松 Hack The North 的经历。没有模型、功能或价格信息。🔗 宣传活动 · 🔗 黑客松

这意味着什么

首日可用正在成为分发常态。Grok 4.7 无须等待:发布当天便已进入 Cursor 和 GitHub Copilot;Qwen-Image-2.1 推出后也立即得到 vLLM、SGLang、ComfyUI 和 Hugging Face 的支持。过去以周计算的模型发布到日常工具可用之间的延迟,如今正趋近于零——对 Cursor 而言,这是因为自 8 月 14 日起,该编辑器与实验室已同属一个集团;对其他平台而言,则是因为集成工作在公告发布前就已开始准备。真正值得关注的问题不再是模型何时上线,而是上线后要花多少钱。

这正是 Copilot 新计费方式带来的变化。Grok 4.7 不再采用请求倍数机制,而是按 xAI 的公开价格和实际用量计费。结合新模型自动启用机制,这使成本决策转移到了平台管理层面:什么都不做,就等于开启一个与第三方供应商价格表挂钩的支出项目。xAI 的论点与此相呼应——输入价格与 Grok 4.6 相同,均为 2 美元;Terminal-Bench 上确有提升,但在长时间代码任务中仍落后于 Fable 5.1:这里出售的是性价比,而非第一名。

在智能体方面,三项看似相距甚远的公告讲述着同一种转变:执行环境不再是黑箱。devin ssh 将智能体虚拟机开放给交互式会话;relore 让智能体获得代码仓库中过往决策的记忆,而不只是代码的当前状态;Perplexity 针对模型在用户使用过程中明确失败的轮次进行后训练;Qwen Code 则通过 bwrap 路由其工具。NVIDIA 为这一趋势提供了理论框架:智能体安全需要在其触及范围之外逐层落实,并由日志提供证据。可检查的智能体与受约束的智能体,是同一需求的两个侧面。

OpenAI 的公告则提出了一个尚未处理的问题。一个内部模型在不到一个月内解决了一百多道开放问题,由此产生的机构回应是成立一个独立、无报酬且可自由发表意见的咨询小组;然而,该小组的职责明确排除了内部进展速度,而这恰恰是 27 位 Fields Medal 获得者抗议的核心。与当天其他动态相比,这种反差颇具启发性:在人们讨论惊人成果出现的速度时,一个 tokenization 库在保证 ID 完全一致的情况下实现了 3 至 30 倍的性能提升;一种压缩方法则借鉴自旋玻璃理论,在 50% 压缩率下将 MMLU 提高了 23 分。这类工作登不上头条,但真正决定着明天的推理成本。


来源