ai-powered-markdown-translator使用 gpt-5.6-sol 将文章从法语翻译成中文。
本周五,各类智能体工具正趋向采用共享格式:当项目中没有 CLAUDE.md 时,Claude Code 现在会读取 AGENTS.md;Antigravity 会将子智能体目录注入其 Markdown 智能体的系统提示词;Codex 会详细列出各子智能体的用量;MiniMax 则开放了其终端智能体的源代码。当天其余动态主要包括两款模型的发布——Qwen3.8-Omni-Flash 和 Grok Voice Transcribe 2.0——以及一项不同寻常的合作:Anthropic 将 Accenture 的评估人员引入公司内部。
Claude Code 读取 AGENTS.md、隔离子智能体并移除 TaskOutput
9 月 18 日——Claude Code 在二十小时内连续发布了三个版本:2.1.275 于 9 月 17 日 22 时 33 分(UTC)发布,2.1.276 于 18 日 02 时 12 分(UTC)发布,2.1.277 于 18 日 18 时 06 分(UTC)发布。
最具结构性意义的新功能浓缩在 2.1.277 的一条更新中。在缺少 CLAUDE.md 的项目里,Claude Code 会读取 AGENTS.md;该指令文件已成为市场上多款代码智能体共同采用的约定。用户可在 /config 的“项目指令”下调整这一选项。该功能目前尚不支持 Bedrock、Vertex 和 Foundry。
Added AGENTS.md support: in a project with no CLAUDE.md, Claude Code reads AGENTS.md instead; change it under “Project instructions” in /config (not yet on Bedrock, Vertex or Foundry)
🇨🇳 新增对 AGENTS.md 的支持:在没有 CLAUDE.md 的项目中,Claude Code 会改为读取 AGENTS.md;该设置可在 /config 的“项目指令”下更改(Bedrock、Vertex 和 Foundry 暂不支持)。 — Claude Code 更新日志,anthropics/claude-code
同一版本中的另外两项变更涉及上下文安全。子智能体的结果会在带有明确标识的标题下返回给主智能体,从而防止子智能体返回的文本被误认为当前会话的指令;提示词中不可见的 Unicode 格式字符也会被移除,并在发送前显示清理后的版本。2.1.277 还移除了已弃用的 TaskOutput 工具:Claude 现在会通过 Read 读取后台任务的输出文件。
2.1.275 新增了即时发送快捷键(ctrl+enter),可中断当前轮次并一次性发送队列中的所有消息;同时还支持将 claude.ai 账户上启用的 skills 和插件同步到终端。在供应链方面,来源为 npm 的插件会通过 npm pack --ignore-scripts 获取并接受完整性验证,从而阻止软件包的安装脚本运行。不到四小时后发布的 2.1.276 只修复了该版本引入的一项回归问题:代理后方的所有请求都会因 400 错误而失败。
| 版本号 | 发布时间(UTC) | 主要内容 |
|---|---|---|
| 2.1.275 | 17/09 22 时 33 分 | 即时发送、同步 claude.ai skills、npm --ignore-scripts |
| 2.1.276 | 18/09 02 时 12 分 | 单项修复:代理后方出现 400 错误 |
| 2.1.277 | 18/09 18 时 06 分 | 支持 AGENTS.md、隔离子智能体、移除 TaskOutput |
Qwen3.8-Omni-Flash:Qwen 首款智能体式全模态模型
9 月 18 日——Qwen 发布 Qwen3.8-Omni-Flash,并将其定位为首款围绕智能体能力打造的全模态模型。此次升级的重点不再只是理解多模态内容,而是利用这些内容:理解内容、规划任务、借助工具执行任务并交付结果。该模型可在 100 万 token 的上下文窗口中接收文本、图像、音频和视频。
Meet Qwen3.8-Omni-Flash, Qwen’s first omni-modal model built around agentic capabilities!
🇨🇳 隆重推出 Qwen3.8-Omni-Flash,这是 Qwen 首款围绕智能体能力打造的全模态模型。 — @Alibaba_Qwen 在 X 上
在 Qwen 选取的 29 项评估中,其平均得分相比 Qwen3.5-Omni-Plus 提升超过 25%,增益主要集中在音频和视频智能体方面。多说话人识别的进步最为显著。
| 选取的评估 | Qwen3.8-Omni-Flash | Qwen3.5-Omni-Plus | Gemini 3.8 Flash |
|---|---|---|---|
| WildClawBench-MM | 71,0 | 34,5 | 58,9 |
| UniClawBench | 69,6 | 67,1 | 69,0 |
| AgenticVBench | 36,8 | 14,5 | 45,0 |
| OmniVideoBench | 63,4 | 53,8 | 65,2 |
| StreamingBench | 80,8 | 57,1 | 79,9 |
| AliMeeting DER / cpWER(越低越好) | 3,4 / 17,2 | 88,1 / 89,6 | 72,6 / 53,1 |
最具新意之处,是将智能体式感知应用于长视频。模型不会从头到尾处理整段录像,而是从所提问题出发,自主决定需要观看和聆听什么,并通过由粗到细的多轮处理定位信息。在 OmniVideoBench 上,这一模式将准确率从 63.4 提升至 67.8,同时把每次请求的 token 消耗从 145,736 降至 79,117,降幅约为 45.7%——这一数字也由官方文章明确给出。
定价也随之调整:按照 Qwen 的计算方法,每小时音频输入的价格相比 Qwen3.5-Omni-Plus 降低超过 98%。两项组件也同步开源:兼容 Codex、Claude Code、Qwen Code 和 Gemini CLI 工具框架的 Qwen-MM-Plugins,以及用于实时交互的 Qwen-Live Harness。Realtime 变体专为低延迟连续交互而设计,首个 token 的延迟介于 591 至 981 毫秒之间。
🔗 Qwen 关于 Qwen3.8-Omni-Flash 的文章
Codex CLI 0.155.0 将语音对话引入实验阶段
9 月 17 日——OpenAI 发布 Codex CLI 0.155.0,这是继 9 月 10 日发布 0.154.0 后的首个稳定版本,可通过 npm install -g @openai/codex@0.155.0 安装。此前一天在 X 上公布的语音智能体终于有了相应的更新日志条目:该功能名为 /voice,提供实时转录和麦克风控制,目前仍处于实验阶段——仅在受支持的构建版本中可用,并需通过 /experimental 启用。
该版本的其他改动更低调,却能立即发挥作用。终端界面现在会在状态行中显示实时推理摘要,并在每轮成功完成后显示结束时间。智能体概览支持隐藏、归档和删除任务,可查看 worktree 的所有权详情,并会在删除由系统管理且状态干净的 worktree 前请求确认。在兼容的 Mac 上,本地 TUI 会话的 MCP 请求可通过 Touch ID 批准。Amazon Bedrock 可以从已配置的命令中获取 AWS 凭证,并支持缓存、到期刷新以及身份验证失败后的恢复。
多项修复与安全有关:系统会阻止受限 WSL 沙盒中的 Windows 进程逃逸;通过中介生成的 shell 快照得到加固,以防泄露凭证;切换账户时,则会使远程控制会话、缓存的 WebSocket 状态以及属于上一身份的模型目录失效。
| 版本新功能 | 详情 |
|---|---|
/voice | 实时转录和麦克风控制,可通过 /experimental 实验性启用 |
| 终端界面 | 状态行中的推理摘要、轮次结束时间戳 |
| 智能体概览 | 隐藏、归档和删除任务,显示 worktree 所有权 |
| Touch ID | 在兼容的 Mac 上批准本地会话中的 MCP 请求 |
| Amazon Bedrock | 通过命令获取 AWS 凭证,并支持缓存和刷新 |
Codex 详细列出各任务、子智能体和对话的用量
9 月 18 日——OpenAI Developers 宣布 Codex 推出详细用量追踪功能:该工具会显示任务、子智能体和单独对话如何构成总用量。个人账户和 Business 账户可在桌面应用的“设置”下进入“用量与账单”查看,符合条件的 Enterprise 账户则可在“用量”下查看;用户需要更新至最新版本才能使用。此次公告没有配套的博客文章或更新日志条目。
真正的重点在于统计粒度。以往,额度耗尽并不会说明消耗来自哪里;按子智能体细分后,用户便能了解哪项委派成本较高,并据此重新设计。这是子智能体在代码工具框架中普及后相应出现的成本核算机制。
Grok Voice Transcribe 2.0:SpaceXAI 价格不变的语音识别模型
9 月 18 日——SpaceXAI 宣布推出新款语音识别模型 Grok Voice Transcribe 2.0,称其在价格与 1.0 版本相同的情况下,准确度提升至两倍。该模型以 Grok Voice 已经采用的音频基础模型为根基;据公司称,后者每天处理数万通客户支持电话,并转录数百万小时的视频旁白。
其核心卖点是真实环境中的音频,而非实验室音频:不稳定的电话线路、相互干扰的声音、地方口音,以及大声口述的电话号码和电子邮件地址。SpaceXAI 宣称,该模型在 Artificial Analysis 公共排行榜的 32 款流式模型中准确率位列第一;公司还采用了四个源于生产流量的内部数据集,分别涵盖 8 kHz 电话音频、与 Grok 的对话、口述标识符,以及 19 种语言的简短语音命令。
最明显的提升来自多语言能力。在短句数据集上,由于句子提供的语言识别上下文最少,词错误率从 20.6% 降至 6.8%。模型会自动检测语言,并能在一次处理过程中跟随录音中的语言切换。
| 测量指标 | 公布数值 |
|---|---|
| 相比 Transcribe 1.0 的准确率提升 | 两倍 |
| Artificial Analysis 排名(流式) | 32 款模型中第 1 名 |
| 短句词错误率(1.0 → 2.0) | 20,6 % → 6,8 % |
| 批处理价格 | 每小时音频 0.10 美元 |
| 流式处理价格 | 每小时音频 0.20 美元 |
| 可独立转录的声道数 | 最多 8 个 |
| 每次请求的专业术语数量 | 最多 100 个 |
该模型支持批处理和流式处理、带置信度分数的逐词时间戳、无需额外付费的说话人分离以及说话轮次结束检测。现有 API 集成无需修改代码即可获得准确率提升。Grok Voice Transcribe 2.0 很快将成为 API 的默认模型,1.0 则会在未来几周内弃用:如需继续使用后者,必须固定为 grok-voice-transcribe-1.0。
🔗 Grok Voice Transcribe 2.0 公告
Anthropic 将 Accenture 评估人员引入公司内部
9 月 18 日——Anthropic 宣布与 Accenture 达成合作,对前沿模型进行独立评估,并称这是落实其首席执行官关于引入嵌入式评估人员承诺的重要一步。相关工作将由 Accenture 旗下的人工智能专业子公司 Faculty 承担,涵盖模型评估和红队测试、对齐评估以及安全护栏测试。
嵌入式评估人员与外部评估人员之间的区别十分明确:嵌入式评估人员在人工智能公司内部工作,拥有与员工相当的访问权限。他们可以在模型训练期间观察模型,了解决定模型构建和部署方式的决策,直接与员工交谈,核实安全承诺是否得到履行,报告事故,并发布信息更充分的收益与风险说明。Anthropic 强调,这种安排并不会减轻其责任,而是让责任更容易得到验证。
公告异常坦率地指出了目前尚不存在的机制。对于嵌入式评估人员应有权访问哪些信息、应如何公布调查结果,目前都没有任何标准,也没有成熟的独立评估资助体系。Anthropic 认为,长期来看,这类资金应来自共同基金或公共基金;由于当下尚无此类机制,公司将直接资助 Accenture 的工作——这也是该安排最明显的局限。
| 合作要素 | 公布内容 |
|---|---|
| 执行实体 | Accenture 旗下人工智能子公司 Faculty |
| 投资 | 双方各至少投入 10 亿美元,为期五年 |
| 涵盖范围 | 评估、红队测试、对齐、安全护栏 |
| 访问级别 | 与员工相当 |
| 资金来源 | 由于缺少共同基金,由 Anthropic 直接资助 |
| 排他性 | 双方均无排他性 |
Anthropic 还表示,正在与 METR 及其他非营利评估机构讨论,尝试由这些机构自行出资开展部分嵌入式评估工作,并将在未来几周内公布其他合作伙伴。
Antigravity:两天内围绕自定义智能体发布三个版本
Google 接连发布了两个 CLI 版本和一个 Antigravity 应用版本。三者从三个角度探讨同一主题:自定义智能体知道什么、可以拒绝什么,以及在无人监管的情况下能够运行多久。它们延续了自 9 月 11 日开始的一系列密集更新,此处未涵盖 1.2.1 至 1.2.4 版本。
CLI 1.2.6 推出与会话绑定的 Remote Control,并取消五分钟上限
9 月 18 日——在 1.2.0 将 CLI 变成持久化系统服务八天后,Google 反其道而行之,推出了第二种轻量得多的 Remote Control:一种仅限会话范围(session-scoped)的连接,可在启动时通过 --remote-control 标志开启,也可在运行期间通过 /remote-control 命令开启。输入 /remote-control off 或关闭会话会拆除隧道,并从列表中移除该设备。1.2.0 面向的是会话结束后仍会继续运行的守护进程,而 1.2.6 的目标恰恰相反。
第二项变更涉及无界面(headless)模式:-p / --prompt 执行的默认超时时间从五分钟改为无限,除非明确指定 --print-timeout。第三项变更规范了错误报告——当智能体或 API 失败时,CLI 会向标准错误输出写入一行 AGY_ERROR: {...} JSON,其中包含规范状态、HTTP 或 gRPC 代码、是否可重试以及错误标识符,同时退出代码从 1 变为 3。因此,编排脚本无需分析自由文本,就能区分临时网络故障和永久性错误。
CLI 1.2.5 终于向 Markdown 智能体提供其子智能体目录
9 月 17 日——此前,以 Markdown 定义的自定义智能体可以在工具中声明 invoke_subagent,却始终不知道有哪些子智能体存在:它拥有工具,却没有目录。如今,CLI 会自动在其系统提示词中加入可用子智能体目录及其使用说明,从而让委派真正生效。
变更日志的措辞需要谨慎理解:这是产品自身增加的上下文,并非安全漏洞或修复。第二项改进会保留发送到后台的任务的明确名称,此前该名称会在通知与任务列表之间丢失。五项修复涉及清理已失效的标识符、中断命令的退出代码,以及停滞不动的思考框架。
Antigravity 2.15.0 允许自定义智能体关闭默认提示词和工具
9 月 18 日——在 2.14.0 发布三天后,该应用发布了 7 项改进和 16 项修复。主要变更让自定义智能体能够掌控自身上下文:它们可以禁用默认提示词章节和默认工具,然后只重新引入所需内容。对于专用智能体而言,这能相应减少强制加入的系统提示词。
其余变更涉及导航和持久化:Page Up、Page Down、Home 和 End 可用于滚动对话,Esc 可退出输入区域,重新加载后仍会记住所选的自定义智能体。两项修复涉及数据完整性——当应用无法读取状态文件时,已保存的设置和项目列表可能被覆盖;权限设置还会不断积累重复项,导致对话文件膨胀。
GitHub Copilot:Sentry 画布、六个模型下线,以及按自定义项统计的指标
两天内发布的三则变更日志都体现了同一种关注:衡量团队实际如何使用 Copilot,并清理不再使用的内容。
9 月 14 日周报单列出两个新组件
9 月 18 日——GitHub 发布了 9 月 14 日当周的 Copilot 周报。摘要的大部分内容都重复了此前陆续发布的变更日志条目;只有两个项目从未单独公布。第一个是 Copilot 应用中的 Sentry 画布,它无需离开应用即可将生产环境崩溃报告与修复关联起来:画布会显示错误、堆栈跟踪(stack traces)和上下文,随后可用于调查原因、验证修复并准备 pull request。这是继 9 月初集成 Jira 后,错误监控工具首次进入画布。
第二个是 VS Code 1.138 的智能体更新。Agents 窗口可在本地 Dev Container 中运行智能体,并使用项目的工具和依赖项——该功能正逐步推出,且需要 Docker。所有 pull request 合并后,非活跃会话可自动标记为已完成,并可选择在宽限期后删除;该功能处于预览阶段,必须明确启用。最后,还可直接从 Agent Host 会话创建 pull request。
六个模型将于 10 月 19 日退出所有 Copilot 使用界面
9 月 18 日——GitHub 宣布,六个模型将于 2026 年 10 月 19 日从所有 Copilot 使用界面下线,包括 Copilot Chat、内联编辑、ask 和 agent 模式以及代码补全。这是 9 月宣布的第二批弃用计划。
| 下线模型 | 下线日期 | 建议替代模型 |
|---|---|---|
| Gemini 3.7 Flash | 19/10/2026 | Gemini 3.8 Flash |
| GPT-5.5 | 19/10/2026 | GPT-5.6 Sol |
| GPT-5.4 | 19/10/2026 | GPT-5.6 Sol |
| GPT-5.4 mini | 19/10/2026 | GPT-5.6 Luna |
| GPT-5 mini | 19/10/2026 | GPT-5.6 Luna |
| Grok 4.5 | 19/10/2026 | Grok 4.6 |
启用默认模型设置后,Copilot Enterprise 和 Business 客户会自动启用替代模型,除非管理员已关闭全局默认值或明确阻止相关模型;在这种情况下,可通过设置中的模型策略重新开放访问权限。下线这些模型无需采取任何操作。
指标 API 统计 CLI 的 skills、智能体、MCP 服务器和 plugins
9 月 17 日——Copilot 使用情况指标 API 现已覆盖 CLI 的五类智能体自定义项:skills、自定义智能体、MCP 服务器、slash commands 和 plugins。totals_by_skill、totals_by_custom_agent、totals_by_mcp、totals_by_slash_cmd 和 totals_by_plugin 表格会列出五个最活跃的项目及其 interaction_count,而 distinct_*_use_count 字段则统计前五名之外使用过的项目种类数量。
有两个细节可避免误读。对于 MCP 服务器,只有当 CLI 尝试连接或重新连接时,计数器才会增加——无论成功还是失败——而不会在已建立的连接上每次调用工具时增加。plugins 指标只统计与 plugin 关联的 skills 调用:它们是 skills 总数的子集,不应与其相加。出于隐私考虑,只显示由 GitHub 提供的名称,客户定义的名称统一归入 other。
终端中的代码智能体:MiniMax 开放其智能体源码,Mistral 稳定其运行框架
同一天,两个毫无关联的参与者在同一市场发布公告:驻留终端的编码智能体正在普及,差异化竞争正转向许可证和运行框架的稳定性。
MiniMax 以 MIT 许可证发布 MiniMax Code CLI 源码
9 月 18 日——MiniMax 开放了其终端编码智能体 0.4.12 版本的源代码。该工具以 mcode 名称安装,并提供三种入口:交互式终端界面、面向 shell 脚本、持续集成和评测的无界面模式(mcode exec),以及适用于兼容 Agent Client Protocol 的编辑器的 ACP 模式。它能读取项目文件、检查差异、执行 shell 命令和测试,并受权限与沙盒机制约束。
模型选择保持开放:一边是 MiniMax 账户及其 Token Plan,另一边则是任何提供 OpenAI 或 Anthropic 兼容 API 格式的第三方供应商。此外,它还提供集成搜索、多模态工具、MCP 协议、子智能体和 plugin 系统。第一方代码默认以 MIT 许可证发布。代码仓库涵盖 TUI、无界面 CLI 和 ACP 模式,但不包括桌面应用,不过仍托管其问题跟踪;目前仅接受代码仓库协作者提交的代码贡献。
Vibe CLI 的 Unified Harness 结束实验状态
9 月 18 日——在 2.25.4 发布六天后,Mistral 发布了 Vibe CLI 2.25.5。结构性变更在发布说明中只有一行:Unified Harness 不再标记为“实验性”,现在 --legacy-harness 成为有文档记录的切换回旧 Python 运行框架的应急选项。在一系列聚焦 shell 审批安全性的修复版本之后,新运行框架正式成为默认方案——这才是重点,而非版本号。
此次切换也伴随着功能补齐:Unified Harness 现在会将当前 Git 分支、代码仓库状态和近期提交注入系统指令;hooks 终于能在子智能体内部执行,不再被静默忽略;未配置 API 密钥环境变量的供应商——本地或自托管服务器——也恢复正常工作。权限强化仍在继续:shell 审批不再扩展到其他程序或环境;MCP 工具调用现在会遵守权限系统,不再绕过;smart approve 也不再规避用户规则。
ChatGPT plugins 现在支持同时连接多个账户
9 月 18 日——大多数 ChatGPT plugins 开始支持多个账户。现在可以关联个人账户、工作账户和附属项目账户,并将各个账户的上下文带入同一对话。账户可通过 chatgpt.com/plugins 的 plugin 目录连接。
OpenAI Developers 账户的公告转发了 Max Stoiber 一小时前发布的消息。plugin 开发者无需进行任何操作:该功能会自动启用,无需修改。希望进一步完善体验的开发者可以向其 MCP 服务器添加 profile 工具,以便 ChatGPT 为已连接的账户添加标签——这是唯一需要他们采取的具体行动。该公告未附带博客文章或变更日志条目,发布时间为巴黎时间 18 时 10 分。
其目标使用场景是开发者按雇主或项目隔离不同身份,而此前他们必须切换登录状态才能切换上下文。
Genspark 为 Plus 和 Pro 套餐增加每周信用额度
9 月 18 日——Genspark 调整了 Plus 和 Pro 订阅权益,在不改变套餐价格的情况下增加每周信用额度。该额度每周发放,在现有订阅套餐之外额外提供,覆盖平台所有智能体和工具的 Standard 模式使用,包括 Super Agent、AI Chat、AI Image、AI Slides、AI Sheets、AI Docs 和 Deep Research。
同一帖子的第二条消息详细说明了 AI Chat 和 AI Image 的运作方式。对于现有订阅者,该额度会叠加到已有额度上;截至 2026 年 12 月 31 日,所有 AI Chat 和 AI Image 模型均可使用且不消耗信用额度,包括 Opus 等旗舰模型。对于从 9 月 18 日起订阅的用户,AI Chat 和 AI Image 的基础模型(core models)免费使用。Genspark 明确指出,这些变更不适用于 Team 或 Enterprise 套餐,并建议前往帮助中心查看详细条件。
Google Research:AlphaGenome Atlas 的成果,以及能够自我测试的模拟
同一天发表的两项研究有一个共同点:两者展示的都不是模型本身,而是第三方利用模型取得的成果,或验证循环代为检查的内容。
AlphaGenome Atlas 公布合作伙伴的首批成果
9 月 17 日——在 AlphaGenome Atlas 发布九天后,Google DeepMind 置顶了一则详细介绍三项合作的帖子。AlphaGenome Atlas 是一张涵盖人类 DNA 90 亿种可能替换的预测图谱。
| 科研合作伙伴 | 报告结果 |
|---|---|
| Stowers Institute | 绘制了超过 2 500 个调控基序 |
| University of Exeter / UK Biobank | 分析了超过 54 000 名参与者,罕见遗传信号检出率提高超过 22% |
| Broad Institute | 识别出 DNM1 基因的关键突变,随后在实验室中得到确认和验证 |
调控基序是像开关和调节旋钮一样控制基因活性的 DNA 序列。Exeter 开展的研究还发现了影响 PLA2G7 丰度的新变异,PLA2G7 是一种与代谢健康相关的蛋白质。Broad Institute 的案例是三者中最具体的:面对未明原因罕见病中数量庞大的潜在突变清单,Atlas 用于锁定正确突变,随后再由实验室验证确认。不过,所有这些内容仅见于 X 上的一则帖子,既无详细博客文章,也无相关论文。
由代理生成并在 Chrome 中测试的教学模拟
9 月 17 日 — Gal Elidan 和 Yael Haramaty 发布了一项实验,将生成式界面(generative UI)应用于教学模拟的创建。教师仍掌握主动权:教师提出主题,Google 生成一组可修改且需经教师批准的学习目标,并以此作为生成基础。每个互动内容都划分为难度逐级提升的关卡,并配有工具箱、渐进式提示和详细解答。
其中最有意思的是自我纠错循环。生成过程受教学法、机制和呈现标准的约束,部分评估由代理执行:可解性测试会打开一个 Chrome 实例,并像用户一样操作模拟,同时还会尝试对抗性操作,例如将滑块推至极值。循环会不断重复,直到满足所有标准,代价是生成时间更长。Google 发布了 30 多个英文 STEM 互动内容;英国教师评估了其中 40 个组成的合集,一项面向 12 名美国教师的研究给出的平均评分为 8 分(满分 10 分)。
Claude 为 30 多个生物学模型提速,并资助一项蛋白质竞赛
9 月 17 日 — Anthropic 发布博文,介绍 Claude 如何在不到四周内优化了生物学家使用的 30 多个 open source 模型的推理性能,涵盖结构预测、蛋白质设计、蛋白质语言模型和基因组模型,平均提速约 4 倍。所有代码均以 open source 形式发布。
技术核心涉及三角注意力和三角乘法,其时间与内存复杂度均为三次方。Claude 开发了 FlashPairformer,这套 kernel 在注意力任务上的性能比该领域标准高出 2.7 至 2.9 倍。一个名为“Big”的低内存模式可以在单个 GPU 节点上准确折叠超过 10,000 个 token 的系统,而 AlphaFold3 预测的 40S 核糖体包含 7,663 个 token。其方法同样值得关注:这项工作由两名此前没有推理优化经验的技术人员监督完成。
最后,Anthropic 与 Adaptyv Bio 联合赞助了一项蛋白质设计竞赛,涵盖五个高难度问题,将对超过 5,000 个社区设计进行实验验证,并提供最高 100 万美元的 Claude 额度以及由 Modal 提供的 25 万美元算力。
开放模型与实验室:Muse 登陆 Mac,Sakana 公布其前沿研究团队
Meta 将其 Muse 代理带到 macOS
9 月 18 日 — Meta 在 Mac 上推出 Muse,该消息于 9 月 17 日至 18 日夜间公布。@AIatMeta 转发了一则介绍个人代理的帖子,该代理能够在每次都获得用户明确许可后,直接在用户的电脑上执行操作。官方列举了三种用途:整理下载文件夹、寻找丢失的文件,以及汇总消息和笔记。
此次发布延续了 Muse 于 9 月 8 日的首次亮相。该代理由 Muse Spark 1.3 驱动,此前已可在 iOS、Android、Web 和 WhatsApp 上使用。登陆 Mac 让这类产品迈出新的一步:代理不再只在自己的 sandbox 中工作,而是开始处理用户的个人文件。Meta 未公布价格、可用国家或系统要求,也没有随此次发布提供专门针对 Mac 的安全文档——ai.meta.com 博客自 7 月 27 日以来没有发布任何内容。
Sakana AI 公布 Frontier Intelligence Group 及其对当前范式的立场
9 月 18 日 — Sakana AI 宣布 Frontier Intelligence Group(FIG)的存在,这是一个自公司创立初期便不断壮大的内部研究集体。其出发点是 Sakana AI 首席技术官、Transformer 发明者之一 Llion Jones 提出的一个问题:不断扩大 Transformer 架构并持续增加数据和算力,是否足以一路通向 AGI?该实验室的答案是否定的。
真正的信息价值正在于此,而非随之列出的研究项目。博文罗列了当前范式尚未解决的缺陷——模型会自信地生成错误信息,面对真正新颖的情境时会失效,并消耗大量能源——并将其与能够持续学习、依靠少得多的数据进行泛化的生物智能相对照。该团队确立了五项原则,其中包括可以在不承受 benchmark 分数压力的情况下自由失败。展示的研究包括与 NVIDIA 合作开展的稀疏 Transformer 项目,其出发点来自一项实测结果:处理一个词时,feed-forward 层中超过 95% 的神经元保持静默。该项目还开发出名为 TwELL 的数据格式,并已被 ICML 2026 接收。
🔗 Sakana AI 关于 Frontier Intelligence Group 的博文
生成式视频:Runway 打通额度体系,Pika 推出首款应用
Runway 让额度可在 Web 应用与 Runway Dev 之间通用
9 月 18 日 — Runway 打破了旗下两款产品之间的壁垒:购买的额度现在可以在 Web 应用和面向开发者的 Runway Dev 中通用。此前,这两个体系分别使用独立的额度池和不同的合同,也没有统一的位置可用于跟踪不同项目之间的用量。
此次变更包含四个要点:通过一张发票集中购买的统一额度池;从在 Web 应用中构建工作流到通过 API 提供该工作流的连续路径;为 Runway Dev 提供增强支持,包括联系 Applied AI Architects;以及重新设计的工作区分析视图,让管理员可以在 Web 和 Dev 工作区之间转移额度。两项商业优惠有效期截至 2026 年 12 月 31 日:新企业签约时可额外获得 10% 的额度,按照 Runway 公布的换算方式,至少相当于 130 分钟视频或 12,000 张图像;现有客户向 AI 应用产品负责人推荐客户,则可获得 5,000 点额度以及一天的 Applied AI Architect 服务。
Pika 推出 Product Ad,将产品照片转化为视频广告
9 月 18 日 — 在发布全新创意平台的第二天,Pika 推出了该平台的首款应用:Product Ad。该应用接收一张或多张产品图片,将其与书面简报相结合,并生成一段号称可直接投放市场的视频。
| 生成参数 | 提供的选项 |
|---|---|
| 可用时长 | 6 s、15 s、30 s、60 s、2 min |
| 输出格式 | 16:9 |
| 所需输入 | 产品图片和书面简报 |
| 访问方式 | 需要创建账户 |
Pika 在公告中引用了自己前一天发布的平台改版消息,这表明 Product Ad 是一系列即将推出的应用之一,而非一项孤立功能。官方未公布所使用的模型,也未透露价格。
NVIDIA 发布 AIPerf:用于衡量大规模推理性能的 GenAI-Perf 继任者
9 月 18 日 — NVIDIA 推出用于衡量生成式推理性能的工具 AIPerf,并将其定位为 GenAI-Perf 的继任者,整个工具从零开始重写。其出发点并不陌生:模型部署后,人们经常用 curl 命令或临时拼凑的负载生成器来回答“它够快吗?”这个问题,但由此产生的数据并不可靠。
真正的突破在于架构。大多数工具在单个进程中运行,并在并发量上升时受制于 Python 全局解释器锁;AIPerf 则将工作拆分开来:工作进程负责生成负载,独立服务负责处理结果,整体通过 ZMQ 协调。目标十分明确——确保性能测量客户端本身永远不会成为瓶颈。
| 报告指标 | 衡量内容 |
|---|---|
| Time to First Token | 从发送请求到生成首个 token 的延迟 |
| Inter-Token Latency | 生成过程中连续两个 token 之间的延迟 |
| 请求延迟 | 完整响应的端到端耗时 |
| 输出 token 吞吐量 | 所有请求每秒生成的 token 数 |
| 报告的百分位数 | p25、p50、p75、p90、p95、p99 |
| 端点类型 | 超过 15 种 |
该工具还可以重放 Mooncake、Baseten 和 WEKA 格式的真实流量轨迹。文章尤其强调分布数据的重要性:一台服务器的平均首个 token 生成时间可能看似正常,但其 p99 却可能急剧上升;这种问题在汇总数据中难以察觉,却会导致生产环境故障。
Mistral 否认其系统遭到未经授权访问的说法
9 月 18 日 — Mistral 于 UTC 05 时 48 分在其 X 账户上发布简短声明,回应有关其系统遭到未经授权访问的说法。该公司表示已展开深入调查,未发现任何证据支持这一说法,并确认其系统未遭入侵。
We are aware of a claim alleging unauthorized access to our systems. Following a thorough investigation, we have found no evidence to support this claim and can confirm that our systems have not been compromised.
🇨🇳 我们注意到有人声称未经授权访问了我们的系统。经过深入调查,我们没有发现任何证据支持这一说法,并可以确认我们的系统未遭入侵。 — @MistralAI 在 X 上
该消息没有指出这一说法的提出者,也没有说明其提出日期或具体性质,并且未提供有关调查范围的任何细节。此处报道的仅为 Mistral 单方面的立场:无法查阅最初的指控。该声明是此期间该账户浏览量最高的帖子,在公司网站上也未发现任何补充公告。
简讯
- Balyasny Asset Management 讲述其如何规范 Claude Fable 5 的使用——这家管理约 380 亿美元资产的公司,将并购套利的初步分析从三至五天缩短至不到一天,其中 agent 运行约 30 分钟,之后由人工审核。🔗 来源
- Codex CLI 0.155.1 再次默认禁用推理摘要——这是 0.155.0 发布次日推出的单项修复:默认启用推理摘要会导致不支持该功能的供应商拒绝请求。🔗 来源
- Gemini CLI 在空缺一天后恢复 nightly 系列更新——9 月 18 日有四项变更,包括在续期时保留 OAuth refresh token,以及使凭据删除操作具备幂等性;stable 和 preview 渠道保持不变。🔗 来源
- Kimi Code 2.0.1 加快启动和会话恢复速度——这是 2.0.0 发布 32 小时后推出的修复版本:压缩会话索引、加快长历史记录的恢复速度、支持从指定的环境变量读取 API key,并限制文件观察器的数量。🔗 来源
- Qwen Code 进入 v0.24.1 预览版,并加入 Playwright 浏览器 SDK——这不是稳定版本;它引入了集成式浏览器控制、Chrome 原生消息中继,以及在容器中执行 sub-agent 的能力。🔗 来源
- Zed 发布稳定版 1.20.2,仅含两项修复——第三方模型供应商的付款错误不再以升级至 Zed Pro 的提示取代原始消息,针对同一语言的两个 snippets 扩展也不再相互抵消。🔗 来源
- Replit 声称 Free Mode“慷慨 30 倍”,但未公布参照基准——相关信息仅来自一条推文,既无链接也无 changelog,且未说明这一倍数与什么相比:应将其视为 Replit 的说法,而非测量结果。🔗 来源
- Copilot 影响力仪表板按功能细分参与度——覆盖过去 28 天内的七个使用界面,区分主动与被动 code review,采用阶段的人群现在也按滚动窗口计算。🔗 来源
- GitHub 安排六种语言的 Copilot SDK 入门直播——内容涵盖会话、工具、MCP server 和流式事件,并设有专门针对 .NET 和 Java 的场次,无需任何前置知识。🔗 来源
- Runway Ruby 在转换为 HDR 时保留 alpha 通道——素材转换为 HDR 时可一步完成并完整保留透明度;未说明价格或订阅层级。🔗 来源
- MiniMax 加入面向新加坡 SkillsFuture 计划的 Singtel AI Pass——MiniMax H3、MiniMax Agent 和 MiniMax Audio 被纳入该服务,面向有资格参加由 SWDA 支持的 200 多门 AI 课程的学习者;未公布金额或时间表。🔗 来源
- VC-Attention 无需重新训练即可加速 MiniMax-H3 的 attention——MiniMax 转发了 Nunchux AI 关于可应用于现有模型的低精度 attention 研究;Nunchux AI 声称,与 FlashAttention-4 相比,其在 B200 上可实现 1.6 倍加速,在 B300 上可实现 1.5 倍加速。🔗 来源
- Wan3.0 在 OpenArt Arena 视频类别中排名第二——Alibaba 强调其 30 秒镜头、原生音频及任意参考内容支持;这只是其在第三方排行榜中的名次,并无产品更新。🔗 来源
- Synthesia 在纽约设立美国总部——这是一则企业动态,未涉及产品、员工规模或投资时间表;消息发布于其 Interactive Avatar API 全面开放两天之后。🔗 来源
- Grok Imagine 详述完全使用 AI 制作试播集的成本——PJaccetturo 的工作室称,其为 Odyssée 竞赛制作试播集耗时九天,共生成 3,627 张图片和 3,043 段视频,生成费用为 2,677 美元。🔗 来源
- BananaMind 2 Pro 以少二十倍的 tokens 接近 SmolLM2 的表现——这一拥有 1.39 亿参数的模型使用 1,000 亿 tokens 和一块 RTX 5070 Ti 训练,在 HellaSwag 上取得 42.78%,而使用 2 万亿 tokens 训练的 SmolLM2-135M 得分为 43.22。🔗 来源
- Optimum-Intel v2.2.0 和 OpenVINO GenAI 2026.4.0 扩展面向 Intel 硬件的导出能力——Hugging Face 与 Intel 联合发布了覆盖 Intel CPU、GPU 和 NPU 的版本,Mistral 3 现也可导出。🔗 来源
- AmberTrace Labs 测量 Olmo 3 在采用可验证奖励的 RL 下的推理忠实度——在未用于训练的探针上,忠实度从 0.238 上升至 0.262:这是正向变化,而非下降,相关 checkpoints 已发布。🔗 来源
- Together AI 声称 DeepSeek V4.1 Flash 的首个 token 响应时间最佳——该公司转述了第三方对预热请求的测量,却未公布方法或数值:这是一项主张,而非可验证的结果。🔗 来源
- Google Flow 助力两位创作者亮相纽约时装周——与 Jane Wade 和 Sergio Hudson 共同设计了定制工具;这是使用案例展示,没有部署新模型或新功能。🔗 来源
- Google AI Educator Series 现可获得大学学分——该培训的课程现在可计入大学学分或继续教育学分。🔗 来源
这意味着什么
这一天最主要地说明了一件事:code agent 正在摆脱封闭产品的形态,开始共享彼此的格式。当项目没有 CLAUDE.md 时,Claude Code 会读取 AGENTS.md——也就是说,Anthropic 接受由其他地方定义的指令文件,让同一个代码仓库可供多种工具使用。同一天,Antigravity 将可用 sub-agent 的目录注入其 agent 的 Markdown system prompt,Vibe CLI 终于让 hooks 在 sub-agent 内部执行,Codex 按 sub-agent 拆分账单,而 Qwen Code 则将其 sub-agent 放入容器。agent 之间的委派曾经只是一项配置承诺;如今它已成为一种必须记录、隔离和计费的机制。Claude Code 甚至将这种不信任逻辑贯彻到底,为 sub-agent 的结果添加专用标头,防止上行传回的文本冒充指令。
terminal agent 市场则正以肉眼可见的速度走向同质化。MiniMax 以 MIT 许可证发布自己的产品,提供 TUI、无界面模式、ACP 和自由选择模型的能力;Mistral 移除了 Unified Harness 的“实验性”标签,并将 --legacy-harness 记录为退出通道;Kimi Code 在重大版本发布 32 小时后推出性能修复。当四家厂商提供拥有相同入口的同类产品时,差异化便转移到了许可证、harness 的稳定性和权限机制上——而这正是当天 Mistral 与 Anthropic 变更所聚焦的领域。
在模型方面,趋势是音频和视频正从描述型转向 agentic。Qwen3.8-Omni-Flash 不再试图描述视频,而是从问题出发,在其中寻找答案:它在 OmniVideoBench 上提升了 4.4 分,同时减少 45.7% 的 token 消耗——性能提升与成本降低方向一致,这并不常见。另一边,Grok Voice Transcribe 2.0 展示的不是实验室演示,而是真实流量表现:短句错误率从 20.6% 降至 6.8%,价格保持不变。两项公告指向同一个结论:价值不再来自模型支持哪种模态,而是来自模型决定处理什么。
剩下的问题是,实验室愿意让外界验证什么。Anthropic 付费请 Accenture 将评估人员安置在公司内部,并赋予其员工级访问权限——但同时也在同一公告中承认,目前并无规范明确这类评估人员应获得哪些访问权限、应如何公布调查结果,以及应由谁为此买单。这既是一种坦白,也是一套机制。相比之下,当天最有力的证据都是第三方可以复现的:Exeter 和 Stowers Institute 在 AlphaGenome Atlas 上取得的结果、以 open source 形式发布的生物分子优化代码,以及 AmberTrace Labs 的 checkpoints。反面情况同样清晰:Replit 在没有参照基准的情况下提出 30 倍的说法,Together AI 转发了没有方法说明的排名,Mistral 否认了一项无人能够查阅的指控。在这样的环境中,AIPerf 来得正是时候——这是一款从承认测量者本身往往就是问题所在开始的测量工具。
来源
- Claude Code 2.1.277 版本说明
- Claude Code CHANGELOG
- Qwen 的 Qwen3.8-Omni-Flash 博文
- Alibaba Qwen 在 X 上发布的模型公告
- Codex CLI 0.155.0 版本说明
- OpenAI Developers 在 X 上发布的 Codex 详细用量信息
- SpaceXAI 的 Grok Voice Transcribe 2.0
- Anthropic 与 Accenture 开展的嵌入式评估
- Antigravity changelog
- GitHub 9 月 14 日 Copilot 每周回顾
- GitHub 关于弃用六个 Copilot 模型的公告
- GitHub 指标 API 中的 CLI agentic 自定义项
- MiniMax 在 X 上宣布开放 MiniMax Code CLI 源代码
- Vibe CLI 2.25.5 版本说明
- OpenAI Developers 在 X 上发布的多账户 plugins 信息
- Max Stoiber 在 X 上发布的多账户原帖
- Genspark 在 X 上发布的 Plus 和 Pro 每周余额信息
- Google DeepMind 在 X 上发布的 AlphaGenome Atlas 合作伙伴成果
- Google Research:通过生成式界面打造教学交互内容
- Anthropic Research:Claude 与生物分子建模
- Meta AI 在 X 上发布的 Mac 版 Muse
- Sakana AI 的 Frontier Intelligence Group
- Runway 的统一定价
- Pika 在 X 上宣布推出 Product Ad
- NVIDIA:使用 AIPerf 衡量大规模 inference
- Mistral AI 9 月 18 日在 X 上发布的否认声明