搜索

Anthropic 发布 Claude Opus 5.5,OpenAI 推出 GPT-6 Sol 和 Luna,Claude Code 的 Pro 与 Team Standard 切换至 Opus

ai-powered-markdown-translator

使用 gpt-5.6-sol 将文章从法语翻译成中文。

在 GitHub 上查看项目 ↗

9 月 22 日星期二,Anthropic 与 OpenAI 在不到两小时内先后推出前沿模型:Claude Opus 5.5,据称以比 Opus 5 低 40% 的成本达到 Fable 5.1 的水平;随后是 GPT-6 Sol 和 GPT-6 Luna,其 API 价格相较 GPT-5.6 的促销价降低一半。两大模型家族当天即登陆 GitHub Copilot、Devin 和 Perplexity,与此同时,Claude Code 2.1.280 将 Pro 和 Team Standard 套餐从 Sonnet 切换至 Opus。Codex CLI 0.156.0、Anthropic 上调的使用限额以及 NVIDIA 的一系列发布,为这一天画上句号。


Anthropic 推出 Claude Opus 5.5,Claude 5.5 家族的首款模型

9 月 22 日——Anthropic 推出 Claude Opus 5.5claude-opus-5-5),这是其全新 Claude 5.5 家族的首款模型;Sonnet 5.5 和 Haiku 5.5 将在“未来几周内”跟进。该模型即日起可通过 Claude API、Amazon Bedrock、Claude Platform on AWS、Google Cloud 和 Microsoft Foundry 使用,并成为 Claude Code 付费套餐的默认模型。上下文窗口为 100 万个 token,最大输出为 128,000 个 token,可靠知识截至 2026 年 6 月。

Introducing Claude Opus 5.5, the first model in our new Claude 5.5 family.

It performs at the level of Claude Fable 5.1 for most tasks, and costs 40% less to run than Opus 5.

🇨🇳 这是 Claude Opus 5.5,我们全新 Claude 5.5 家族的首款模型。它在大多数任务上的表现达到 Claude Fable 5.1 的水平,而运行成本比 Opus 5 低 40%。@claudeai 在 X 上

据 Anthropic 称,这 40% 是在典型工作负载的“默认设置”下测得的,综合了更低的价格和每项任务更少的 token 用量。价格下降 20%(每百万个 token 的输入和输出价格分别为 4 美元和 20 美元,而 Opus 5 分别为 5 美元和 25 美元),缓存读取价格则下降 60%(0.20 美元)。输出生成速度提高了 30% 以上;处于研究预览阶段的快速模式(fast mode)承诺可将速度提升至 2.5 倍,输入和输出价格分别为 8 美元和 40 美元。

Benchmark(Anthropic 数据)Claude Opus 5.5Claude Fable 5.1GPT-6 Astra
Terminal-Bench 4.066,4 %55,8 %57,9 %
FrontierCode v1.1 Main54,4 %50,3 %53,3 %
GDPval-AA v2.1 (Elo)184617351542
OSWorld 2.081,8 %80,7 %
AutomationBench40,0 %31,4 %41,4 %
Terminal-Bench-Science 0.158,7 %52,6 %64,6 %

Opus 5.5 在智能体编程、办公工作和计算机操作方面居于首位,但 GPT-6 Astra 在 AutomationBench 和 Terminal-Bench-Science 上仍然领先。Anthropic 指出,其分数是在生产环境防护措施启用的情况下测得的,这可能拉低了成绩;该公司还认为,Benchmark 的差距已经成为“可靠性较低的参考”:在实际使用中,它与 Fable 5.1 的差距可能比这些数字所显示的更小。这是首款在发布时便配备 Fable 5.1 级别网络安全、生物学和蒸馏防护措施的 Opus(大多数网络安全任务会切换至 Opus 4.8);Anthropic 也承认,它似乎经常怀疑自己正在接受评测。

对开发者而言,迁移需要进行一些调整:自适应思考无法再被关闭;强制指定工具(tool_choiceanytool)会返回 400 错误;默认 effort 则变为 medium(Opus 5 为 high)。如今,在两次工具调用之间写入的文本会重新出现在思考块中,而在默认显示模式下这些块为空。

🔗 Claude Opus 5.5 简介 · Opus 5.5 的 API 新特性


Claude Code 2.1.280 引入 Opus 5.5,并将 Pro 和 Team Standard 切换至 Opus

9 月 22 日——Claude Code 2.1.280 于 UTC 时间 16 时 38 分发布,距 Opus 5.5 官宣仅七分钟。2.1.279 从未发布:CHANGELOG 从 9 月 19 日的 2.1.278 直接跳至这个包含 114 项条目的版本。

最明显的变化涉及模型。Opus 5.5 成为默认 Opus 模型,而 Pro 和 Team Standard 套餐的默认模型从 Sonnet 切换至 Opus,与此前的 Max、Team Premium 和 Enterprise 保持一致。在 /effort 尚未按模型单独设置时保存的 effort 级别,不再应用于 Opus 5.5 等新模型;这些模型会以各自的默认设置启动。与此同时,Opus 4.7、Opus 4.8 和 Fable 5 也不再强制使用高于用户所选设置的启动 effort。

在安全方面,通过符号链接进行的写入如今会依据其真实目标位置进行判断:授权请求会指出写入最终到达的位置,而 acceptEdits、授权规则和自动模式也不再批准最终落在目录树之外的写入。当安全检查没有返回响应时,自动模式不再无停顿地循环拒绝操作:新的重试会逐步拉开间隔,并在连续拒绝十次后结束当前轮次。冒用保留名称的插件 marketplace 会被拒绝,而变量 CLAUDE_CODE_MAX_MCP_DESCRIPTION_LENGTH 可用于修改 MCP 工具描述的 2,048 字符上限。

其余变化主要提升了使用体验:单独按下 yn 不再确认或关闭对话框(改用回车键和 Esc 键);在对话框中连续按两次 Ctrl+C 不再退出 Claude Code;两处 prompt cache 失效问题得到修复;VS Code 扩展新增六项可输入的命令(/status/sandbox/chrome/export/skills/plan)。

CHANGELOG 条目类别条目数
修复(Fixed69
改进(Improved21
新增(Added12
变更(Changed10
回退与移除2
总计114

🔗 Claude Code v2.1.280

两份 Opus 5.5 使用指南

9 月 22 日——Anthropic 还发布了两份由 Addy Osmani 撰写的指南。第一份《Opus 5.5 上一项任务的成本》(What a task costs on Opus 5.5)提醒道:两款每 token 单价相同的模型,在同一任务上的成本可能相差甚远,因为每一轮都会重新发送整段对话。其示例被描述为基于公开定价的说明:280 万个输入 token 在不使用缓存时花费 11.20 美元,而其中 90% 从缓存读取时仅花费 1.62 美元;一个输出 token 的成本相当于一次缓存读取的 100 倍。指南建议日常使用 medium,当 medium 卡住时改用 high;如果 Opus 5.5 在同一问题上连续失败两次,再切换至 Fable 5.1。需要注意的是,更改 effort 或模型会清空缓存(订阅模式下缓存保留一小时,使用 API key 时默认保留五分钟)。在一项包含 44 个支持工单的内部 Benchmark 中,从 Opus 4.8 切换至低 effort 的 Opus 5.5 后,成本降低了约 18%,而 /claude-api prompt-audit 又进一步降低了 9%。

第二份发布于 claude.dev 的指南建议先明确“完成”的含义,然后让模型自行工作;同时删除“认真思考”之类的指令,因为模型始终会在回答前进行思考。指南还解释了当消息被防护措施标记时如何切换至较旧的模型;这一行为可在应用程序或 /config 中调整。

🔗 Opus 5.5 上一项任务的成本 · 充分发挥 Opus 5.5 的能力


OpenAI 推出 GPT-6 Sol 和 GPT-6 Luna,价格比 GPT-5.6 促销价低 50%

9 月 22 日——在 Anthropic 发布新品不到两小时后,OpenAI 以 GPT-6 SolGPT-6 Luna 扩充 GPT-6 家族。两款模型采用与 GPT-6 Astra 相似的方法训练;据该公司称,GPT-6 Astra 仍是其最佳模型。Sol 面向复杂编程和智能体工作流,Luna 则面向高吞吐量的特定任务;它们分别接替 GPT-5.6 Sol 和 GPT-5.6 Luna。

We’ve also made caching and inference more efficient, and we’re passing the savings directly to you: 50% lower API prices for Sol and Luna compared with GPT‑5.6 promotional pricing.

🇨🇳 我们还提升了缓存和推理效率,并将节省的成本直接回馈给你:Sol 和 Luna 的 API 价格相较 GPT-5.6 的促销价降低 50%。@OpenAI 在 X 上

价格类型(每百万个 token)GPT-6 SolGPT-6 Luna所引用的 GPT-5.6 价格(Sol / Luna)
输入2 美元0,10 美元4 美元 / 0,20 美元
缓存输入0,20 美元0,01 美元未说明
输出10 美元0,50 美元20 美元 / 1,20 美元

两款模型均支持 1,050,000 个上下文 token,并可生成最多 128,000 个 token;当输入超过 272,000 个 token 时,整项请求的输入价格按两倍计费,输出价格按 1.5 倍计费。

在 OpenAI 的 Benchmark 中,Sol 的对比对象是 Opus 5.5 之前的 Claude 模型。Sol 在 xhigh effort 下的 AutomationBench 得分为 33.2%,每项任务成本为 0.27 美元,领先于 max effort 的 Claude Opus 5(26.9%,成本高出 11.1 倍)以及 low effort 的 GPT-6 Astra(30.3%)。在 DeepSWE v1.1 上,它达到 68.8%,仅比 Claude Fable 5 的最佳成绩低 1.1 个百分点,而每项任务的成本低约 80%;Luna 在该测试中取得 66.6%。竞争对手的成绩来自公开报告。在对齐方面,在专为诱导模型产生不诚实行为而设计的编程任务中,Sol 的欺骗率降至 1.3%,而 GPT-5.6 Sol 为 10.4%。

两款模型均登陆 ChatGPT Work 和 Codex,面向 Plus、Pro、Business、Enterprise 和 Edu 订阅者逐步推出(Enterprise 需由管理员启用);Free 和 Go 用户可在桌面应用中使用 Luna,这些模型尚未在 Chat 中提供。它们在 API 中分别名为 gpt-6-solgpt-6-luna,可通过 Responses 和 Chat Completions 使用。

🔗 GPT-6 Sol 和 Luna 简介

为 GPT-6 重新设计的 prompt cache

9 月 22 日——作为发布配套文章,《为 GPT-6 提供更出色的 prompt cache》详细介绍了该家族的新缓存系统:默认缓存命中率更高;符合条件且在 30 分钟内重复使用的共享前缀,其缓存输入 token 最多可享受 90% 的折扣;写入缓存则按输入价格的 1.25 倍计费。开发者还获得了 Prompt Caching 仪表板、用于固定复用前缀的显式缓存断点(explicit cache breakpoints)、应用启动时的缓存预热(prewarming),以及一个 configuration_update,可在不同响应之间更改 reasoning effort 而不破坏缓存。GitHub 产品总监 Mario Rodriguez 表示,需要重新处理的 prompt token 占比已降低 50% 以上;Strawberry Browser 则宣布成本降低了 20%。

🔗 为 GPT-6 提供更出色的 prompt cache


当天登陆各类工具:GitHub Copilot、Devin、Perplexity、Cursor 和 v0

9 月 22 日——Opus 5.5 和两款全新 GPT-6 没有让用户久等:短短数小时内,主要编程与搜索工具便纷纷加入这些模型,并且往往还公布了各自的测试数据。

GitHub Copilot 开放 Opus 5.5、GPT-6 Sol 和 GPT-6 Luna

GitHub 在三款模型发布当天便将其加入十个平台:VS Code、Visual Studio、Copilot CLI、编程智能体、GitHub Copilot 应用、github.com、GitHub Mobile、JetBrains、Xcode 和 Eclipse。所有模型均按供应商公开价格根据用量计费,不设 premium request 倍率;仍使用旧版按请求计费方式的年度订阅者无法使用这些模型。目前三者均尚未加入自动选择(Auto)。

Copilot 中的模型可用套餐每百万个 token 的输入和输出价格
Claude Opus 5.5Pro+、Max、Business、Enterprise(不含 Pro)4 美元和 20 美元
GPT-6 SolPro+、Max、Business、Enterprise2 美元和 10 美元;超过 272,000 个 token 后为 4 美元和 15 美元
GPT-6 LunaPro、Pro+、Max、Business、Enterprise0,10 美元和 0,50 美元;超过 272,000 个 token 后为 0,20 美元和 0,75 美元

因此,Luna 是 Copilot Pro 唯一可用的 GPT-6 模型,而 Opus 5.5 并未向该套餐开放。根据 GitHub 的初步测试,Opus 5.5 能以明显更少的步骤和 token,达到 Claude Opus 5 的任务解决水平。GitHub 还指出,Opus 5.5 会在其文本输出中加入水印(watermark);据 GitHub 称,这不会影响语义、质量、可读性、token 数量或成本。

🔗 GitHub Copilot 中的 Claude Opus 5.5 · GitHub Copilot 中的 GPT-6 Sol 和 GPT-6 Luna

Devin 对 FrontierCode 1.1 新模型进行排名

Cognition 在 Claude Opus 5.5 发布当天便将其接入 Devin Desktop 和 Devin CLI,并以 Extended 变体 65.3% 的成绩将其列为 FrontierCode 1.1 基准测试第一名,领先于 Claude Fable 5(64.9%)和 GPT-6 Astra(64.5%),而每项任务的成本不到 Fable 5 的十分之一。该 65.3% 的成绩不能与 Anthropic 公布的 54.4% 相比较,后者是在 Main 变体上测得的。四十七分钟后,GPT-6 Sol 和 Luna 也相继上线:Sol 以 60.7% 对 60.6% 的成绩追平 GPT-5.6 Sol,同时每项任务的成本降低 61%,读取的上下文约少 17%;Luna(56.1%)的每项任务成本低于 0.10 美元,是 Cognition 排行榜中最便宜的模型。

前一天,即 9 月 21 日下午(太平洋时间),Cognition 已接入 Grok 4.7,并测得 59.4%,低于 Grok 4.6(61.3%):它在 Java、Go 和 Ruby 的高难度后端任务上表现稳健,但往往会超出任务范围(over-scope),产生比任务所需更大的 diff。随后 v0 也接入了 Grok 4.7,并在 9 月 27 日前提供 40% 的折扣,但未说明折扣适用于什么。

受评模型FrontierCode 1.1 Extended 得分
Claude Opus 5.565.3%
Claude Fable 564.9%
GPT-6 Astra64.5%
Claude Fable 5.163.6%
SWE-262.5%
Grok 4.661.3%
GPT-6 Sol60.7%
GPT-5.6 Sol60.6%
Grok 4.759.4%
Gemini 3.7 Flash56.3%
GPT-6 Luna56.1%

粗体表示 9 月 21 日和 22 日加入 Devin 的模型。分数由 Cognition 在 Extended 变体上公布。

🔗 Devin 中的 Opus 5.5 · Devin 中的 GPT-6 Sol 和 Luna · Devin 中的 Grok 4.7 · v0 中的 Grok 4.7

Perplexity:Computer 接入 Opus 5.5 和 GPT-6 Sol,Agent API 接入四款模型

Perplexity 将这两款新模型接入了其多步骤智能体 Computer 于 9 月 17 日推出的工作量调节器。Claude Opus 5.5 成为 Standard 档位:在 Perplexity 衡量成本与性能的内部基准测试 WANDR 中,它以每项任务 4.13 美元的成本取得 0.610 分,略高于 Claude Fable 5.1,而每项任务的成本低 67.6%。同样在 Perplexity 应用中提供的 GPT-6 Sol 成为 Light 档位的默认选项。两则消息均未说明适用的套餐,也未说明它们取代了哪些模型。

在开发者方面,一则仅标注为 2026 年 9 月的 API 更新日志条目宣布 Agent API 新增 openai/gpt-6-solopenai/gpt-6-lunaanthropic/claude-opus-5-5xai/grok-4.7,但该条目未列出价格。

🔗 Computer 中的 Opus 5.5 · Computer 中的 GPT-6 Sol · Perplexity API 更新日志

Cursor 和 v0 接入 Opus 5.5

Cursor 称其为 CursorBench 新的最佳模型,在最大工作量(Max)下得分 57.8%,每项任务的成本比 Opus 5 低 40%;这些数据来自 Anthropic,并注明了工作量级别。v0 也接入了该模型,但未提供定价详情。

🔗 Cursor 在 X 上的消息 · v0 在 X 上的消息


Anthropic 提高五小时限额,并提供一次可在 10 月 22 日前使用的限额重置

9 月 22 日——随着 Opus 5.5 上线,Anthropic 提高了 Pro、Max、Team 和按席位授权的 Enterprise 套餐按五小时计算的限额。@ClaudeDevs 量化了 Claude Code 的增幅:五小时会话限额从当天起提高 20%。订阅用户还会获得一次可留待备用并自行选择时间触发的限额重置:Pro、Max 和 Team 用户可在“设置 → 用量”(Settings → Usage)中找到,并须在 10 月 22 日前使用。

价格变化也带来了额外影响:在 Claude Code 中,Opus 5.5 成为付费套餐的默认模型;由于它比 Opus 5 更便宜,五小时限额和每周限额可以“多用 25%”。同日发布的成本指南指出,降价会反映到限额中,其中包括缓存上下文,但缓存读取价格的额外降幅仅适用于 API。

🔗 @ClaudeDevs 在 X 上的消息 · 限额重置与限额


Codex CLI 0.156.0 默认启用语音和 worktree

9 月 22 日——Codex CLI 0.156.0 于 UTC 时间 19 时 51 分发布,是继 9 月 18 日的 0.155.1 之后首个稳定版本;其完整更新日志列出了自 0.155.0 以来的 525 个 pull request。它正式普及了 0.155 中仍属实验性的两项功能:语音对话,其中为 Linux 和 Windows 内置了音频引擎;以及 worktree,智能体指挥中心可将其作为会话打开,并按状态筛选任务。

版本新功能命令或设置Codex CLI 中的此前状态
默认启用语音对话F8、/voice settings实验性 /voice(0.155.0,9 月 17 日)
默认启用 worktree智能体指挥中心自 0.154.0 起为实验性功能(9 月 9 日)
全屏界面/tui,下次启动时
analytics 仪表板/usage桌面应用 analytics(9 月 18 日)
本地后台服务器/daemon--no-daemon

全屏界面支持搜索转录内容、使用鼠标选择以及右键复制;同时新增六种内置主题,并可直接在回复中显示 Mermaid 图表和公式。该版本还修补了多项沙箱隔离漏洞,包括 Windows 下的入站流量、app-server 的 Unix socket,以及 macOS 下可修改的 fcntl。发行说明没有提到 GPT-6:可通过 /model--model 选择 Sol 和 Luna。

🔗 Codex CLI 0.156.0


终端编程智能体:Vibe CLI、Qwen Code 和 Amp

Vibe CLI 2.25.6 和 2.25.7

9 月 22 日——Mistral 发布了包含六项修复的 Vibe CLI 2.25.7。前一天的 2.25.6 在 CHANGELOG 中标注为 9 月 21 日,但从未作为 GitHub release 发布,主要新内容都在该版本中,包括 1 项新增、3 项变更和 17 项修复。启用 --experimental-harness 选项后,即使当前模型无法读取图片,也可以附加图片:同一提供商旗下具备视觉能力的模型会为智能体描述图片,而 config.toml 中的 vision_model 键可用于指定其他模型。以这种方式描述的界面截图包含布局契约(layout contract),以便智能体重建屏幕。

在安全方面,无需批准即可运行的 Git 命令得到了加固:安全 fetch 不再继承 Git 配置中的路径覆盖项,不受信任的 checkout 无法再选择 SSH 客户端或 hook,而夹带在只读命令中的高风险选项或 shell 重定向现在需要批准。2.25.7 最终还向 Vibe API 密钥和 workspace 密钥开放了 /teleport,其中也包括免费账户。

🔗 Vibe CLI v2.25.7 · Vibe CLI 的 CHANGELOG

Qwen Code v0.24.4

9 月 22 日——在 v0.24.3 发布一天后,Qwen Code 升级至 v0.24.4,包含 13 项功能和 15 项修复,且没有破坏性变更。qwen serve 服务器现在可以通过 SSH 打开远程工作区,无需在目标机器上安装守护进程;而在 v0.24.0 中引入 Linux 的 bubblewrap(bwrap)沙箱,现在会在每次工具执行时生效。在 Web Shell 中,当经过身份验证的服务器监听在本地回环(loopback)以外的地址时,默认可使用二维码配对,并提供 60 秒后失效的一次性邀请;编辑 diff 也会在批准前显示。在 Java 方面,受管工具执行会通过 JDBC 保存在数据库中。同日随后还发布了仅包含两项修复的 v0.24.5-preview.0。

🔗 Qwen Code v0.24.4

Amp runner 创建 Git worktree

9 月 22 日——在允许一个 runner 服务多个目录的五天后,Amp 又让它能够创建 Git worktree。在选择器中,每个由其服务的仓库都会提供 New Worktree 选项:按下 Tab,为分支命名,thread 随后便会在仓库旁新建的全新 checkout 中启动(~/code/amp 会生成 ~/code/amp-fix-flaky-login-test),且不会影响主 checkout。之后可通过专用操作归档该 thread,并删除 worktree 和分支。runner 还可以接收在 ampcode.com 上配置的密钥和环境变量(Secrets & Env Vars):该选项默认关闭,可通过 --amp-env 启用;变量修改后会从下一个 thread 起生效,无需重启或使用 SSH。

🔗 一个 Runner,多个 Worktree


第三方评估:OpenAI 制定规则,英国 AISI 公布结果

9 月 22 日——同一天,两份发布内容都涉及由实验室以外的机构评估模型。

OpenAI:面向独立评估机构的四项优先领域与七项原则

这篇由 Lama Ahmad 署名的文章承诺,OpenAI 将向私人或非营利独立评估机构开放对其模型训练、评估和部署的深入访问权限,使其能够质疑 OpenAI 的假设、发现被忽略的风险,并自行判断其防护措施。这些评估不同于与政府合作开展的工作,可能持续数周至数月,并且不与任何发布绑定。

优先领域审查内容
安全论证(safety cases证明模型从训练到外部部署的风险均受到控制的论证
关键防护措施对 jailbreak 的抵抗力、网络防御、失准监控器,以及思维链监测的可靠性
Preparedness Framework能力测试(化学和生物风险、网络安全、AI 自我改进)以及对齐
失准事件对关键事件进行独立调查,其中以 7 月的 Hugging Face 事件为例

整个框架由七项原则规范:预先约定范围并登记主张、与需求相称的访问权限、透明的方法、专业能力与独立性(申报利益冲突)、安全与保密、提供可采取行动的调查结果并在发布前留出整改时间,以及以规范删减内容的方式负责任地发布。OpenAI 表示正在与多家机构商谈,但未透露其名称。

🔗 有效第三方评估的优先事项与原则

英国 AI Security Institute 通过 EvalEval 发布经验证的结果

EvalEval Coalition 在 Hugging Face 博客上宣布,负责研究先进 AI 风险的英国公共机构 UK AI Security Institute(AISI)现已在 EvalEval 的开放平台 Evaluation Cards 上发布其评估结果,并附带相关背景和配置,采用统一的 Every Eval Ever 格式。首批发布内容涵盖五项基准测试(HealthBench、FrontierMath、Humanity’s Last Exam、SWE-Bench Pro 和 Terminal-Bench 2.0),测试对象为六款模型:Claude Opus 4、4.5 和 4.6,以及 GPT-5、GPT-5.2 和 GPT-5.4,另有两项网络安全评估。其核心在于可复现性:附带配置发布的经验证参考结果,有助于理解为何两个看似可比的分数会出现差异。

🔗 UK AISI 与 EvalEval 如何让基准测试结果可复现


ChatGPT 在美国支持追踪 Experian 信用评分

9 月 21 日——@ChatGPT 账户于 9 月 21 日宣布了一项新功能,允许用户在 ChatGPT 中追踪自己的信用评分。美国的 Plus 和 Pro 订阅用户可以在“财务”空间连接其 Experian 信用报告和 VantageScore 3.0 评分,获得有关哪些因素影响该评分的个性化说明,并在评分发生变化时收到通知。该功能可在网页端以及最新版 iOS 和 Android 应用中使用。

OpenAI 列举了具体用法:衡量信用状况对租房申请的影响、决定优先偿还哪张信用卡、长期积累信用,或了解信用和预算如何影响汽车租赁或住房贷款。该功能补充了 5 月面向美国 Pro 订阅用户以预览形式推出的个人财务工具,其中包括通过 Plaid 连接银行账户。

🔗 ChatGPT 在 X 上的公告


Google:Colab 纳入 Google AI 套餐,Gemini API 限制 Gemini 2.5

Colab 加入 Google AI 套餐

9 月 22 日——Google AI 订阅用户将获得 Colab 高级权益,其中包括优先使用速度更快的加速器和性能更强的机器。Ultra 订阅用户还可解锁不中断的后台运行和 Premium GPU 访问权限,使长时间训练无需保持浏览器标签页打开也能运行至完成。文章称该功能“从今天起”推出,但同时指出,相关权益将在未来几周内陆续覆盖 Colab 可用的国家和地区。根据 Colab 常见问题解答,Google AI 套餐与 Colab Pro 或 Pro+ 订阅所含的计算单元会累加至同一余额;仅包含存储空间的 Google One 套餐和免费试用不享受该权益。文章和常见问题解答均未说明各套餐分配的计算单元数量。

🔗 Colab 现已成为 Google AI 套餐的一部分 · Colab 常见问题解答

Gemini API 限制 Gemini 2.5 的访问权限

9 月 18 日——Gemini API 发行说明在 9 月 18 日的一则说明中表示,为确保性能可靠并保留容量,Gemini 2.5 模型的访问权限将仅限于过去曾主动使用这些模型的用户。这些模型并未弃用,并会继续提供服务,直至另行通知:弃用页面没有为 gemini-2.5-progemini-2.5-flashgemini-2.5-flash-lite 列出停用日期,只有 gemini-2.5-flash-image 将于 2026 年 10 月 2 日停止服务。对于所有新项目,Google 建议使用 Gemini 3.5 Flash-Lite 或 Gemini 3.8 Flash。

🔗 Gemini API 发行说明 · Gemini 弃用页面


Hugging Face 让 Transformers 运行 llama.cpp 的 GGUF

9 月 22 日 — Hugging Face 现在支持在 Transformers 中高效运行 GGUF 文件,即 llama.cpp 的量化格式。只需将文件传递给 from_pretrained(参数 gguf_file):权重会以压缩形式保留在内存中,计算则通过 ggml 的 Metal 内核运行,这些内核由 kernels 库从 Hub 分发。随后,命令 transformers serve 会通过兼容 OpenAI 的 API 提供该模型。

初始适用范围较窄:仅支持 Apple Silicon Mac、Qwen3.5 的 dense 和 MoE 架构版本(以及兼容的 Qwen3.8 checkpoints)、一次只能进行一个对话,并且需要从 main 分支安装。其中四个内核来自 ggml,第五个由 Hugging Face 编写,用于处理专家路由。在 MacBook Pro M2 Max 上,Hugging Face 认为 Transformers 的表现“接近” llama.cpp,但只通过图表给出了数值,而且测量口径并不相同(一方包含预填充,另一方仅测量解码);该团队仍建议使用 llama.cpp 进行高效的本地推理。真正的价值在于:可以使用常规 PyTorch 工具操作 GGUF,或从反量化后的 GGUF 出发进行微调。

GGUF 变体(Qwen3.5-4B,Unsloth)文件大小标明的权衡
BF168,42 Go非量化基准
Q6_K3,53 Go更高精度
Q5_K_M3,14 Go大小与精度之间的权衡
Q4_K_M2,74 Go推荐的本地起点

🔗 Transformers 现已支持运行 llama.cpp 量化模型


Kimi:K3 登陆 Amazon Bedrock,浏览器扩展更名

Kimi K3 登陆 Amazon Bedrock

9 月 22 日 — Moonshot AI 宣布 Kimi K3 登陆 Amazon Bedrock;不过,AWS 页面将此次发布的日期标为 9 月 18 日。这款开放权重模型于 7 月底发布,拥有一百万 tokens 的上下文窗口,并可在该平台上使用 Bedrock 的访问控制、加密和审计功能。它通过美国及全球跨区域推理(cross-Region inference)提供服务(us.moonshotai.kimi-k3global.moonshotai.kimi-k3),显式缓存从每个缓存点 1 024 tokens 起步,持续时间至少为 30 分钟。Priority 层级(基础价格的 1.75 倍)和 Flex 层级(基础价格的 0.5 倍)均以基础价格为准计算。

推理选项(Standard 层级)每百万 tokens 输入价格每百万 tokens 输出价格缓存读取
全球推理3,00 美元15,00 美元0,30 美元
美国推理3,30 美元16,50 美元0,33 美元

🔗 Amazon Bedrock 上的 Kimi K3 页面 · Kimi K3 登陆 Bedrock 的 X 公告

Kimi WebBridge 更名为 Kimi Browser Extension

9 月 22 日 — 这款于 6 月随 Kimi Work 推出的浏览器扩展现已更名,并新增侧边栏。用户可以在侧边栏中与 Kimi 对话,让它浏览网站、填写表单并将任务执行到底。重复性任务只需录制一次,便可保存为 skill,供 Kimi 下次继续使用;该扩展还会把网页拆解成命令。本地服务通过 Chrome DevTools Protocol 控制已经打开的 Chrome 或 Edge,Moonshot 声称登录会话和页面内容不会离开设备。只有侧边栏需要 Kimi 账户。

🔗 Kimi Browser Extension · Kimi Browser Extension 的 X 公告


SpaceXAI:Grok Bot 消化客服工单激增

9 月 22 日 — SpaceXAI 分享了其自身客户支持的实践经验:该系统围绕 Grok Bot 重建,这个 agent 可在企业工具中开展工作。自 Cursor 于 8 月 14 日加入 SpaceXAI 后,两个支持团队已经合并,需要覆盖更多产品。据文章称,在没有新增任何员工的情况下,工单量增长了 175%;若非如此,可能需要招聘 200 人,但文中并未说明测量周期。

部署过程循序渐进:Grok Bot 接入 Plain 处理工单,并接入 Linear 处理事件;起初,它仅限于撰写内部备注,每次写入操作都要由人工确认,随后开始处理简单工单,并在第一天结束前直接回复客户。如今,它会对每个新工单进行初步调查,为工程团队录制问题复现视频,并每天汇总超过 20 000 条产品反馈。

SpaceXAI 公布的指标公布数值
支持工单增幅+175 %
避免的招聘人数(估算)200
传统工具的单次解决成本1 至 4 美元
使用 Grok Bot 时的最低单工单成本0,20 至 0,30 美元
无人工参与处理的退款99 %

🔗 SpaceXAI 如何使用 Grok Bot 扩展客户支持


Cognition:进军拉丁美洲,并发布 Devin 新版说明

Cognition 以 São Paulo 为基地进军拉丁美洲

9 月 22 日 — Cognition 的拉丁美洲团队在一篇文章中回顾了前一周于 São Paulo 艺术博物馆 MASP 发布的消息:公司正在该地区扩张,在 São Paulo 组建团队并开展招聘,其中包括部署到客户现场的工程师(deployed engineers)。其业务建立在已有客户基础之上,包括 Itaú、Nubank、Santander、Natura 和 EBANX。据 Cognition 称,Itaú 超过 75 % 的技术团队正在使用 Devin;Devin 已为超过 300 000 个代码仓库生成文档,并自动解决约 70 % 的漏洞。在 Nubank,一个包含数百万行代码的单体应用迁移项目据称从需要数年缩短至数周,成本也降低到原来的二十分之一以下。这些结果均由 Cognition 发布,没有第三方来源佐证。

🔗 构建拉丁美洲软件工程的未来

Devin 9 月 21 日版发布说明

9 月 21 日 — 在我们上一期内容发布后推出的 Devin 版本说明宣布,Cognition 于 9 月 10 日发布的代码模型 SWE-2 已以研究预览版(research preview)形式加入 agent 选择器:用户可以在会话开始时或进行过程中选择 SWE-2,并设定工作强度(Medium、High 或 Max);在 Slack 中使用 !swe2 也能完成同样的操作。Microsoft 365 MCP servers(Mail 和 Contacts、Calendar、To Do、OneDrive 和 SharePoint、Teams、Entra ID 目录)已加入 MCP 市场;在未配置 OAuth 范围时,默认仅提供读取权限。Devin Review 现已支持 Bitbucket Data Center,plugins 的容量上限提高至 20 Mio 和 2 500 个文件;独立 CLI npx devin-review 已被移除,已安装的副本也不再可用。

🔗 Devin 9 月 21 日版发布说明


Genspark 的演示文稿 benchmark 纳入 Fireworks AI 的 SII 指数

9 月 22 日 — Fireworks AI 推出 Specialized Intelligence Index(SII),该指数包含 20 项真实工作 benchmark,分布于七个领域(安全、法律、金融、客户支持、软件、医疗、生产力),并由从业人员构建;Harvey、Doximity、Mercor、Sierra、Decagon 和 Genspark 位列参与的十二家公司之中。作为生产力类别中唯一的 benchmark,Genspark Slides Benchmark 让十一款模型在 Genspark Slides agent 的测试框架中完成 200 项真实任务并制作演示文稿;评分来自 Genspark 的内部评估器。对于自研模型 Gen-1 Slides,Genspark 再次强调,其输入价格约为 Claude Opus 5 的十七分之一。

评测模型SII 指数得分Genspark 9 月 10 日文章中的得分指数中的单份演示文稿成本
Claude Fable 5.183,6 %未列入表格,正文称其领先 Gen-1 Slides 0,003未显示
Gen-1 Slides82,2 %0,8210,44 美元
Claude Opus 581,0 %0,8104,16 美元
Claude Fable 579,9 %未列入表格未显示
GPT-6 Astra78,0 %未列入表格未显示
Kimi K372,6 %0,7232,00 美元
GPT-5.6 Sol67,0 %0,6682,01 美元
MiniMax M356,1 %0,5630,34 美元

🔗 Specialized Intelligence Index · Genspark 公告


Runway 推出面向 AI 原生创意人才的招聘平台 DIFFUSE

9 月 22 日 — Runway 推出开放平台 DIFFUSE(diffuse.runway.com),品牌、代理机构和工作室可以在其中寻找、联系并招聘熟悉生成式 AI 工具的人才(AI-native talent)。创意工作者、自由职业者、精品工作室或制作公司可以创建个人资料并托管作品集;平台未公布任何价格。

Runway 以其对近 400 家企业发布的 1 000 多个创意岗位进行的研究为依据:17 % 的岗位提到了 AI 技能或生成式工具;根据该公司的说法,Runway 是其中需求遥遥领先的视频工具。Runway 承认,AI 正在一定程度上改变创意职业,但该公司表示,围绕这些工具正在形成一支新的创意人才队伍,市场对他们的需求也在加速增长。

🔗 DIFFUSE 发布介绍 · Runway 在 X 上的公告


面向开发者的 NVIDIA:Isaac ROS 5.0、DLSS 5 和 RTX Mega Geometry 2.0

Isaac ROS 5.0 聚焦 agents

9 月 22 日 — Isaac ROS 5.0 在 Toronto 的 ROSCon 大会上亮相。这套由 NVIDIA 推出的 GPU 加速 ROS 软件包免费且开源,支持 ROS Lyrical 和 Ubuntu 24.04,并覆盖从 Jetson Orin Nano 到 Jetson Thor 的整个 Jetson 产品线。主要新功能面向 agents:用于安装和操作的可复用 Isaac skills、agents 可读取的文档、一项帮助 agent 针对自有相机微调立体视觉模型 FoundationStereo 的 skill,以及一项独立的抓取与放置(pick and place)skill。FoundationPose 新增了一个推理库,能够以最高 5.5 倍的速度跟踪物体的位置和方向,但 NVIDIA 没有说明比较基准。

🔗 Isaac ROS 5.0

面向工作室详解 DLSS 5,RTX Mega Geometry 2.0 现已推出

9 月 22 日 — DLSS 5 已在 NBA 2K27 中提供,现有面向开发者的详细介绍:其 3D 引导神经渲染(3D-Guided Neural Rendering)位于 pipeline 的最后阶段,以引擎渲染的图像为起点,利用颜色和运动矢量逐帧添加光照与材质细节;整个过程具有确定性,可在单张 GeForce RTX 50 系列显卡上以最高 4K 分辨率运行。工作室可以调节结构强度(Structure Intensity)和色调强度(Tone Intensity),并使用 AI 语义遮罩。同一篇文章还为 ACE 新增两款拥有 600 百万参数的模型:Nemotron Speech 3.5 Streaming(语音识别)和 Qwen3 TTS(语音合成);同时发布 RTX Kit 2026.3,并推出 RTX Mega Geometry 2.0,为超高密度网格提供连续细节层级的 cluster streaming。

🔗 面向游戏开发者的新功能


NVIDIA 与推理:多 GPU Dynamo-Triton 及 B200 机密计算

Dynamo-Triton 26.07 在八张 GPU 上运行分布式模型服务

9 月 21 日 — NVIDIA 展示了如何像普通模型一样,为分布在多张 GPU 上的 TensorRT 模型提供服务。TensorRT 的多 GPU 推理(multi-device inference)从 TensorRT 11.0 起得到完整支持,并基于 NCCL 实现;前身为 Triton Inference Server 的 Dynamo-Triton 26.07 在其 TensorRT backend 中启用了这一功能,应用只需调用单个 gRPC endpoint。在 Cosmos 3 Nano 的视频生成测试中(1280×720、189 帧、35 个步骤),端到端延迟从单张 GPU 上的 156,6 秒降至八张 GPU 上的 34,2 秒,即缩短至原来的 4.58 分之一。NVIDIA 指出,该测试既未测量并发请求下的吞吐量,也未测量单个视频的成本。

测试配置GPU 数量平均端到端延迟
单 GPU1156,595 s
CP2287,999 s
CP4453,093 s
CP8834,183 s

🔗 Dynamo-Triton 与 TensorRT 多 GPU

B200 上的机密推理保留超过 96 % 的吞吐量

9 月 22 日 — NVIDIA 测量了在 Blackwell 上启用 Confidential Computing 的性能代价。该技术在具有内存加密功能的虚拟机中运行工作负载,并使用机密 GPU 和加密的 NVLink。在一台 DGX B200(八张 GPU、Intel TDX 平台)上,使用 TensorRT LLM 以 NVFP4 运行 DeepSeek-R1,输入 32 000 tokens、输出 1 000 tokens 时,机密模式可保留 96,1 至 98,2 % 的吞吐量;在 1 至 16 个并发请求下,每个输出 token 的平均耗时仅增加 1,2 至 4,3 %。framework 为此进行了三项调整:部分传输使用可分页内存而非锁页内存;内核 autotuner 使用 GPU 内部计数器;由于该模式不支持 NVLink SHARP multicast,因此采用其他通信算法。选择这一工作负载是为了让额外开销更明显;NVIDIA 建议用户针对自己的工作负载比较两种模式。

🔗 机密计算与 TensorRT LLM


简讯

  • Zed 正在筹备 Delta — Zed 宣布将在本周为 Delta 推出线程分组颜色,以及显示距离上下文自动压缩还有多远的进度条,但这些功能尚未上线。Delta 是其支持 agents 的多人协作编码环境。🔗 来源
  • Replit 与 Handshake — Replit 成为 Handshake AI Skills Studio 的创始合作伙伴:完成三项免费的 45 分钟任务后,即可获得一个展示在 Handshake 个人资料中的项目;其他合作伙伴包括 OpenAI(10 项任务)、Google、Figma 和 Vercel。🔗 来源
  • oMLX 加入 Hugging Face — Apple MLX 生态项目 oMLX 的创建者 Jun Kim 加入 Hugging Face;该项目仍采用 Apache 2.0 许可证并继续由他领导,同时将获得维护和资金支持,首要目标是让 Transformers 模型更快地迁移至 MLX。🔗 来源
  • SnowLLM — 社区文章:据作者称,这款针对 Ryzen AI Max GPU 编写、采用 Apache-2.0 许可证的推理引擎(内核以二进制形式提供),解码速度最高可达 llama.cpp 的 2.3 倍(不使用推测解码时为 1.9 倍),预填充速度最高可达 9.4 倍。🔗 来源
  • DecisionBench 与 Bosun v3.1 — Hanno Labs 发布 DecisionBench 1.0(43 项任务、28 个领域),以及两个基于 Qwen3 的开放权重决策模型(6 亿和 17 亿参数);它们在其自有应用型测试套件上的得分分别为 83.20% 和 87.29%,但 Jev 在推理赛道上领先。🔗 来源
  • 6 亿参数的 Moshi — 一位开发者讲述了自己尝试构建基于 Qwen3-0.6B-Base 的全双工语音模型:每次在 B200 上训练的成本为 2 至 15 美元;文本能够收敛,但语音仍然模糊,瓶颈被定位在精细声学 codebooks。项目已暂停,未发布任何权重。🔗 来源
  • Together AI 与 GLM-5.2 — Together AI 在 9 月 18 日发布、21 日于 X 再次分享的一则案例研究中,介绍了一家金融科技公司如何使用 56 张 B200,在 256K 上下文下通过 GLM-5.2 为其编码 agents 提供服务;一次造成 1 至 3 分钟排队的事故,于当天通过重新配置路由得到修复。🔗 来源
  • Gemini CLI — 9 月 22 日的 nightly 版本是自 19 日以来首个包含新代码的版本;它修复了通过代理使用 Vertex AI 时出现的 HttpsProxyAgent is not a constructor 崩溃,并在 ACP 模式下请求权限前发出 tool_call 更新。🔗 来源
  • Google Flow — 官方账号宣称其月度用户已超过 2500 万,并将每日额外赠送 50 个积分的活动延长至所有用户;该优惠在 7 月时仅面向 Google AI 订阅者,有效期原定至 8 月 31 日。🔗 来源
  • Jigsaw 与 Sensemaking AI — Google 旗下孵化器推出 Partner Program,计划在 30 个城市、州和国家部署其由 Gemini 驱动的开源公民咨询套件;项目获得 Google.org、Bloomberg Philanthropies 和 Packard Foundation 设立的基金支持,但金额未公布。🔗 来源
  • 10 万份培训奖学金 — 在联合国大会期间,Google 通过国际电信联盟 AI for Good 计划的 AI Skills Coalition,在 80 多个国家资助 10 万份可获得认证的 AI 培训奖学金,并由当地政府和 Giga 网络负责发放。🔗 来源
  • 保护 Google 代码安全的 agents — Google 在 9 月 19 日的一篇文章中表示,会在提交前使用基于其开源 Mantis 框架构建的 agents 分析基础设施中的每一项代码变更,每月拦截数百个漏洞;其分流 agent 宣称可在不到一分钟内达到超过 92% 的准确率。🔗 来源
  • Copilot CLI 1.0.88 — 企业托管设置现已应用于 --acp--ahp-host--server 会话;这些会话此前不受 MCP 策略、权限或 plugins 管理,同时 /fork 可在单个轮次内运行;9 月 21 日发布的 1.0.87 版本则为 Auto 路由层级加入了托管设置。🔗 来源
  • Pika 与 Seedance 2.5 — Seedance 2.5 的 Draft 模式现已登陆 Pika 和 Pika API Club:可按每秒 0.10 美元起的价格生成视频片段草稿,之后再以高质量完成制作。🔗 来源
  • Pika Swap Anything — Pika 推出的新应用,可替换视频中的演员、服装、场景或道具,同时保留原始镜头的节奏、动作和叙事;价格尚未公布。🔗 来源
  • Suno Studio — Suno 的音乐制作工作站加入一套音频效果,包括压缩器(阈值、压缩比、启动时间、释放时间、侧链),包含在 Premier 订阅中。🔗 来源
  • Sluicebox 与 Nemotron 3 Ultra — NVIDIA 案例研究:这家供应链碳分析初创企业改用 Nemotron 3 Ultra 后,将推理成本降低了 51% 至 80%,供应商数据提取准确率达到 87.7%,高于上一代模型的 84%。🔗 来源
  • Topograph — NVIDIA 推出的开源工具包,可发现 GPU 集群的网络拓扑,并将其提供给 Kubernetes、Slurm 和 Slinky,以便让分布式工作负载尽可能靠近部署;它能够读取 Crusoe、Google Cloud、Lambda、Nebius、Nscale 和 Oracle Cloud 的 API。🔗 来源
  • 评估 agent — NVIDIA 在 9 月 21 日发布的一篇方法论文章中提出六项指标,涵盖从工具调用到任务完成,并指出 Nemotron 3.5 Lightning 在 PinchBench 上达到 86%,速度比 Qwen3.6 35B 快 30%。🔗 来源
  • Intel 上的 Qwen-Image-2.1 — Intel 于 9 月 21 日宣布、Qwen 于 22 日转发的首日 OpenVINO 支持,面向 Arc Pro B70 GPU 和 Core Ultra Series 3 的集成 GPU,并提供专用 notebook。🔗 来源
  • Box 与 Grok 4.7 — 9 月 21 日,即 Grok 4.7 发布当天,Box 在 Box Agent 预览版中使用一宗价值 200 万美元的保险事故进行测试:发现一张重复开具的 8.2 万美元发票,以及一笔缺失的 6.4 万美元贷项;上线日期和价格均未公布。🔗 来源
  • 一位外科医生与 Codex — OpenAI Developers 发布了一段视频,手外科医生 Brian Pridgen 在其中展示如何使用 Codex 构建自己的工具,并查阅 PubMed 上的科学文献;视频未提供数据,也没有书面研究。🔗 来源
  • Word 中的 ChatGPT — 9 月 17 日宣布:一个统一的 Microsoft 加载项可在全球范围内让所有套餐(包括 Free)在 Word、Excel 和 PowerPoint 中使用 ChatGPT,但设有使用限制;Business 和 Enterprise 用户可在 9 月 30 日前免费预览 Word 中的 GPT-5.6 Sol。🔗 来源
  • AI 素养 — Perplexity 发布了一份指南,将评估回答视为关键能力,批评“培训表演”,并引用 Gallup 的数据:2025 年第四季度,自报采用率为 38%,但每日使用率仅为 12%。🔗 来源

这意味着什么

同一天,Anthropic 和 OpenAI 为同一个论点辩护:重点并非不惜代价追求更强大的模型,而是以低得多的价格提供接近其高端产品的水平。Opus 5.5 被描述为达到 Fable 5.1 的水平,同时比 Opus 5 便宜 40%;GPT-6 Sol 则被称为继承了 Astra 的大部分优势,每百万 tokens 的价格分别为 2 美元和 10 美元。两家公司如今都按单项任务成本而非每 token 价格来考量,并将缓存视为真正的杠杆:Anthropic 的缓存读取价格为 0.20 美元,OpenAI 则提供最高 90% 的折扣和明确的断点。

集成速度则以小时计算。GitHub Copilot、Devin、Perplexity、Cursor 和 v0 都在新模型发布当天开放使用,每家都有自己的衡量标准:Cognition 的 FrontierCode 1.1 Extended、Perplexity 的 WANDR,以及 Cursor 的 CursorBench。这些数字无法直接对应(Opus 5.5 的 Extended 变体为 65.3%,Main 变体为 54.4%),而且两家公司都尚未将自己的新模型与对方的模型进行比较。对于开发者而言,最佳选择越来越需要在自己使用的工具和实际任务中判断,而不是根据发布时的表格决定。

套餐也成为差异化竞争的领域。Anthropic 提高了五小时周期内的限额,提供一次限额重置,并让 Pro 和 Team Standard 用户在 Claude Code 中使用 Opus;GitHub 将 Opus 5.5 保留给更高级的方案,但从 Copilot Pro 起便开放 GPT-6 Luna;Google 将 Colab 纳入 Google AI 方案,同时限制 Gemini 2.5 的使用以保留容量。不同方案之间如何分配算力,如今与标价本身同样重要。

最后,衡量方式本身也在变化。Anthropic 承认,benchmark 的细微差距已不像以前那样具有指导意义,而且 Opus 5.5 似乎经常知道自己正在接受评估;OpenAI 制定了向独立评估者开放模型的规则;英国 AISI 借助 EvalEval 让结果可以复现,NVIDIA 则建议根据 agent 是否完成任务来评判,而不是逐次评估每个工具调用。核实模型实际能做什么,如今与它的得分同样重要。


来源