ai-powered-markdown-translator使用 gpt-6-sol 将文章从法语翻译成中文。
9 月 23 日,Anthropic 公布了自己的分子生物学实验室及其首项成果:约 950 个 Claude 智能体在噬菌体 DNA 中发现了此前未知的酶系统 ART。Google 推出 Gemini 3.8 Flash TTS 和 Flash-Lite TTS,两款可创建和复刻声音的语音合成模型;Black Forest Labs 发布用于控制机器人的开放权重模型 FLUX 3 Action;Perplexity 则发布了其智能体运行环境 SPACE 的首份安全审计报告。
Anthropic 启用分子生物学实验室,Claude 在其中发现 ART
9 月 23 日 — Anthropic 介绍了一个新的生命科学研究团队。团队于春季成立,在旧金山湾区设有自己的分子生物学实验室。其首项成果是:Claude 智能体在噬菌体(感染细菌的病毒)的 DNA 中发现了一种从未被描述过的酶系统。Anthropic 将其命名为 ART(array-associated reverse transcriptases,与阵列相关的逆转录酶)。
研究始于一条提示词:在大型 DNA 序列数据库中寻找新的逆转录酶,这类酶能够将 RNA 复制为 DNA。在 21 小时内,约 950 个智能体消耗了 2.1 亿个 token,汇集了超过 200,000 个逆转录酶,筛选出 3,500 个前所未见的候选系统,并选定最有希望的 20 个,每个都附有供人阅读的报告。Anthropic 表示,专家完成类似分析需要数周甚至数月;人类参与仅限于最初的提示词和实验室实验。
| 研究阶段 | 测得数值 |
|---|---|
| 研究时长 | 21 小时 |
| 参与的 Claude 智能体 | 约 950 个 |
| 消耗的 token | 2.1 亿 |
| 汇集的逆转录酶 | 超过 200,000 个 |
| 新的候选系统 | 3,500 个 |
| 入选并完成分析的候选系统 | 20 个 |
ART 包含三个要素:逆转录酶、一个功能未知的邻近伙伴基因,以及一段很长的、间隔规律的重复 DNA 序列阵列,其排列方式类似 CRISPR 阵列。逆转录酶本身发现于一种巨型噬菌体,此前已为人所知;但据 Anthropic 所说,Claude“似乎是第一个”注意到伴随它的非编码阵列和蛋白质的。初步实验表明,该阵列会表达为多个不同的小 RNA。Anthropic 对结论保持谨慎:ART 的功能尚不明确,更多实验仍在进行。据 Anthropic 介绍,已知系统中只有少数具有这些特征,而它们都可编程,并能剪切、复制和粘贴 DNA。
Claude has discovered a previously unknown enzyme system hidden in the DNA of bacteriophages. Beside the enzyme’s gene sits a long array of repeating DNA—a structure that looks somewhat similar to CRISPR.
🇨🇳 Claude 在噬菌体 DNA 中发现了一种此前未知的酶系统。酶基因旁有一段很长的重复 DNA 序列阵列,其结构有些像 CRISPR。 — @AnthropicAI 在 X 上
该实验室仅开展生物安全等级 BSL-1 和 BSL-2 的工作,不处理任何能够感染人类的病原体;所有实验台操作都由人类科学家完成。团队使用 Claude Science 和 Claude Code,有时还使用自行开发的工具,同时协调多个会话。由于一次研究会产生数百甚至数千份报告,假设本身也成为研究对象:研究人员认为哪些假设值得检验,其区别特征会用于改进给 Claude 的指令。CRISPR 基因组编辑先驱 Feng Zhang(MIT 和 Broad Institute)审阅了预印本,认为这是 AI 智能体助力生物学发现的一个令人振奋的例子。Anthropic 发布了这份预印本,并邀请科学家向其提交研究问题。
🔗 Claude 发现带有类 CRISPR 重复序列的新型酶系统 · 预印本(PDF)
Gemini 3.8 Flash TTS 和 Flash-Lite TTS:Google 创建并复刻声音
9 月 23 日 — Google 为 Gemini 系列增添了两款语音合成(text-to-speech)模型,并称它们是旗下表现力最强的音频模型:Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS。两款模型均已通过 Gemini API 和 Google AI Studio 正式提供,同时推出了新的 Voices 端点。API 更新日志将上线日期记为 9 月 22 日,公开公告则发布于 23 日。
两款模型各有用途。Flash TTS 用于创作:用户可以用自然语言描述声音的角色、口音和个性,再指导每一句台词的演绎、节奏与方言切换。Google 将其定位于电子游戏、有声书和播客。Flash-Lite TTS 则面向大规模和低成本需求:大规模配音、批量制作音频,以及实时语音智能体;它将取代 gemini-3.1-flash-tts-preview。两款模型都支持在同一脚本中生成双人对话、连续生成数小时音频而音色没有明显漂移,以及 <laughs>、<sigh> 或 |mhm| 等标签。
公告称,现成声音超过 2,000 种,包括魁北克法语等地区变体;而 API 文档列出的是 30 种录音室声音,以及一个包含数百种声音的扩展库。声音复刻只需一段 30 秒的样本,但必须录下声音所有者的口头同意;所有生成的音频都带有 SynthID 水印。法国读者需要留意:公告中的一则说明指出,通过 AI Studio 使用声音复刻功能,目前在欧洲经济区、英国、瑞士、印度、伊利诺伊州和得克萨斯州均不可用。现有声音的混音功能也预告即将推出。
| 模型特性 | Gemini 3.8 Flash TTS | Gemini 3.8 Flash-Lite TTS |
|---|---|---|
| API 标识符 | gemini-3.8-flash-tts | gemini-3.8-flash-lite-tts |
| 支持的语言(依据 API 文档) | 130 | 101 |
| 目标用途 | 创作、精细指导 | 大规模制作、配音、语音智能体 |
| 音频输出标准价格,截至 2026 年 12 月 31 日(每百万 token) | 9 美元 | 6 美元 |
| 音频输出标准价格,自 2027 年 1 月 1 日起(每百万 token) | 18 美元 | 12 美元 |
| 面向消费者的产品 | Gemini Notebook | Google Vids(已预告旁白功能) |
作为对比,Gemini 3.1 Flash TTS Preview 的音频输出价格为每百万 token 20 美元。Google 还援引外部评测支持此次发布:Flash TTS 在 Hume AI 的 Voice Design Benchmark 中排名第一(71.4),两款模型包揽 Hume AI 的 Overall Quality Index 前两名。它们也将“很快”通过 API 接入 Gemini Enterprise。
🔗 Google 公告 · Gemini API 版本说明 · API 价格
FLUX 3 Action:Black Forest Labs 发布用于控制机器人的开放权重模型
9 月 23 日 — 以 FLUX 图像模型闻名的 Black Forest Labs 发布了 FLUX 3 Action。这是一款拥有 70 亿参数、用于控制机器人的世界动作模型(World Action Model)。它源于多模态基础模型 FLUX 3,利用摄像头画面和关节位置,在同一次计算中预测未来图像和电机指令。模型权重开放(Hugging Face 上 DROID 检查点的页面显示其许可证为“flux-kommunity-license”),实验室还发布了代码、微调方案、基准测试和可复现示例。
An open weights 7B World Action Model that achieves first place on the RoboLab benchmark. It outperforms the previous best open model by 6.1 percentage points while using 56% fewer parameters and running up to 3.95x faster.
🇨🇳 一款拥有 7B 参数、开放权重的世界动作模型,在 RoboLab 基准测试中排名第一。它比此前表现最好的开放模型高出 6.1 个百分点,同时参数量减少了 56%,运行速度最高快 3.95 倍。 — @bfl_ai 在 X 上
| 评测模型 | 模型类型 | 权重获取方式 | RoboLab-120 成功率 | 参数数量 |
|---|---|---|---|---|
| FLUX 3 Action | WAM | 开放 | 42,92 % | 7B |
| OASIS WAM | VLM + WAM | 封闭 | 39,0 % | – |
| Cosmos3-Nano-Policy | WAM | 开放 | 36,8 % | 16B |
| Phoenix | TAMP+FM | 封闭 | 34,4 % | – |
| BiMind v0.1 | VLA | 封闭 | 33,3 % | – |
| π0.5 | VLA | 开放 | 28,0 % | 3,3B |
| DreamZero | WAM | 开放 | 25,7 % | 14B |
| GR00T N1.6 | VLA | 开放 | 7,2 % | 3B |
此前表现最好的开放模型是 NVIDIA 的 Cosmos3-Nano-Policy。“最高快 3.95 倍”是与采用 FP8 的 Cosmos 3 Nano 比较得出的:视 GPU 而定,速度为其 1.52 至 3.95 倍。与表现最好的开放视觉语言动作模型(VLA)π0.5 相比,单步蒸馏版本(38.3%)在工作站和数据中心 GPU 上更快,但在 RTX 5090 上更慢;不过,它每次预测可以预判 2.13 秒的动作,而 π0.5 为 1 秒。
文章还测试了一种由 OpenAI 的 GPT-6 Astra 监督机器人的混合策略:FLUX 3 Action 搭配低推理强度(low)的 Astra,完成了 90% 的任务回合,每次成功耗费 8.77 美元、约 8 分钟;单独使用“xhigh”推理强度的 Astra 则完成了所有任务,但每次成功耗费 13.47 美元、16 分钟。在真实的 Franka 机械臂上,Positronic Robotics 的盲测结果显示,FLUX 3 Action 在 30 次尝试中成功 28 次,Cosmos 3 Nano 为 27 次,π0.5 为 13 次。Hugging Face 上提供三个检查点(base、SO-101 和 DROID);该模型还与 NVIDIA 合作集成至 LeRobot,并可部署到 Jetson。
🔗 FLUX 3 Action(Black Forest Labs) · Hugging Face 合集
逃离 SPACE:Perplexity 发布 Computer 沙盒的首份安全审计报告
9 月 23 日 — Perplexity Secure Intelligence Institute 发布了一份针对 SPACE 的渗透测试(red-teaming)报告的第一部分。SPACE 是 Perplexity Computer 智能体运行的沙盒,于 7 月 15 日亮相。这是 SPACE 首次公开的安全评估。每个沙盒都是一台 Firecracker 微型虚拟机,与宿主机隔离;每个沙盒还有专属网关,负责执行网络出站策略。
九款模型获得了虚拟机内的 root 权限,并接到两项夺旗任务:突破虚拟机与宿主机之间的边界,获取一个诱饵 AWS 标识符;或者访问网络策略封锁的 URL。测试方案交叉设置了是否提供 SPACE 源代码,以及两种网络访问级别:完全没有访问权限,或允许部分访问(PyPI 和 Ubuntu 软件包仓库、Perplexity 网络搜索);每种配置尝试三次。结果是:即使提供源代码,108 次尝试中也没有一次从虚拟机逃逸到宿主机。网络完全封锁时,过滤机制守住了防线(54 次中 0 次成功);但在允许部分网络访问时,修复前有 54 次尝试中的 11 次到达了被禁止的目标。
| 评测模型 | 提供源代码时成功次数 | 未提供源代码时成功次数 |
|---|---|---|
| Claude Opus 5.0 | 3 次中有 3 次 | 无 |
| GPT-5.6 Sol | 3 次中有 3 次 | 3 次中有 2 次 |
| Kimi K3 | 3 次中有 2 次 | 无 |
| GPT-5.6 Cyber | 无 | 3 次中有 1 次 |
| 其他五款受评模型 | 无 | 无 |
攻击利用了两处漏洞。第一处是 DNS 伪造:智能体注入虚假响应,将 pypi.org 指向目标地址,而网关没有核实响应来源,便记录了这一映射;这种方法需要知道一个只有在源代码中才能看到的内部地址。第二处利用 CDN 共享 IP 地址:GPT-5.6 Sol 让 fiddle.fastly.dev 查询被禁止的 URL,该服务可通过与 PyPI 相同的地址访问;GPT-5.6 Cyber 则借助 Taboola 的图片服务和截图生成器 thum.io,再通过字符识别读取旗帜。Claude Opus 5.0 发现了后一种途径,但认为它违反了不得针对任何外部系统的指令,因此没有采用。Kimi K3 是唯一成功的开放权重模型。另有两款模型无法评估:尽管 Perplexity 已加入 Anthropic 的 Cyber Verification Program,Fable 仍拒绝参加测试;GPT-6 Astra 也同样拒绝。
这些漏洞于 8 月 26 日被发现,现已修复:每个出站数据包都必须携带分配给其虚拟机的地址,网关也会自行终止 TLS 连接,以核查服务器名称(SNI)和 HTTP 主机名。在最有利于攻击者的配置下重新评估后,模型均未再获取旗帜。随后,Perplexity 在没有智能体参与的情况下测试了十个第三方沙盒平台:其中八个至少存在一种绕过方法,包括 E2B、Vercel Sandbox、Modal Sandboxes 和 Daytona Sandbox;Cloudflare Sandbox 和 NVIDIA OpenShell 则经受住了测试。所有厂商均于 9 月 1 日收到通知,并作出回应;截至 9 月 10 日,Daytona、Deno 和 microsandbox 已完成修复,Vercel 和 Modal 则将该行为视为已知限制。报告第二部分将介绍模型的策略,目前尚未公布发布日期。
Claude Code 2.1.281:可关闭署名,自动模式收紧
9月23日——Claude Code 2.1.281 于世界协调时间 19:19 发布,距 2.1.280 发布仅一天。此次更新包含 176 项变更,其中 112 项为修复。两项变化在日常使用中尤为明显:在 settings.json 中设置 "attribution": false,即可移除提交和拉取请求中的所有署名;立即发送消息(ctrl+enter)时,正在运行的工具会转入后台,而不会取消当前轮次。
自动模式进一步收紧:当分类器审核在服务器端运行时,即使是只读 shell 命令也要等待审核结果。另有一项安全修复值得注意:针对命令替换的递归 rm,例如 rm -rf "$(pwd)",此前在自动模式下即使启用了 --dangerously-skip-permissions,也会未经确认就执行;现在即便有允许执行的 Bash 规则,仍须确认。为避免无人值守的会话一直受阻,危险 rm 的确认提示会等待两分钟,随后拒绝该命令并建议改写。
对自行托管的运行器有一项不兼容变更:添加 --system-prompt 的中间脚本(wrapper)或钩子必须改用 --system-prompt-file。对于管理员,Claude apps 网关可以使用通过 STS 获取的 IAM 角色调用 Amazon Bedrock(assume_role),必要时可跨 AWS 账户调用,并为每个请求应用 Bedrock 防护措施。
Anthropic 产品动态:claude.ai 提速,Marketplace 扩展
Anthropic 同日发布的两项产品消息,补充了科研方面的进展。
claude.ai 在两周内提速至三倍
9月23日——Anthropic 的三名工程师在 claude.dev 讲述了今年 8 月为期两周的冲刺:claude.ai 和桌面应用的速度因此提高到原来的约三倍。整个过程都在一个 Slack 频道中进行,由 Claude Tag(测试版)参与协作;它使用的内部研究模型“能力大致相当于 Opus 5.5”。Claude 找出瓶颈、构建基准测试、提出修复方案并监控部署,人工团队则设定目标并批准每项变更。最终,超过 3,000 项变更得到合并,且没有发生客户可见的故障或回滚。
| 测量项目(第 75 百分位) | 冲刺前 | 冲刺后 |
|---|---|---|
| claude.ai 页面可开始输入 | 3,1 s | 0,55 s |
| 新建 Claude Code 会话(桌面端) | 0,8 s | 0,3 s |
| Claude Cowork 云端会话(桌面端) | 2,6 s | 0,73 s |
| 13 项测量结果的几何平均值 | – | 快 3,1 倍 |
其方法可以概括为一个想法:只要给 Claude 一个需要超越的数字,它就能进行优化。因此,团队将确定性的测量指标变成只能向下调整的 CI 门槛。其中一项成果——流式输出流畅度提高约四倍——已于 8 月 24 日公布。
Claude Marketplace 汇集连接器、代理和集成服务商
9月23日——Anthropic 扩展了今年 3 月以有限预览形式推出的 Claude Marketplace。这个平台如今汇集三类产品与服务:超过 2,000 个连接器和插件(Atlassian、Google、Microsoft、Notion、Salesforce 等);由 Claude 驱动的代理和产品(CrowdStrike、Cursor、Harvey、Legora、Lovable、Snowflake),企业可使用其 Anthropic 支出承诺中的一部分支付费用;以及 Claude Partner Network 中的咨询公司(Accenture、Boston Consulting Group、Deloitte)。开发商有三种加入方式:利用 MCP 和 Agent Skills 构建连接器或插件,申请上架代理或产品,或者加入 Partner Network。一篇配套文章展示了采购方式:CodeRabbit 用其 Anthropic 预算中的承诺支出支付了 Vercel 套餐费用,一周内就达成协议。这种使用 Anthropic 支出承诺付款的方式仍处于有限预览阶段,需申请资格。
ChatGPT:Voice 开始执行任务,推出复习卡片和 Privacy Center
Voice 使用插件,并进入 ChatGPT Work
9月23日——OpenAI 从两个方向扩展 ChatGPT Voice。现在,在网页端、iOS 和 Android 的对话中,Live 语音模式可以使用账户连接的插件和应用,例如邮件、日历或 Slack。Voice 也进入了网页端和移动端的 ChatGPT Work:用户可以口头要求创建文档、演示文稿或电子表格,使用已连接的应用,或在浏览器中执行任务;通话结束后,任务还可以通过文字继续。
模型方面,OpenAI 的推文称 Voice 也可以使用 GPT-6 Astra、Sol 和 Luna;帮助文章则指出,Live 会根据套餐使用 GPT-Live-1 或 GPT-Live-1 mini,但没有详述 GPT-6 模型的作用。Free 和 Go 用户可在 Chat 中通过 Voice 使用各自套餐包含的插件;在 Work 中使用 Voice 则需要同时拥有两项功能的使用权限,由此启动的任务计入 Work 的正常用量。Live 不支持视频或屏幕共享。该功能自 9 月 23 日起通过最新版应用在全球推出。
🔗 OpenAI 在 X 上的公告 · ChatGPT Voice 帮助文章
复习卡片与隐私中心
9月22日——ChatGPT 现在可以根据主题或上传的笔记创建交互式复习卡片(flashcards)。点按卡片即可翻面,然后标记自己是否知道答案,或是否需要再复习;卡片顺序也可以打乱。卡片会自动保存到资料库。所有套餐的用户都可在移动端和网页端使用,包括免费套餐。
9月21日——补充一则消息:同一版本说明页面在前一天宣布推出隐私中心(Privacy Center),目前正向已登录的 Free、Go、Plus 和 Pro 用户逐步开放。它在同一处汇集有关对话隐私、记忆、个性化、数据使用、已连接应用和账户安全的信息,并提供直达设置的链接。在网页端,可通过账户菜单进入(先选 Help,再选 Privacy Center);在移动端,可从设置中进入。
两项新基准测试:心理健康与推理服务
MentalHealthBench(OpenAI)
9月23日——OpenAI 发布开放基准测试 MentalHealthBench,用于衡量模型在真实感较强的心理健康对话中的回应方式,涵盖带有情绪困扰的日常交流乃至紧急情况。来自 22 个国家、使用 19 种语言的 80 多名持证心理学家和精神科医生参与了共同构建。合成对话设有四类人物:成年人、13 至 17 岁的青少年、照护者和临床医生。专家为每段对话编写了权重介于 -10 至 +10 的评估标准;只有至少三分之二的专家赞同,且第三名专家不持相反意见的标准才被保留。评分由 GPT-5.6 Sol 担任评估模型自动完成,并分解为安全性、背景信息探询、尊重用户自主权等十个维度。OpenAI 称模型持续进步,尤其体现在背景信息探询方面,但各模型的分数只出现在文章图表中。OpenAI 同时提醒,ChatGPT 不能替代心理治疗或专业人员的持续照护。
SWE-Serve(NVIDIA)
9月23日——负责 Nemotron 模型数据与评估的 NVIDIA 团队,与 SGLang 团队共同发布 SWE-Serve:他们从这个推理服务引擎中 83 个实际合并的拉取请求,构建了 53 项可执行任务,涉及推测解码、模型支持、内核、缓存和服务 API。主要结果揭示了本地测试与实际服务之间的差距:在 19 项会启动真实服务器的任务中,同一批修复在不运行实时服务测试时通过率为 69,4 %,使用完整验证器时则降至 45,9 %。也就是说,在通过其他检查的修复中,约有三分之一会在模型加载并接受请求后失败。
| 受评模型(最高推理强度) | 3 次运行的 pass@1 | 每项任务的平均成本 |
|---|---|---|
| Claude Opus 5 | 75 % | 17,40 美元 |
| GPT-5.6 Sol | 75 % | 12,26 美元 |
| Kimi K3 | 64 % | 7,24 美元 |
| GPT-5.6 Luna | 64 % | 0,95 美元 |
| DeepSeek V4 Flash (0731) | 55 % | 0,69 美元 |
研究使用一个无法访问网页的简易代理评估了 11 个模型;表中不包含 Claude Opus 5.5、9 月 22 日发布的 GPT-6 Sol 和 Luna,也不包含 GPT-6 Astra。任务和验证器均已公开。
🔗 SWE-Serve 如何揭示本地测试与实时服务之间的差距 · GitHub 仓库
生成式视频进入剪辑软件
Runway 进入 DaVinci Resolve Studio
9月23日——在推出 Premiere Pro 和 After Effects 插件两周后,Runway 进入了 Blackmagic Design 的剪辑软件 DaVinci Resolve Studio。这款适用于 macOS 和 Windows 的免费插件可从 Workspace 进入,再选择 Workflow Integrations。用户可以在其中通过提示词生成图像和视频,一键导入 Media Pool 并放到时间线上,无需打开浏览器。Edit Studio 功能可以处理已剪辑好的镜头:面板会导出选定片段,Aleph 2.0 再根据最多五张经过修改的关键帧,以新风格重新生成相同时长的片段。使用该插件需要 DaVinci Resolve Studio 19 或更高版本;所有 Runway 付费套餐均可生成内容,费用从现有积分中扣除,每次生成的成本会在确认前显示。
Google Vids 免费提供 Gemini Omni 1.1 Flash
9月23日——现在,拥有 Google 或 Google Workspace 账户的用户都可以在电脑上通过 vids.new,使用 Google Vids 中的 Gemini Omni 1.1 Flash 免费生成视频。1.1 版本增加了三种控制能力:在保持人物、光照和场景一致的情况下延长画面;精确设定片段时长,使其与画外音同步;以及直接生成 1080p 视频。每个片段都带有 SynthID 水印。全面推送从 9 月 23 日开始,可能需要 1 至 3 天;付费套餐提供更高的生成额度,但 Google 未公布具体数量。Google 还宣布,Gemini 3.8 Flash-Lite TTS 即将在 Vids 中支持 100 多种语言的旁白生成。
Made On YouTube 2026:Gemini Omni 加入 Shorts 剪辑
9月23日——在年度活动 Made On YouTube 上,YouTube 将 Gemini Omni 集成到面向 Shorts 和 YouTube Create 应用的对话式剪辑助手中:只需简单的文字指令,就能剪掉口播片段、同步音乐、添加文字开场语或调整镜头顺序。直播新增自动配音(Live auto-dubbing);YouTube Music 增加 Ask Music,可通过对话编排播放队列;Podcast Lineup 则每周提供由人工智能生成的推荐播客语音预览。创作者还获得了范围更广的相似性检测功能,以保护自己的声音和面容。只有个性化首页信息流(Custom Feeds)给出了上线时间:今年秋季面向美国观众推出;其他功能尚无明确时间表。
🔗 Made On YouTube 2026 · Google 总结
助手连接更多应用
Gemini:新一批已连接应用
9月23日——Google 推出一批可连接到 Gemini 的新应用,@GeminiApp 账户将这些连接称为 MCP 连接。文章按三个类别列出 14 个名称:生产力工具(Airtable、Linear、monday.com、PandaDoc、Wispr AI、Zoho)、创作工具(Adobe、Picsart、Squarespace、Webflow)和日常生活服务(apartments.com、Experian、Peloton、SeatGeek);而 @GeminiApp 的推文称新增了 13 款应用。用户可在设置中启用这些服务,也可在对话中输入 @ 来调用。例如,使用 Adobe 调整照片光照,或通过 Experian 查询自己的信用评分。文章没有说明适用国家或套餐。
Meta 的代理 Muse:Shopify、PayPal、Expedia、Instacart,以及 ElevenLabs 和 HeyGen
9月22日至23日——Meta 于 9 月 8 日推出的个人代理 Muse,在不到 24 小时内宣布了四个面向商业服务的连接器。官方账户 @Muse 称它们均将“很快”上线,但没有给出日期、价格或适用国家。23 日,又有两家生成式媒体公司宣布接入:ElevenLabs 未说明上线日期;HeyGen 则使用其 MCP 服务器。
| 宣布接入的服务 | 公告描述的用途 | 发布方 | 公布的上线时间 |
|---|---|---|---|
| Shopify | 在全网一键付款 | @Muse | 即将上线 |
| PayPal | 由代理在全球范围内处理付款 | @Muse | 即将上线 |
| Expedia | 预订酒店 | @Muse | 即将上线 |
| Instacart | 杂货送货上门 | @Muse | 即将上线 |
| ElevenLabs | 画外音、配乐和视频 | @ElevenLabs | 未说明 |
| HeyGen | 用自己的声音制作可直接发布的头像视频 | @HeyGen | 未说明 |
🔗 @Muse 宣布的四个连接器 · ElevenLabs 接入 Muse · HeyGen 加入 Muse
Grok Bot 登陆 Tesla,并连接 Google Slides、Sheets 和 Docs
9月22日——Tesla 宣布,SpaceXAI 的代理 Grok Bot 将进入其汽车:借助 Connectors,Grok 可以管理邮箱、整理日历,或接续现有的文件、对话和任务,驾驶员无需松开方向盘。@grok 账户当晚转发了这项公告。启用需要三步:在车内登录 Grok 应用,通过 Grok 移动应用或网站添加 Connectors,然后订阅使用 Grok Bot 所必需的 SuperGrok。相关消息未说明适用车型或国家。
同一天,@bot 账户宣布 Grok Bot 可原生连接 Google Slides、Sheets 和 Docs,更好地处理电子邮件附件(读取和添加文件),并可让网页浏览流量经由用户的网络。SpaceXAI 还表示任务执行会更快、桌面应用响应会更灵敏,但未提供具体数据。
🔗 @grok 转发的消息 · Tesla 公告 · Grok Bot 帖文串
Antigravity:本地运行的代理与 /plan 命令
SDK 借助 Gemma 4 26B 在本地运行代理
9 月 23 日 — Antigravity SDK 让开发者能够通过 Python 使用 Google Antigravity 的代理能力,现已支持完全在本地运行的工作流。首批支持的是通过 LiteRT (Google AI Edge) 运行的 Gemma 4 26B A4B,设备需配备超过 24 GB 的 VRAM 或统一内存;LocalOpenAIAgentConfig 可连接 Ollama、LM Studio 或 vLLM 等任何兼容 OpenAI 的服务器。Google 表示,这样无需支付 API 费用,也不受速率限制,代码不会离开本机,还能运行混合工作流。在其演示中,Gemini 3.8 Flash 在云端使用 95 个 token 规划对三个存在漏洞的模块进行审计,全程不接触代码;本地的 Gemma 4 26B 实例则复现漏洞、编写并验证修复方案。97.2% 的 token(3 322 个)留在本地。这些功能随 9 月 21 日发布的 SDK 0.1.18 一同推出;该版本还从默认工具中移除了交互式提问工具 ASK_QUESTION,让代理能够自主运行。
Antigravity 2.16.0 与 2.17.0,CLI 1.2.8 与 1.2.9
9 月 22 日 — Antigravity 应用在同一天发布了两个版本。2.17.0 引入 /plan 命令:代理先拟定计划,供用户审阅和修改,然后才开始编写代码。Plan Review Policy 设置提供三种模式:审阅每份计划、由代理自行判断,或跳过审阅。该版本还为规则预留了 20 000 个 token 的预算,并从 .gemini/config.json 读取各仓库的配置;旧的 .agents/settings.json 不再生效。2.16.0 支持连接 WSL 发行版、将 Word、Excel 和 PowerPoint 文档拖入提示词,并以实时卡片展示子代理。
| 应用版本 | 改进数量 | 修复数量 | 主要新功能 |
|---|---|---|---|
| 2.16.0 | 12 | 15 | WSL、Office 附件、子代理卡片 |
| 2.17.0 | 11 | 10 | /plan、规则的 20 000 个 token 预算 |
9 月 22 日和 23 日 — 在终端方面,CLI 1.2.9 新增 @ 语法,可直接向子代理发送消息,并提高了 headless 模式的可靠性:后台任务最多可等待 30 分钟,不再在代理停止活动几秒后就被取消。1.2.8 调整了上下文压缩机制,并将语音听写时长限制为 3 分 30 秒。
Google DeepMind:为 Private AI Compute 提供加密的持久化记忆
9 月 23 日 — Google DeepMind 详细介绍了为 Private AI Compute 增加持久化记忆的方案。Private AI Compute 是其在硬件隔离的云端安全区内处理数据的平台。此前,该平台“无状态”:任务结束后,所有上下文都会消失。新的一层机制相当于云端的加密保险库,密钥只保存在用户设备上;Google 表示,因此任何人,包括 Google,都无法访问其中的数据。当模型需要某项信息时,安全区会在隔离内存中暂时解密数据、处理请求、保存新的上下文,然后立即重新加密。文中举例说,用户可以在电脑上找回此前通过智能眼镜查看过的组装说明。
这是一项面向未来的架构公告,没有给出上线日期,也没有指定产品。为建立信任,Google 发布了更新版白皮书、公开且不可篡改的服务器软件记录,供设备在发送个人数据前验证,并公布了一家未具名机构开展的独立审计结果。
Qwen:面向智能手机的代理与更便宜的音频服务
Qwen Intelligence:为手机厂商提供三种代理
9 月 23 日 — Qwen 推出 Qwen Intelligence,这是一套主要面向手机厂商的智能手机代理服务。规划、执行、图像和记忆模块可以按需组合,路由机制则在设备与云端之间分配计算任务。首批推出三种代理:Mobile Planner 规划复杂任务;Mobile-Use 执行任务时优先调用 API,必要时改用图形界面(据 Qwen 称,其在 MobileWorld 上得分 82.1,在 AndroidDaily 上得分 97.2,端到端成功率为 90%);Mobile Creative 可在 3 秒内生成一张图像。Qwen 开放了四项基准测试,但未开放代理的模型权重或代码。Mobile-Use 和 Mobile Creative 已按使用量计费,Mobile Planner 的计费则称将“很快”推出。
| 评测模型或系统(据 Qwen) | MobilePA-Bench 总分 |
|---|---|
| Qwen-Planner-Agent 27B | 77,05 % |
| GPT-6 Astra | 76,84 % |
| Claude Opus 5 | 75,71 % |
| Claude Fable 5 | 74,53 % |
| GLM 5.3 | 73,88 % |
🔗 Qwen 在 X 上的公告 · Qwen-Planner-Agent 报告
Qwen-Audio-3.1:价格最多降低 95%
9 月 23 日 — Qwen-Audio-3.1 升级了 Qwen 的三种音频模型:语音识别(ASR)、语音合成(TTS)和实时对话(Realtime),并新增两种模型:TTS-Next 可一次生成语音、音效和背景声音;ASR-Next 可区分说话人、为转录内容添加时间戳,并识别情绪及环境噪声。Realtime 可以边听边说,也允许用户打断。在 QwenCloud 上,qwen-audio-3.1-realtime-plus 的音频输入价格为每百万 token 6.4 美元,文本及音频输出为 24 美元,上下文长度为 262K token;文件 ASR 的输入价格为每百万 token 0.15 美元。目前仅开放这两种 API,其余 API 据称将“很快”开放。
| 模型系列 | 宣布的降价幅度 |
|---|---|
| TTS | 约 70 % |
| Realtime | 约 85 % |
| ASR | 最高 95 % |
🔗 Qwen-Audio-3.1 在 X 上的公告 · QwenCloud 上的 Qwen-Audio-3.1-Realtime
Mistral Vibe:Chat 与 Work 合并,CLI 收紧权限
Chat 与 Work 合并,知识库进入预览阶段
9 月 22 日 — Mistral 发布了其助手 Vibe(原 Le Chat)的四份版本说明,没有另发博客文章或推文。其中最主要的变化是将 Chat 和 Work 合并为统一体验:用户可以在同一处提问或启动任务;Fast / Think 选择器取代模式切换;Skills 取代 Chat Agents,Deep Research 则成为其中一项 Skill。Free、Pro 和 Teams 账户的迁移已于 9 月 14 日开始;企业账户将从 10 月 1 日起陆续迁移,整个过程预计持续约六个月。进入公开预览阶段的代理知识库(Agentic Knowledge Base)用可查看、可编辑的页面取代不透明的记忆机制,并标明每条被调用信息的来源。Mini App Canvas 可根据提示词生成可分享的小型 React 应用;付费方案中的 Vibe Work 也开始支持 Excel 或 CSV 表格。
Vibe CLI 2.25.8 修复权限绕过问题
9 月 23 日 — Vibe CLI 2.25.8 包含 5 项新增功能和 38 项修复,其中多项涉及权限安全。按相对路径设置的允许列表不再仅因文件路径具有相同后缀就放行该文件;shell 命令中的通配符不再绕过对工作目录以外路径的检查;授予父文件夹的权限也不再自动涵盖其子文件夹,因此某些审批请求可能重新出现。版本说明还首次提及“Rust CLI”,涉及 18 条更新,包括支持配置 Vibe Code 远程项目。在企业方面,组织强制执行的配置从 Unified Harness 会话启动时即生效;对 Supabase 等会签发客户端密钥的 MCP 服务器,OAuth 连接问题也已修复。
开源及命令行代码代理
ZCode 在出现安全问题后开源
9 月 21 日 — 补充消息:针对社区报告的安全问题,Z.ai 开放了 ZCode 的源代码。ZCode 是一套代理编程框架,被介绍为 GLM-5.3 的官方工具。@zcode_ai 表示已完成必要的修复,并为此道歉。采用 Apache-2.0 许可证的 zai-org/ZCode 仓库包含客户端、后端服务、CLI 和代理运行时;截至 9 月 23 日,该仓库约有 6 500 颗星。
With respect to the code data referenced by the community, we confirm that no such data is retained and that it has never been used for model training.
🇨🇳 关于社区提及的代码数据,我们确认这些数据均未被保留,也从未用于训练模型。 — @zcode_ai 在 X 上
据 ZCode 称,此后有两家机构评估了相关情况:CAICT 认为,Alibaba Cloud OSS 存储桶“zcode-prod”已不再包含数据;NSFOCUS 认为,该存储桶及其中的对象均已删除。两家机构都指出,客户端 v3.14.0 已包含修复,Repo Wiki 功能已移除,上传本地仓库快照的数据流也已停用。Z.ai 宣布建立长期漏洞报告及奖励机制,并承诺公布完整的评估报告。
Kimi Code 2.1.0 加强安全性
9 月 23 日 — Moonshot 发布 Kimi Code 2.1.0,包含 2 项新功能和 18 项修复。最明显的新功能是实验性的全屏布局,可在 /settings 中选择,重启后生效。多项修复加强了安全性:文件工具不再能通过符号链接访问工作目录之外的内容;只有在工作区获得批准后,项目的本地配置才会生效;仓库的 git 配置不再能在后台 git 操作期间执行命令;指向用户主目录或根目录的额外文件夹也会被拒绝。MCP 服务器的 OAuth 现在会请求离线访问权限,从而避免每小时重新授权。与此同时,Moonshot 将旧版、用 Python 编写的 Kimi CLI(11 424 颗星)归档;其 1.51.0 和 1.52.0 版本均引导用户转向 Kimi Code。
DeepSeek Harness 0.1.7-rc.1 预览版
9 月 23 日 — DeepSeek 发布了 DeepSeek Harness v0.1.7-rc.1。这套采用 MIT 许可证的开源代理框架于 8 月 13 日亮相。该版本是候选发布版(release candidate):自 8 月以来,仓库已有 21 个预览版本,但至今没有稳定版本。主要新增功能仍处于实验阶段:Computer Use 模式允许代理操作本地电脑并截图(通过 Cua Driver MCP 或原生驱动);另外还提供三种浏览器控制后端(Playwright MCP、Chrome DevTools MCP、Stagehand)。网页界面新增内置终端和带 diff 的修改审查;headless 模式从标准输入读取任务,并以 JSON 输出事件;代理还能通过 SSH 在远程工作区工作。需要留意的迁移变化包括:DeepSeek 官方适配器改为仅使用 Messages API,E2B 执行后端被移除,实验性的团队模式则从 8 名队友扩展到 16 名。
🔗 DeepSeek Harness v0.1.7-rc.1
GenCode:Genspark 的代码代理
9 月 23 日 — Genspark 推出 GenCode,这是一款集成在其 Super App 中的代码代理,支持 macOS、Windows 和 Linux,也可通过命令行使用。其主要卖点是可以通过同一个账户,按任务选择 Claude、GPT、DeepSeek 或开放权重模型,无需配置 API 密钥;Genspark 称,开放模型的成本“仅为十分之一到二十分之一”。GenCode 可一步导入为 Claude Code 编写的指令、规则和记忆。npm 软件包 @genspark/gencode 的 README 说明了其来历:它基于开源代码代理 opencode 开发,但属于与该项目无关联的专有产品,并有意共用仓库中的 .opencode/ 文件夹。每一步的开销都会以 Genspark 积分显示。
GitHub Copilot:辅助审批与本地沙箱
面向 JetBrains 的 Copilot 1.18.0
9 月 22 日 — 面向 JetBrains IDE 的 Copilot 1.18.0 在公开预览中引入辅助审批(assisted approvals):在代理会话中,被判定为低风险的工具调用会自动获批,风险较高的操作仍需用户决定。用户还可以编辑此前发送的消息;Copilot 随后会回退对话和文件修改,再发送新的指令。JetBrains 版 Copilot 中的 Codex 代理新增计划模式,可在修改任何内容前审阅、完善或批准执行方案;会话也支持组织和企业级的 Skills 与指令。默认启用的内置 GitHub MCP 服务器现在可以关闭。使用 JetBrains 2025.1 IDE 的用户会收到升级至 2026.1 或更高版本的提示。
Copilot 应用隔离本地会话
9 月 23 日 — GitHub 专为代理打造的桌面应用 GitHub Copilot,在公开预览中加入本地沙箱。沙箱按项目配置,可限制本地会话中的命令能够访问的资源:文件系统(可读写、只读或禁止访问的文件夹)、网络(访问互联网和局域网的出站连接)以及凭据(通过 HTTPS 使用的 Git 凭据、GitHub CLI 凭据)。企业管理的设置可以进一步收紧策略。如果操作系统无法执行所请求的策略,沙箱 shell 会报错退出,避免在缺乏保护的情况下运行。沙箱默认关闭;启用后会应用于项目的新会话,也可以通过 /sandbox on 为正在进行的会话启用。它不涵盖云端会话或远程主机,其设置也独立于 Copilot CLI 的设置。
Cursor:两个部署机器人,token 用量减少 7%
Rollouts 与 Security Review
9 月 23 日 — Cursor 推出两个面向代码交付“最后一公里”的机器人,供 Teams 和 Enterprise 套餐使用。每当有 pull request 创建时,Rollouts 就会发布一份监测计划,列明风险、预期效果和需要核查的信号;每次部署后,它会将计划与日志、指标和追踪数据对照,并按环境给出结论:正常、检测到回归,或无法确定。如果发生回归,它会指出可疑变更,并可创建一份需要审核的回滚 PR;它不会自行合并或回滚。Security Review 会检查每个 pull request,标出可被利用的漏洞,包括注入、身份验证绕过、遗留在代码中的密钥、SSRF 等,并为每项漏洞提供严重程度、攻击路径和建议修复方案。在 10 天内,试用额度可让 Teams 用户测试约 50 项变更,Enterprise 用户测试约 500 项变更。
Token 成本降低 7%,质量不变
9 月 23 日 — Cursor 说明了它如何在不降低质量的情况下,将用户使用其智能体的 token 成本降低 7%。由于新近的模型不再需要冗长的禁止事项清单,系统提示词缩短了约 66%;这些删减通过真实流量上的 A/B 测试得到验证。内置工具中,大多数在不到 20% 的对话中才会用到,因此现在改为按需加载。
| 优化措施 | Cursor 测得的效果 |
|---|---|
| 精简系统提示词 | 删除约 66% 的提示词 |
| 按需加载内置工具 | 静态上下文中的工具描述 token 减少 60% |
| 显式设置缓存断点 | 冷缓存失败率降低 20% |
| 每十行标注一次行号 | 从缓存读取的 token 减少 1.6% |
| 所有变更合计 | 用户的 token 成本降低 7% |
NVIDIA:开放的说话人分离模型与 AI Day Singapore
Nemotron 3 Diarization 可区分最多八名说话人
9 月 23 日 — NVIDIA 在 Hugging Face 发布 Nemotron 3 Diarization。这是一款拥有 1 亿参数的开放权重模型,可判断对话中谁在何时说话,包括声音重叠的情况。它最多可跟踪八名说话人,而前代模型 Streaming Sortformer 只能跟踪四名;它既支持离线处理,也支持流式处理,缓冲延迟可在 30.4 秒至 0.32 秒之间调整。它不转写词语,而是提供按说话人划分的时间段,供与转写模型配合使用。在 VoiceArena 的 Diarization-Bench 首批结果中,它以 14.72% 的说话人分离错误率在 12 个系统中排名第一,第二名为 19.3%;NVIDIA 表示,这一初步排名仍可能变化。与旧模型相比,它在八个评测数据集上的平均错误率降低了 41%,但在 CALLHOME 的双人对话数据上略有退步。采用 OpenMDW 1.1 许可证。
| 已公布的指标 | Nemotron 3 Diarization | 前代模型 |
|---|---|---|
| 最多跟踪的说话人数 | 8 | 4 |
| 30.4 s 时的吞吐量(批量大小 32,RTX PRO 5000) | 实时速度的 15 113 倍 | 2 619 倍 |
| 30.4 s 时的 DIHARD III 错误率 | 12.73% | 19.09% |
🔗 Hugging Face 博客上的 Nemotron 3 Diarization
AI Day Singapore:Vera Rubin 与 Nemotron 进入东南亚
9 月 22 日 — 在 AI Day Singapore(9 月 22 日至 23 日)期间,NVIDIA 于 22 日太平洋时间 19 时 30 分发布博文,介绍 Shopee、Garena 和 Monee 的母公司 Sea Limited:它是东盟地区首家采用 Vera Rubin 平台的企业,计划用该平台更大规模地开发和部署模型与智能体。博文其余部分展示了 Nemotron 开放模型在当地的应用:AI Singapore 将面向区域语言的 SEA-LION 模型家族扩展到 Nemotron 模型;在越南,Viettel AI 针对越南语微调了 Nemotron 3 Super,使其在 VMLU 基准测试中排名第一;在泰国,iApp Technology 通过以开源方式发布的 OpenThai 2.0 Legal,将 Nemotron 3 Nano 适配泰国法律领域,并用于为约 43 000 名用户提供服务的法律聊天机器人 Thanoy。
🔗 AI Day Singapore:NVIDIA 与合作伙伴展示东南亚 AI 进展
稳妥地将 AI 投入生产环境
两项公告传达了同一个思路:在切换流量或更新机器之前,先用真实负载验证。
Together AI 的金丝雀部署
9 月 22 日 — Together AI 详细介绍了其 Dedicated Model Inference 服务的渐进式部署功能。该功能自 9 月 15 日更新后提供,可在不中断服务、也不更改 URL 的情况下,替换 endpoint 背后提供服务的模型。它提供三种策略:金丝雀部署默认按 5%、25%、50%、100% 逐级增加新模型承接的流量;蓝绿部署一次性切换全部流量;渐进式替换则逐个更换副本。金丝雀部署每完成一级,检查机制都会将延迟或错误率与旧模型比较;如果指标恶化,就暂停部署。在公布的演示中,从 Qwen2.5-7B 切换到 Qwen3.5-9B 时,新模型承接 10% 流量便因 p95 延迟上升 137%(1 740 ms 对 734 ms)而停止部署;随后回退到旧模型,期间已处理的 6 800 个请求没有一个失败。
NVIDIA 的 NVCRE 与 NodeWright
9 月 23 日 — NVIDIA 介绍了 DSX OS 中两个采用 Apache 2.0 许可证的开源项目。DSX OS 是其 AI 工厂平台的软件层,这两个项目面向 Kubernetes 下的 GPU 集群。NVIDIA Cluster Readiness Engine (NVCRE) 针对一个问题:集群即使通过所有健康检查,仍可能在分布式训练中失败。因此,它会依据拓扑选择节点组,用真实负载验证集群,包括 NCCL 通信测试、DCGM 诊断和 NeMo 预训练;它还能指出故障节点,并在诊断模式下不断将故障节点组对半拆分,直到找出可疑节点。博文提到,这些负载包含参数量分别为 80 亿和 560 亿的 Nemotron 5 模型,但没有给出更多细节。NodeWright 原名 Skyhook,已在 NVIDIA 的生产环境中使用。它会等待受保护任务结束,再分批更新节点系统,包括内核设置、安全代理和漏洞补丁;批次规模可固定、线性增长或指数增长,如果失败批次过多,更新会自动停止。
🔗 在 AI 工作负载运行前验证 GPU 集群的就绪状态 · NodeWright
两个开放数据集:多人对话与科学语料库
Basis Conversations 1500
9 月 23 日 — Basis 在 Hugging Face 发布 Basis Conversations 1500:该数据集包含来自 33 个国家的 2 645 人进行的 1 502 小时自然对话,涵盖从英语到明格列尔语、科萨语在内的 22 种语言。每段对话有两到四名参与者,每人都有独立且同步的录音轨道(FLAC 48 kHz),可用于研究声音重叠、打断和轮流发言;团队称,这些现象仍让模型感到棘手。约 100 小时的内容经过人工细致标注,共有 113 096 项判断,涉及富有同理心或不耐烦的语音反馈、尴尬的沉默,以及合作性或竞争性的声音重叠。提供的转写文本由系统自动生成,未经核验不应作为训练目标。博文称该数据集可免费用于商业和研究用途,但它采用 Basis 自有的 basis-data-license-1.0 许可证,访问申请需经人工审核。
QVAC Genesis III
9 月 23 日 — Tether AI Research 发布 QVAC Genesis III,这是其面向科学、技术、工程和数学领域小模型预训练的合成语料库第三部分。新增 430.6 亿 token 后,整个语料库达到 1,914.3 亿 token、约 1.6 亿份文档,覆盖 19 个领域;随附论文已获 COLM 2026 会议接收。其方法是向一个小型学生模型 Qwen3-1.7B-Base 提问:答错时生成纠正性解释,答对时分析每个答案选项。一个拥有 17 亿参数的模型从零开始使用该语料库训练,在相同 token 预算下,相比使用 Cosmopedia-v2 训练的同款模型取得明显进步。语料库采用非商业许可证(CC-BY-NC 4.0)发布;研究团队还宣布,一个使用该语料库训练的模型将采用 Apache 2.0 许可证。
| 评测基准 | 相比 Cosmopedia-v2 的提升(token 预算相同) |
|---|---|
| ARC-Easy | +28.57 分 |
| ARC-Challenge | +21.35 分 |
| GPQA Diamond | +2.52 分 |
| MMLU STEM | +15.03 分 |
AI 助力气候与粮食生产
Ai2 与 Global Fishing Watch 借助智能体监测海洋
9 月 23 日 — 在纽约气候周期间,Ai2 和 Global Fishing Watch 宣布合作,将 AI,尤其是智能体,用于海洋监测和渔业监管。两家机构此前已有合作,如今将共同开发:一套共用的检测流程、用于实时分析卫星图像的新视觉模型,以及能够交叉分析多个数据源的智能体。Global Fishing Watch 将使用 Ai2 基于开放模型构建的地球观测平台 OlmoEarth,为自身数据添加标注并训练自己的模型。Skylight 的实时船舶检测结果将接入其面向海洋保护区管理人员的门户;两个团队也将改进 Shippy 等智能体,让分析人员能够向其查询船舶历史。公告未提供时间表或资金数额。
🔗 Ai2 与 Global Fishing Watch 携手将 AI 智能体用于海洋监测
Google.org 与 Gates Foundation 面向 2 亿小农户
9 月 18 日和 22 日 — 近期消息回顾:Google.org 与 Gates Foundation 扩大联合计划,目标是让撒哈拉以南非洲和南亚的 2 亿小农户用上气候、农业和语言方面的 AI 工具,最初目标为 5 000 万人。双方合计投入 1 亿美元,并获得 Google 研究人员和工程师的技术支持。Gates Foundation 的新闻稿发布于 9 月 18 日;blog.google 于 22 日晚间转载了这则消息。该计划资助印度的 Wadhwani AI 和 Digital Green 等本地机构,将 AI 预测整合进 TomorrowNow 气候平台,以小于一米的分辨率绘制地块地图,并支持建设涵盖 40 多种非洲语言的开放语音与文本数据集。小农户生产了全球近 35% 的粮食。
🔗 Google.org 公告 · Gates Foundation 新闻稿
简讯
- Anthropic:代码现代化 — 在“Notes from the Field”系列中,Anthropic 的两名驻客户现场工程师 Jonah Ezekiel 和 Lexie Tonelli 提出由智能体推进代码现代化前的六个准备步骤:确定目标、建立测试“证书”、分阶段进行人工审查、满足前提条件、设计智能体工作流程,然后启动。他们没有给出成本数据,建议通过试点测算。🔗 来源
- Boris Cherny 用 Lean 验证 Claude Agent SDK — 22 日晚,Claude Code 的 Boris Cherny 表示,他用 Opus 5.5 和 Lean 证明助手对 Claude Agent SDK 进行了形式化验证:几个简短提示就生成了 16 个修复错误和并发问题的拉取请求。他说自己也使用 TLA+。🔗 来源
- Codex CLI 0.156.1 — 这一针对 0.156.0 的修补版本将 GPT-6 Sol 和 GPT-6 Luna 加入 CLI 的模型选择器;遇到速率限制时显示的提示现在推荐 Luna,并提供从 GPT-5.5 和 GPT-5.6 迁移的选项。🔗 来源
- Airbnb 与 GPT-6 Astra — 一项新协议扩大了 Airbnb 工程和产品团队通过 OpenAI API 及 Amazon Bedrock 使用 OpenAI 模型的权限,其中包括 GPT-6 Astra。其首席技术官 Ahmad Al-Dahle 称,团队交付的功能比一年前增加约 80%;协议金额未披露。🔗 来源
- OpenAI Academy 成立两周年 — 自 2024 年 9 月以来,OpenAI Academy 举办了 250 多场活动,覆盖超过 400 万人;OpenAI 正在试点“社区培训师计划”(Community Trainer Program),合作组织的员工通过评估后学习如何主持工作坊。🔗 来源
- 变身语音助手的 LED 显示屏 — Sid Rampally 在 OpenAI Developers 博客上介绍,Codex 如何帮助他连接并编程一块由 Raspberry Pi 驱动、分辨率为 128 × 64 像素的 LED 面板;GPT-Live-1 负责对话,并通过 Responses API 将搜索和显示任务交给 GPT-5.6 Luna。🔗 来源
- MedGemma 下载量超过 1000 万次 — Google 介绍了其开放医疗模型的实际应用:在赞比亚为 3500 多名女性筛查宫颈癌、在德里 AIIMS 医院开展试点,以及在印度尼西亚检测结核病。Google 提醒,这些模型的输出不应直接用于诊断决策。🔗 来源
- Google Docs 中的 Gemini Notebook — 在 Docs 中输入 @,即可引用某个 notebook 作为来源:Gemini 会依据其中的资料撰写内容,附上文内引文,并通过 Workspace Intelligence 将其与电子邮件和文件结合。该功能面向 Business Standard 和 Plus、Enterprise Standard 和 Plus、Education Plus,以及 Google AI Pro 和 Ultra 订阅用户开放。🔗 来源
- 六款 Google Flow 工具 — Google Labs 发布了创作者使用 Google Flow Tools 构建的六款工具:Mondo Sónico(同步音效)、CaptionCast(动态字幕)、ThumbnailForge(缩略图)、Surface(3D 表面纹理)、CollageMotion Pro 和 SwissFlow Studio(动态图形设计);每款都可以复制和重新混搭。🔗 来源
- Google Beam 开始在法国交付 — Google 与 HP 合作销售的视频通信平台 Beam 旨在重现面对面交流的临场感,目前已在包括法国在内的六个国家交付,并拥有 18 家合作伙伴。一项内部研究称,团队成员的联系感提高了 50%,跟进会议减少了 21%。🔗 来源
- Android Enterprise 与 Gemini 智能体 — Gemini 可以根据屏幕显示的上下文跨应用连续执行任务;防护机制则阻止个人智能体访问工作资料。管理员可以限制或关闭整个设备群的 AI 自动化功能。🔗 来源
- AI Brief 支持法语 — AI Brief 的封闭测试现已支持法语、荷兰语、德语、意大利语、日语、葡萄牙语和西班牙语。它允许用户用自己的话指导 Google Ads 的 AI Max 广告活动。🔗 来源
- Gemini CLI:9 月 23 日夜间构建版 — 这只是夜间构建版,并非稳定版:它新增 Gemini 3.8 Flash 和 Gemini 3.5 Flash Lite,可立即通过 API 密钥、Vertex AI 或网关使用;使用 Google 账号则须开启实验性功能标志。22 日星期二没有发布稳定版。🔗 来源
- EcoHash 测量视频优化效果 — 在配备 96 GB 显存的 RTX PRO 6000 上,EcoHash 使用经蒸馏、只需 4 步的 LoRA,将 MiniMax H3 视频生成时间从 174.8 秒缩短至 40.8 秒,将 Wan2.2 文生视频时间从 132.3 秒缩短至 10.7 秒。尝试的十项设置中有三项没有产生变化,其中包括两种编译模式。🔗 来源
- 克里米亚鞑靼语:避免了一次失真的测试 — 一名克里米亚鞑靼语语音识别模型开发者发现,语料库中有四本有声书各出现了两次:主测试集 96.9% 的片段在训练数据中都有对应副本。修正数据、进行 LoRA 微调并调整解码器后,词错误率从 0.3463 降至 0.1701。🔗 来源
- Falcon-H1 与 mlx-lm — 在 mlx-lm 0.31.3 中,如果不使用 KV 缓存,训练时 Falcon-H1 的 66 层只有第一层会执行:任何 LoRA 都会在这个实际只有一层参与训练的模型上完成训练,且没有错误或警告。修复只需一行代码,相关 issue 已建立。🔗 来源
- 智能体与开源贡献 — Hugging Face 的 Quentin Gallouédec 认为,智能体生成的贡献掩盖了真实需求的信号,还占用维护者的审查时间;他呼吁停止让智能体随意向项目提交内容,先从使用项目开始。🔗 来源
- Phionyx 向 IETF 提交草案 — Phionyx 的作者提交了一份个人草案 Claim-Preserving Exchange of AI Evaluation Evidence,旨在让评估结果在系统之间传递时保留其适用条件和局限;目前没有任何工作组采纳该草案。🔗 来源
- Kimi Work 3.2.12 — Moonshot 的桌面智能体现在允许用户选中 PPT、Excel、Word 或 Markdown 文件中的一段内容,再对其进行精确修改;附件大小限制也已取消。🔗 来源
- Qwen-Image-2.1 位居开放模型榜首 — 据 Arena 数据,Qwen-Image-2.1 在图像编辑(1367 分,总榜第 16)和文生图(1228 分,总榜第 17)两个类别中均成为排名第一的开放模型。🔗 来源
- Copilot 应用中的 OpenTelemetry — 管理员可通过
managed-settings.json的telemetry属性,将 GitHub Copilot 应用的智能体会话追踪数据(模型请求、使用的工具)导出到其监控工具;提示词和回复内容默认不包含在内。🔗 来源 - Copilot CLI 与 C++ — Copilot CLI 的 Microsoft C++ Language Server 现在会为整个项目的符号构建持久索引,且默认启用;首次构建可能耗时较长、占用较多内存,GitHub 没有量化性能提升。🔗 来源
- 一份有百万行代码的拉取请求 — GitHub 的一篇工程博客介绍,Copilot 应用如何显示一份涉及 2200 个文件、超过 100 万行代码和 400 多条评论的拉取请求:代码的布局信息预先计算,评论的布局信息则在接近可见区域时测量。🔗 来源
- Genspark 加入 Opus 5.5、GPT-6 和 Grok 4.7 — 23 日夜间,Genspark 在 AI Chat、Code Agent 和 Claw 中开放 Claude Opus 5.5、Grok 4.7、GPT-6 Sol 和 GPT-6 Luna,并沿用各模型厂商的宣传说法;未说明套餐或价格。🔗 来源
- GitHub 与 Yale 的调查 — 在美国的 1039 名 GitHub 用户中,71% 表示担忧 AI 对环境的影响,十人中有八人希望获得编写更节能代码的工具;GitHub 指出,样本来自同意接收其营销信息的人群,不具代表性。🔗 来源
- Zed 1.21.0 — 稳定版允许用户使用自己的 API 密钥接入 Claude Opus 5.5 以及 GPT-6 Astra、Sol 和 Luna,在 Agent 面板加入 SuperGrok 登录,并默认在智能体工作期间阻止计算机进入睡眠状态。🔗 来源
- Warp — GPT-6 Sol 和 Luna,以及随后加入的 Claude Opus 5.5,现已登陆 Warp 终端和 Warp Agent CLI;连接了 Grok 订阅的用户也可使用 Grok 4.7。公告只说明了可用性,没有公布价格。🔗 来源
- Microsoft Teams 中的 Devin — 此前只能在频道中使用的 Devin,现在也能回复私信和群聊消息、从频道启动 Automations,并发送提问或审批卡片;该应用不要求新增权限。🔗 来源
- Scribe v2 Medical — ElevenLabs 的临床转录模型自 9 月 11 日起已可使用,如今获得正式发布公告,并公布了一项新数据:处理临床音频时,其词错误率比 Scribe v2 低 35%。定价为每小时 0.22 美元起。🔗 来源
- Sora 2 退出 ElevenLabs — ElevenLabs 将 Sora 2 和 Sora 2 Pro 从其创作平台移除,因为 OpenAI 将于 9 月 24 日关闭 Sora API;OpenAI 已于 3 月 24 日宣布这一截止日期。受影响的工作流程需要改用其他视频模型,例如 Gemini Omni 1.1 Flash。🔗 来源
- Cohere Model Vault 在加拿大上线 — Cohere 宣布,其单租户专用推理平台 Model Vault 已在加拿大提供,但未说明云区域、供应商或价格;产品页面尚未提及加拿大。🔗 来源
- Cohere 与变革管理 — Cohere 的 Katherine Correia 在一篇文章中建议将 AI 视为参与者,而不只是工具;将任务分为可验证型、依赖判断型和混合型,并按使用场景进行治理。文章没有发布产品或数据。🔗 来源
这意味着什么
Anthropic 的研究成果将代码智能体带入基础生物学领域。约 950 个 Claude 智能体在 21 小时内筛选了 20 多万种逆转录酶;人类只在开始时提供提示词,并在最后开展实验。瓶颈转向假设的筛选,Anthropic 如今也将这一过程作为研究对象。仍需谨慎看待:ART 的功能尚不明确,研究结果目前也只是预印本。同样的思路——大规模部署智能体并用指标约束其工作——也见于加速 claude.ai 的冲刺项目,其中产生了 3000 多项更改,以及使用 Lean 对 Claude Agent SDK 进行的形式化验证。
智能体沙箱的安全性正成为公开讨论的话题。Perplexity 的审计区分了两道边界:虚拟机隔离在 108 次测试中全部守住;网络过滤则在 54 次测试中被突破 11 次,模型利用了验证不足的 DNS 或 CDN 的共享地址;十家第三方平台中有八家至少存在一种绕过方式。Fable 和 GPT-6 Astra 两个模型拒绝执行这项测试。同一天,GitHub Copilot 应用推出了一个在无法提供保护时会直接终止运行的本地沙箱;Claude Code 的自动模式将只读命令也交给分类器检查;Vibe CLI 和 Kimi Code 封堵了授权绕过漏洞。两天前,ZCode 在社区报告问题后公开了源代码。
语音正在成为执行操作的界面。Gemini 3.8 Flash TTS 和 Flash-Lite TTS 的音频输出价格比上一预览版降低一半以上:到 2026 年底,每百万 token 分别为 9 美元和 6 美元,原价为 20 美元。它们还加入了以录制同意声明为前提的声音复刻功能,但该功能无法通过 AI Studio 在欧洲经济区使用。Qwen 宣布其音频产品线降价 70% 至 95%;NVIDIA 开放了一款能够区分八名说话者的模型;Basis 发布了 1500 小时包含声音重叠的对话数据。与此同时,借助 ChatGPT Work 的插件和任务功能,ChatGPT Voice 正从对话转向执行操作。
最后,实体世界中的 AI 也在开放,但开放程度各有不同。FLUX 3 Action 的 70 亿参数模型登上 RoboLab-120 榜首,并与 NVIDIA 合作将其集成到 LeRobot;它还表明,快速可靠的策略可以减少对高成本推理的需求:由 GPT-6 Astra 担任监督模型时,每次成功的成本为 8.77 美元,而单独使用 Astra 则为 13.47 美元。不过,“开放”的具体含义并不一致:FLUX 3 Action 和 Basis Conversations 1500 各有自己的许可证,QVAC Genesis III 采用非商业许可证,Qwen Intelligence 则只公布基准测试结果而不开放模型权重。对于希望复用这些资源的人来说,许可证与评分同样重要。
来源
- Claude 发现一种具有类似 CRISPR 重复序列的新型酶系统(Anthropic)
- ART 预印本(PDF,Anthropic)
- @AnthropicAI:Claude 发现的酶系统
- Gemini 3.8 Flash TTS 和 Flash-Lite TTS(Google)
- Gemini API 9 月 22 日版本说明
- Gemini API 定价
- FLUX 3 Action(Black Forest Labs)
- @bfl_ai:FLUX 3 Action 发布
- Hugging Face 上的 FLUX 3 Action 合集
- 逃离 SPACE,第一部分(Perplexity)
- Claude Code v2.1.281
- 我们如何在两周内让 claude.ai 提速三倍(claude.dev)
- Claude Marketplace(Anthropic)
- @OpenAI:ChatGPT Voice 支持插件并登陆 ChatGPT Work
- ChatGPT Voice 帮助文章
- ChatGPT 版本说明
- 介绍 MentalHealthBench(OpenAI)
- SWE-Serve(NVIDIA)
- NVIDIA/swe-serve 代码仓库
- Runway 现已登陆 DaVinci Resolve
- Google Vids 中的 Gemini Omni 1.1 Flash
- Made On YouTube 2026
- Made On YouTube 2026 回顾(Google)
- Gemini 新增的关联应用
- @GeminiApp:新增 13 个关联应用
- @Muse:即将推出四个连接器
- @ElevenLabs:ElevenLabs 即将登陆 Muse
- @HeyGen:HeyGen 加入 Muse
- @grok:Tesla 车内的 Grok Bot
- @Tesla:Grok 与 Connectors
- @bot:Grok Bot 连接 Google Slides、Sheets 和 Docs
- Antigravity SDK 中的本地模型(Google Developers)
- Antigravity 更新日志
- Private AI Compute 的持久记忆功能(Google DeepMind)
- @Alibaba_Qwen:Qwen Intelligence
- Qwen-Planner-Agent 报告
- @Alibaba_Qwen:Qwen-Audio-3.1
- QwenCloud 上的 Qwen-Audio-3.1-Realtime
- Mistral 版本说明
- Vibe CLI 2.25.8
- @zcode_ai:ZCode 开源
- zai-org/ZCode 代码仓库
- Kimi Code 2.1.0
- DeepSeek Harness v0.1.7-rc.1
- GenCode(Genspark)
- @genspark_ai:GenCode 发布
- 适用于 JetBrains 的 Copilot 1.18.0(GitHub 更新日志)
- GitHub Copilot 应用中的本地沙盒(GitHub 更新日志)
- Rollouts 与 Security Review(Cursor 更新日志)
- Token 效率提升(Cursor)
- Nemotron 3 Diarization(NVIDIA,Hugging Face 博客)
- AI Day Singapore(NVIDIA)
- 金丝雀发布(Together AI)
- NVIDIA Cluster Readiness Engine(NVIDIA)
- NodeWright(NVIDIA)
- Basis Conversations 1500(Hugging Face 博客)
- QVAC Genesis III(Hugging Face 博客)
- Ai2 与 Global Fishing Watch(Skylight)
- Google.org 与盖茨基金会(blog.google)
- 盖茨基金会新闻稿
- 如何为人工智能驱动的代码现代化项目做准备(Anthropic)
- @bcherny:在 Lean 中对 Claude Agent SDK 进行形式化验证
- Codex CLI 0.156.1
- Airbnb 与 GPT-6 Astra(OpenAI)
- OpenAI Academy 两周年
- 让我的 LED 显示屏活起来(OpenAI Developers)
- MedGemma 与全球健康(Google)
- Google Docs 中的 Gemini Notebook(Workspace 更新)
- 六款 Google Flow 工具(Google Labs)
- Google Beam 扩展至六个国家(Google)
- Android Enterprise 2026 新功能(Google)
- AI Brief 与 AI Max(Google Ads)
- Gemini CLI v0.62.0-nightly.20260923
- 十项优化中有三项毫无效果(EcoHash)
- 克里米亚鞑靼语语音识别(Hugging Face 博客)
- 在 Mac 上微调 Falcon-H1(Hugging Face 博客)
- 通往开源地狱的路由善意铺就(Hugging Face 博客)
- 仪表板显示“通过”。究竟通过了什么?(Phionyx)
- Kimi Work 版本说明
- @arena:Qwen-Image-2.1 成为排名第一的开放模型
- GitHub Copilot 应用中的 OpenTelemetry
- Copilot CLI 中的 C++ 代码智能功能
- 在 GitHub Copilot 应用中呈现大型拉取请求
- @genspark_ai:Genspark 中的 Claude Opus 5.5
- GitHub 与耶鲁大学关于软件开发效率的研究
- Zed 1.21.0
- @warpdotdev:Warp 中的 GPT-6 Sol 和 Luna
- Devin、Microsoft Teams 与 Microsoft 365
- @ElevenLabs:Scribe v2 Medical
- ElevenLabs 9 月 23 日更新日志
- @cohere:加拿大的 Model Vault
- 人工智能变革管理(Cohere)