ai-powered-markdown-translator使用 gpt-5.6-sol 将文章从法语翻译成中文。
周六和周日,各家实验室都悄无声息:DeepSeek、Meta、Ai2、Sakana、Mistral 和 xAI 均未发布任何内容,开放模型领域的官方账号也连续两天空空如也。真正的新发布只有一个:周日下午时段以开放权重发布的 Qwen-Image-2.1。其余内容主要是 Hugging Face 社区博客的五篇文章、一个没有修复任何问题的 Antigravity 版本,以及补记的两条 9 月 18 日 GitHub 更新日志——这是平静的一天,没有任何夸大它的理由。
Qwen-Image-2.1:一个模型同时实现生成、编辑与透明输出
9 月 20 日——Qwen 在 Hugging Face、ModelScope 和 GitHub 上以开放权重发布了图像生成与编辑模型 Qwen-Image-2.1。它的卖点不在规模,而在统一:同一套权重既能根据文本指令创作图像,也能修改已有图像,而过去这两种用途需要两个模型。
最具体的新功能是原生透明度:模型能够直接生成和修改 RGBA 图层,并由指令决定输出是否包含透明通道。自 2025 年 12 月起,Qwen 一直通过专用模型 Qwen-Image-Layered 提供这一能力,如今该模型已被整合。由此可省去一个抠图步骤:既可从照片中提取主体并制成可复用图层,也可替换透明图层中的文字。
在编辑方面,该模型的一幅合成图最多可接收 10 张参考图像;需要修改的区域可通过彩色圆圈、涂绘标注或单独提供的蒙版指定——之所以提供第三种方式,是因为前两种会遮盖原始内容。其效率来自混合粒度注意力机制:编辑输入构成静态上下文,并从第一步起进入缓存。
| 技术项目 | 公布的数值 |
|---|---|
| 视觉生成参数 | 70 亿,采用 32 层 Single-Stream DiT |
| 可接收的参考图像 | 最多 10 张 |
| 输出透明度 | 生成与编辑均原生支持 RGBA 图层 |
| 被整合的专用模型 | Qwen-Image-Layered,发布于 2025 年 12 月 |
| 首日支持 | vLLM-Omni 和 ComfyUI |
Qwen 发布了 Qwen-Image-Bench 上的对比结果,但具体数值仅出现在博文的一张图片中,因此这里不再转录。
Generate, edit, and create transparent images with one model: a 7.1B DiT paired with Qwen3-VL-8B.
🇨🇳 使用单个模型生成、编辑和创建透明图像:一个 71 亿参数的 DiT 与 Qwen3-VL-8B 相结合。 — @vllm_project 在 X 上
🔗 公告
Qwen Code v0.24.2:Web Shell 完整语音功能与不断完善的 bwrap 沙箱
同一家发布方,同一天,却是毫不相关的产品。9 月 20 日——命令行代码智能体 Qwen Code 的 v0.24.2 在 v0.24.1 发布仅略超二十四小时后推出;这是该系列首个完全没有破坏性变更的版本,而此前两个版本各自都有一项。
bubblewrap 沙箱获得了完整的执行基础设施:结构化进程启动、监控以及受限的 worker。同样在安全方面,信任状态尚未确定的工作区现在要求用户明确作出决定。Web Shell 则让 Live Voice 功能真正可用:可从配置卡片中选择模型和语音,并在通话期间显示麦克风音量。对于并行运行多个会话的用户,现在每条传入消息都会针对其目标会话进行评估,延迟工具的 prompt 缓存也得以保留。
🔗 版本说明
无需生成一个 token 即可验证回答,以及作者兼任裁判的排行榜
9 月 20 日——同一天,两篇文章采用同一个包含 2,018 个项目的数据集。第一篇介绍 Zero-Token Confidence:探针通过一次前向传播读取模型最后的隐藏状态,并从中得出校准后的概率,全程无需生成一个 token。询问模型是否确定,其曲线下面积为 0.5000,相当于随机猜测;读取内部状态则达到 0.8801,耗时 0.0615 秒,而生成回答需要 1.631 秒。第二篇用同一数据集测试了十三个验证器:只有三个超过 0.70,ZTC 领先 JEV 0.0014,但这一差距无法区分二者。
最确凿的事实却在别处:一个只观察回答长度和格式、完全不查看内容的基线达到了 0.7036,击败十三个系统中的八个。需要保留意见的是,排行榜作者并非中立第三方——他表示还测量了自己的系统,却没有说明十三个系统中哪一个属于他,而且两篇文章在同一天发布。数字可能准确,但排行榜的独立性尚未得到证实。
一个价值 54 美元、既修复问题又造成破坏的 LoRA
9 月 20 日——ScalablyAI 使用其智能体平台留下的 143,145 个工具使用片段,在 Qwen3.8-27B 上训练了两个 LoRA 适配器,成本为 53.88 美元,随后使用在第一步训练前就已冻结的测试套件对其进行评估。
结果具有两面性。在工具调用遭拒后的 73 个恢复状态中,适配器的成功次数从 31 次上升到 38 次,有七个案例转为对它有利,没有任何案例出现反向变化。但在 73 个正常轨迹决策中,成功次数从 49 次下降至 45 次,降幅为 5.5 个百分点,超过预设的 2 个百分点上限。由于卸载适配器是一个原子操作,要避免退步就必须同时放弃收益,因此两个适配器均遭弃用。最终采用的架构也由此而来——一边是 433 条可编辑的记忆规则,另一边则保持权重不变。
If every useful experience immediately changes the weights, learning and corruption can become the same operation, and at production sample sizes you cannot tell which one you performed.
🇨🇳 如果每次有用的经验都会立即修改权重,那么学习和破坏可能会变成同一种操作;以生产环境拥有的样本量,你无法知道自己刚刚完成的究竟是哪一种。 — Hugging Face 博客上的 pavle-scalably
SeamFlow 把 UV 接缝放到艺术家会选择的位置
9 月 20 日——将 3D 表面展开为 2D 必然要进行切割;优秀的展开方式会把这些接缝放在最不显眼的位置。由 Meshy AI 联合 City University of Hong Kong、Bambu Lab 和 Nanyang Technological University 推出的 SeamFlow,在模型处理前改变了表示方式:网格的每条边都成为一个 token,二元标签则被松弛为连续值,从而可以应用流匹配(flow matching)。
这种方法具有结构性优势:无需投影步骤,也不存在任意的 token 顺序,每条预测切线都会落在已有边上。模型使用 350,000 个由专业人员制作接缝的 Objaverse 网格进行训练,会将切线置于褶皱处:接缝沿线的平均二面角达到 67.59 度,相比之下,xatlas 为 56.65 度,PartUV 为 55.97 度。其展开耗时为 5.63 秒,而自回归基线需要 11.46 秒;在首选结果中,它以 61.0% 的比例胜出,排名次席的方法仅为 19.1%。
🔗 SeamFlow
Antigravity 2.15.1 在 Windows 上开放沙箱,但并未启用
9 月 19 日——Antigravity 2.15.1 的内容可以用一句话概括:文件和网络沙箱登陆 Windows。只有一项改进,没有任何修复;而前一天的 2.15.0 则包含七项改进和十六项修复——这是一次针对性新增,并非维护版本。
它与产品其他平台版本之间的差距才是真正的问题。在 Linux 上,沙箱依赖内核 namespace;在 macOS 上,它依赖 sandbox-exec 的 Seatbelt profile;两种情况下均默认启用。在 Windows 上,所用的底层机制没有文档说明,仍需通过“Enable Sandbox Mode (Preview)”复选框手动启用,而且提供的三个安全预设——Default、Full machine、Turbo mode——没有一个会启用它:勾选复选框后,预设会切换为 Custom。Google 表示会在后续版本中统一行为,但没有提供时间表。
简讯
- 五个标注器、同一条指令、五种不同回答——针对 100 个土耳其场景,以人工参考标注中的 9 个阳性样本为基准,五个机器标注器给出的阳性样本数量从 0 到 78 不等;尽管原始一致率达到 74.7% 至 86.3%,所有 Cohen’s kappa 仍仅介于 0.000 和 0.185 之间。作者声明自己正是被评估方案的设计者,并提醒说,设计者并不是判断自身方案可迁移性的中立裁判。🔗 来源
- 9 月 20 日的 Gemini CLI nightly 不包含任何变更——标签
v0.62.0-nightly.20260920.gcfbcaa8df指向与前一天相同的 commit,hash 后缀也相同,版本页面没有显示“What’s Changed”部分。stable 渠道(v0.60.0)和 preview 渠道(v0.61.0-preview.0)同样没有变化。🔗 来源 - 由 GitHub 一名法律从业者编写的 Copilot CLI 插件 Eyeball 已开源——该工具会在被分析条款的位置嵌入源文档截图,让分析内容及其证据可以并排查看。仓库
dvelton/eyeball采用 MIT 许可证公开,以 Python 编写,拥有 35 颗星,自 2026 年 4 月 5 日以来没有新的 commit。🔗 来源 - 自 9 月 18 日起提供仅限暂存的 npm token——“Read and write (stage only)”权限允许持续集成流水线通过
npm stage publish提交版本,但不能发布;正式上线需要维护者进行 2FA 审批。限制由 registry 端实施,即使 token 被配置为绕过 2FA 也不例外;npm 将于 2027 年 1 月取消这种直接发布方式。🔗 来源 - 同样自 9 月 18 日起,可通过 REST API 控制代码覆盖率规则——规则集选项“Restrict code coverage”可要求达到最低阈值,或限制 pull request 允许出现的覆盖率降幅;该选项现已在 API 中正式可用,因此也可纳入基础设施即代码。仅限 GitHub Enterprise Cloud 和 GitHub Team,不支持 GitHub Enterprise Server。🔗 来源
- Wan 展示其 Peel-Off Sticker 功能——Alibaba Wan 账号演示了 wan.video 的一个模块,它会把个人照片嵌入场景,并使用 Wan 3.0 制作动画。这并非一次产品发布:消息没有提供开放日期、价格或质量指标。🔗 来源
- Cohere 发布了四张来自蒙特利尔 ALL IN 大会的照片——9 月 19 日的消息提到 Aston Martin F1 和 Magnus Carlsen 与该公司共同出席。没有产品公告、数字或链接。🔗 来源
这意味着什么
周末唯一发布的模型采用开放权重,并且它做的是整合而非叠加。Qwen-Image-2.1 并不是简单地排在 Qwen-Image-Layered 旁边:它吸收了后者,把透明度集成到主模型中,从而让一个存在九个月的专用模型退出舞台。生成与编辑之间也发生了相同的整合,二者如今统一在一套权重之中。对于制作视觉内容的人而言,这意味着工作链更短——只需加载一个模型,就能直接得到可用的 RGBA 图层,无需抠图步骤——而且生态系统当天便已跟进,vLLM-Omni 和 ComfyUI 在发布之时就可投入使用。
周日发布的三篇文章从三个角度讲述了同一个问题:如何判断模型生成的内容是否可信,以及需要付出多大成本。Zero-Token Confidence 从成本角度作答——0.0615 秒对 1.631 秒,因为会生成 token 的验证器会与智能体争夺同一份预算。十三个验证器的排行榜则从测量角度作答,其结论令业界难堪:一个只读取回答长度和格式的基线,竟能击败十三个验证器中的八个。因此,要证明一个验证器确实理解了内容,门槛比多数系统所展示的更高——而作者承认还测试了自己的系统,这也意味着最好等待第三方复现。
ScalablyAI 的报告补上了另外两篇文章所缺少的维度:可逆性。一次成本为 54 美元的权重更新,在同一个产物中既带来了失败后恢复能力的可测提升,也可能损害正常决策;而在现有样本量下,生产环境无法明确区分二者。由于无法只卸载适配器的一半,最终只能全部弃用。其操作层面的结论——容易撤销的低成本知识应存放在文本文件中,权重只能在冻结测试套件的把关下变动——为“能够自我改进的 AI”叙事提供了有益的反面视角。
在工具方面,依托操作系统实现的隔离正在从可选项变成基础设施。Qwen Code 将 bubblewrap 变成内部执行基础,Antigravity 把沙箱带到 Windows,npm 则推出只能准备版本却无法发布的 token:三家厂商在三天之内,都把安全从口头表态推进为默认机制。但 Windows 的情况仍需保留意见:一个必须手动勾选、且三个预设均不会启用的沙箱,还算不上默认防护;在 Google 给出时间表之前,它与 macOS 和 Linux 之间的差距依然存在。
来源
- Alibaba Qwen 在 X 上发布 Qwen-Image-2.1 公告
- Qwen 的 Qwen-Image-2.1 博文
- Hugging Face 上的 Qwen-Image-2.1
- vLLM 在 X 上宣布首日支持
- Qwen Code v0.24.2 版本说明
- Zero-Token Confidence
- 十三个回答验证器共测同一测试集
- ScalablyAI:快速记忆与缓慢权重
- ScalablyAI 证据登记簿
- SeamFlow:通过流匹配实现 UV 展开
- SeamFlow 项目页面
- Antigravity 更新日志
- Antigravity 沙箱文档
- 五个 LLM 标注器之间的一致性
- Gemini CLI 9 月 20 日 nightly
- GitHub 在 X 上宣布 Eyeball 开源
- GitHub:仅限暂存的 npm token
- GitHub:通过 REST API 管理代码覆盖率规则
- Alibaba Wan 在 X 上展示 Peel-Off Sticker
- Cohere 在 X 上发布 ALL IN 大会消息