AI 编程周报 2026-09-17:Claude Code 给插件装上评测门禁、Devin Fusion 双模型降到 36% 成本、Anthropic 把中小企业做成 43 条工作流
2026-09-17 · Claude Code 更新日志(Releasebot)/ Cognition 官方博客 / Artificial Analysis / Unite.AI / 腾讯研究院 AI 速递
要点
工具与平台
- 09-11 Claude Code v2.1.269 引入
claude plugin eval:把插件 / 技能跑在一组真实 prompt 上打分,默认每条用例跑 3 次带插件 + 3 次不带插件,用 Δ(带插件得分 − 不带插件得分) 衡量插件的真实贡献。 - 09-11 Cognition 把 Devin Fusion 从云端下放到 Devin Desktop 与 Devin CLI:前沿模型做 lead(规划、歧义判断、审查),低成本模型做 sidekick(探索、实现、跑测试),官方推荐 Fable 5.1 / GPT-6 Astra + SWE-2。
- 09-15 Anthropic 为 Claude for Small Business 新增 43 个预置工作流与 27 项集成(Shopify、Salesforce、TikTok、Atlassian、Zoom、Xero、Gusto、Square、Stripe、Zapier 等);该插件自 5 月上线累计安装 超过 90 万次。
- 09-15 Factory 宣布完成 2 亿美元融资,估值 50 亿美元。(专文解读)
- 09-15 Google 发布 Gemini 3.8 Live / Extended Thinking 实时语音模型。(专文解读)
- 09-15 字节跳动 CEO 梁汝波确认两个月前已将豆包、飞书、火山引擎整合,飞书 8.0 向 Agent 开放 767 个功能点。(专文解读)
成本结构(本周主线)
- Devin Fusion 的第三方实测:Artificial Analysis 编码 Agent 指数上 Fable 5.1 + SWE-2 得 61.7 分、每任务 7.90 美元;对照 Claude Code 跑 Fable 5.1 max 得 62.2 分、12.40 美元——分数几乎持平,成本降 36%。Astra + SWE-2 组合更便宜 43%、快 31%,但分数降到 59。
- Gemini 3.8 Live:综合质量仅差 1.1 分,每小时成本差 40%(0.84 / 3.50 对 5.83 美元)。
待核实
- 有报道称 OpenAI 产品负责人预告本周发布量达 DevDay 级别,部分用户反馈使用 GPT-5.6 Sol 时已被路由至 GPT-6 Sol,并称 GPT-5.5 将于 10 月 14 日起在 ChatGPT 与 Codex 下线。以上均未获 OpenAI 官方确认。
背景与分析
一、claude plugin eval:AI 行为终于有了可测量的数字
这是本周最有工程价值的一条,也是容易被当成「又一个小命令」而忽略的一条。
过去团队写一个内部 skill 或插件,验证方式是:手写一段 SKILL.md → 手动试三四次 → 看到 Claude 调对了工具 → 发布。三周后有人反馈「这个 skill 好像不太触发了」,没人能说清它到底有没有稳定触发过,因为「稳定」从来没有一个数字。
claude plugin eval 的做法:
- 用例放在插件目录下的
evals/,每条含prompt.md与graders/; - 提供 6 种 grader——
regex、tool_used、tool_order、file_exists四种从会话记录与文件直接判定(不花钱),llm、baseline两种调用裁判模型(计费); - 默认双臂各跑 3 次,输出 WITH / W/OUT / Δ;
claude plugin eval init让 Claude 根据你的插件自动生成用例与判定标准;- CI 场景可用
--threshold、--max-cost-usd、--trust-plugin、--no-publish与--model/--judge-model固定模型版本。
关键在 Δ 这个设计。 一条用例带插件得 1.00,不代表插件有用——如果不带插件也能得 1.00,Δ ≈ 0,说明这个插件是冗余的。官方点出的最常见首测结果就是:Δ 接近 0 且 tool_used: Skill 判定失败,意思是「用自然说法提问时,Claude 根本没选中你的技能」——这恰恰是 claude plugin validate 查不出来的问题,因为它只校验 manifest 语法与 schema,不校验行为。
这件事的意义超出插件本身:它把「AI 行为好不好」从主观感受变成了可以进 CI 门禁的数字。 门禁示例:
claude plugin eval . --trust-plugin --json results.json \
--threshold 0.8 --model claude-sonnet-5 --judge-model claude-haiku-4-5 \
--no-publish --max-cost-usd 20
同一版本还带来 CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS(单次运行并发 Agent 上限 1 → 256)、/output-style 在云端与 headless 会话生效、VS Code 扩展的 agent map 与 Hooks 对话框。
二、双模型 harness:成本优化从「选便宜模型」移到「编排层」
Devin Fusion 与上周的几条消息是同一个趋势的不同切面。它的机制值得细看:
| 角色 | 模型 | 职责 |
|---|---|---|
| lead | Fable 5.1 / GPT-6 Astra | 制定计划、解释歧义、最终审查,可随时收回任务 |
| sidekick | SWE-2(Cognition 推荐) | 探索代码、实现改动、跑测试、回报结果 |
两个 Agent 各自持有独立的持久化上下文,之间只交换任务简报、结果、反馈三样东西,而不是完整对话历史。Cognition 给的理由很实在:在单个会话中途切换模型会打断 prompt 缓存——这正是很多模型路由方案失败的原因。
第三方实测(Artificial Analysis)比官方口径更值得看:
| 配置 | 指数得分 | 每任务成本 | 对比 |
|---|---|---|---|
| Claude Code + Fable 5.1 max | 62.2 | 12.40 美元 | 基线 |
| Devin Fusion(Fable 5.1 + SWE-2) | 61.7 | 7.90 美元 | −36% |
| Devin Fusion(Astra + SWE-2) | 59 | — | 成本低 43%、快 31% |
用 0.5 分的差距换 36% 的成本,在多数业务场景里是划算的。 但要冷静看三点:一是这些数字跑在精选任务集上,生产环境的模糊需求与半坏测试集会显著削弱路由准确率;二是 Astra 组合虽便宜 43%,分数掉了 3 分;三是 Fusion 仅限付费计划(CLI 3000.10.20+ / Desktop 3.10.0+),且配对中的两个模型分别按各自费率计费。
同期 Factory 的 Factory Router 宣称任务级路由省 60% 以上 token(官方口径)——两家从不同方向给出了同一个答案:把「用哪个模型」从一个全局设置,变成一个按任务决定的运行时决策。
三、Anthropic 的 43 条工作流:模型竞争已经打到「开箱即用」层
Claude for Small Business 这次更新的信号不在数量,在形态:
- 只选任务,不写提示词。 每周简报(现金状况、销售对比、管线进展、逾期发票)、线索智能响应、智能提案生成、营销内容引擎、月末对账与结账——五大场景全部预置。
- 默认「人工审批」模式。 Claude 先起草并暂存,等 owner 确认后才真正发送、发布或付款;可以逐条放开自动运行,也能随时收回。
- 权限继承。 员工在 QuickBooks 或 Google Drive 里看不到的东西,通过 Claude 也看不到。
这套设计把「中小企业主不会写提示词」当成既定前提,而不是待教育的问题。 90 万次安装与「约三分之一企业主希望 AI 帮他们增长业务」的反馈,说明这条路走对了。
把它和本周另外两条放在一起看会很清楚:Devin 在优化企业的单位任务成本,Anthropic 在优化非技术用户的上手成本,Factory 在优化可度量性——三家打的是同一场仗的不同侧面:把 AI 从「能力」变成「可采购的交付物」。
对开发者的影响
- 有内部 skill / 插件的团队,本周就把
claude plugin eval接进 CI。 先跑claude plugin eval init生成用例,重点看 Δ——Δ ≈ 0 且tool_used: Skill失败的,优先改 skill 描述,而不是改实现。CI 里务必固定--model与--judge-model,否则上游静默升级会让分数漂移,被误读成插件回归。 - 别只看 WITH 分数。 双臂对比是这套工具的核心价值,只跑带插件那一臂等于白跑。
- 评估双模型编排时,先定义「哪些任务可以外包给便宜模型」。 Devin Fusion 的效果取决于路由准确率,在你自己的任务分布上验证,比看厂商基准更有意义。参见 Devin。
- 成本对比请按「每任务」而不是「每 token」。 本周三条消息全在用每任务成本说话——榜单分差已经小到不足以构成采购理由。
- 模型静默升级仍在发生(待核实 GPT-6 Sol 路由)。 用 Model ID 而非模型名对接的,实际跑的可能已经换了。把关键路径的回归评测固化成定时任务,别等 changelog。参见 Claude Code 与 Codex CLI。
- 中小企业场景的集成清单值得抄作业。 如果你在做面向非技术用户的 AI 产品,「默认人工审批 + 权限继承 + 预置任务」这三条组合是被 90 万次安装验证过的设计。
AI 之家 观点
- 本周真正的分水岭是「可度量性」。
claude plugin eval的 Δ、Devin Fusion 的每任务 7.90 美元、Factory 的 Agent Effectiveness,指向同一件事:AI 正在从「我们相信它有用」走向「我们能证明它值多少钱」。 这一步跨过去,AI 才真正进入企业采购的正规流程。 - Δ 这个设计比它看起来更重要。 它把「这个 skill 有没有用」从风格问题变成了统计问题。我们预计未来一年,Agent 生态会出现类似单元测试的「贡献度回归」文化——没有 Δ 的 skill 将不再被信任。
- 双模型编排会从「Cognition 的特性」变成行业默认。 前沿模型做判断、便宜模型做执行,这个分工在成本结构上太占优了。接下来的竞争点不是谁支持双模型,而是谁的路由更准——路由准确率会成为新的核心指标。
- 「榜单分差小、成本差 40%」正在成为 2026 下半年的标准形态。 这意味着采购决策的主导权会从技术团队转向财务团队。对工具厂商是坏消息(溢价空间被压缩),对使用者是好消息。
- 对国内团队:别追「双模型 harness」这个词,先追「每任务成本」这个数。 国产工具在气隙与信创上有优势,缺的恰恰是把 AI 花销换算成业务价值的度量层。先把单位任务成本测出来,再谈优化。
相关阅读
- 本期专题:Factory 融资 2 亿美元估值 50 亿 · Gemini 3.8 Live 发布 · 字节整合豆包/飞书/火山引擎 · TypeSafe AI Jev 决策模型
- 工具卡:Claude Code · Devin · Factory · Cursor · Codex CLI · Cline
- 概念:Agentic Coding · MCP · 上下文工程 · BYOK
- 模型卡:Claude Fable 5.1 · GPT-6 Astra · Gemini 3.8 Live · GLM-5.3
- 往期周报:AI 编程周报 2026-09-16 · AI 编程周报 2026-09-15 · AI 编程周报 2026-09-14
来源
- Claude Code Updates & Release Notes(Week 37 · September 7–11, 2026) — Releasebot
- Claude Code 2.1.269 Ships Plugin Evaluation Command and Expands Workflow Controls — How to Claude
- Claude Code plugin eval: gate skills on delta before you merge — DEV Community
- Anthropic Adds Plugin Evals to Claude Code: 6 Grader Types, a No-Plugin Baseline, and a CI Gate for Skills — Web AI News
- Devin Fusion: Cognition 的双模型 harness — AI Primer
- Devin Fusion Comes to Desktop and CLI — Yet Another Changelog
- Anthropic Adds 43 Workflows, 27 Integrations to Claude for Small Business — Unite.AI
- Claude 发布重大升级:43 项全能工作流与 27 个巨头应用深度打通 — 站长之家
- 腾讯研究院 AI 速递 20260917 — 搜狐
待核实:GPT-6 Sol 灰度、GPT-5.5 于 10-14 下线均为媒体转述的用户反馈与预告,OpenAI 官方尚未确认;Devin Fusion 的 36% / 43% 成本降幅来自 Artificial Analysis 与厂商合作的评测,任务集与对照配置由 Cognition 选定;Factory Router 省 60% token 为官方口径。本资讯由 AI 之家 编辑部整理,非厂商付费内容。