跳到主内容

AI 编程周报 2026-09-17:Claude Code 给插件装上评测门禁、Devin Fusion 双模型降到 36% 成本、Anthropic 把中小企业做成 43 条工作流

2026-09-17 · Claude Code 更新日志(Releasebot)/ Cognition 官方博客 / Artificial Analysis / Unite.AI / 腾讯研究院 AI 速递

要点

工具与平台

  • 09-11 Claude Code v2.1.269 引入 claude plugin eval:把插件 / 技能跑在一组真实 prompt 上打分,默认每条用例跑 3 次带插件 + 3 次不带插件,用 Δ(带插件得分 − 不带插件得分) 衡量插件的真实贡献。
  • 09-11 Cognition 把 Devin Fusion 从云端下放到 Devin Desktop 与 Devin CLI:前沿模型做 lead(规划、歧义判断、审查),低成本模型做 sidekick(探索、实现、跑测试),官方推荐 Fable 5.1 / GPT-6 Astra + SWE-2
  • 09-15 Anthropic 为 Claude for Small Business 新增 43 个预置工作流与 27 项集成(Shopify、Salesforce、TikTok、Atlassian、Zoom、Xero、Gusto、Square、Stripe、Zapier 等);该插件自 5 月上线累计安装 超过 90 万次
  • 09-15 Factory 宣布完成 2 亿美元融资,估值 50 亿美元。(专文解读
  • 09-15 Google 发布 Gemini 3.8 Live / Extended Thinking 实时语音模型。(专文解读
  • 09-15 字节跳动 CEO 梁汝波确认两个月前已将豆包、飞书、火山引擎整合,飞书 8.0 向 Agent 开放 767 个功能点。(专文解读

成本结构(本周主线)

  • Devin Fusion 的第三方实测:Artificial Analysis 编码 Agent 指数上 Fable 5.1 + SWE-2 得 61.7 分、每任务 7.90 美元;对照 Claude Code 跑 Fable 5.1 max 得 62.2 分、12.40 美元——分数几乎持平,成本降 36%。Astra + SWE-2 组合更便宜 43%、快 31%,但分数降到 59。
  • Gemini 3.8 Live:综合质量仅差 1.1 分,每小时成本差 40%(0.84 / 3.50 对 5.83 美元)。

待核实

  • 有报道称 OpenAI 产品负责人预告本周发布量达 DevDay 级别,部分用户反馈使用 GPT-5.6 Sol 时已被路由至 GPT-6 Sol,并称 GPT-5.5 将于 10 月 14 日起在 ChatGPT 与 Codex 下线以上均未获 OpenAI 官方确认。

背景与分析

一、claude plugin eval:AI 行为终于有了可测量的数字

这是本周最有工程价值的一条,也是容易被当成「又一个小命令」而忽略的一条。

过去团队写一个内部 skill 或插件,验证方式是:手写一段 SKILL.md → 手动试三四次 → 看到 Claude 调对了工具 → 发布。三周后有人反馈「这个 skill 好像不太触发了」,没人能说清它到底有没有稳定触发过,因为「稳定」从来没有一个数字。

claude plugin eval 的做法:

  • 用例放在插件目录下的 evals/,每条含 prompt.mdgraders/
  • 提供 6 种 grader——regextool_usedtool_orderfile_exists 四种从会话记录与文件直接判定(不花钱),llmbaseline 两种调用裁判模型(计费);
  • 默认双臂各跑 3 次,输出 WITH / W/OUT / Δ
  • claude plugin eval init 让 Claude 根据你的插件自动生成用例与判定标准;
  • CI 场景可用 --threshold--max-cost-usd--trust-plugin--no-publish--model / --judge-model 固定模型版本。

关键在 Δ 这个设计。 一条用例带插件得 1.00,不代表插件有用——如果不带插件也能得 1.00,Δ ≈ 0,说明这个插件是冗余的。官方点出的最常见首测结果就是:Δ 接近 0 且 tool_used: Skill 判定失败,意思是「用自然说法提问时,Claude 根本没选中你的技能」——这恰恰是 claude plugin validate 查不出来的问题,因为它只校验 manifest 语法与 schema,不校验行为。

这件事的意义超出插件本身:它把「AI 行为好不好」从主观感受变成了可以进 CI 门禁的数字。 门禁示例:

claude plugin eval . --trust-plugin --json results.json \
  --threshold 0.8 --model claude-sonnet-5 --judge-model claude-haiku-4-5 \
  --no-publish --max-cost-usd 20

同一版本还带来 CLAUDE_CODE_WORKFLOW_MAX_CONCURRENT_AGENTS(单次运行并发 Agent 上限 1 → 256)、/output-style 在云端与 headless 会话生效、VS Code 扩展的 agent map 与 Hooks 对话框。

二、双模型 harness:成本优化从「选便宜模型」移到「编排层」

Devin Fusion 与上周的几条消息是同一个趋势的不同切面。它的机制值得细看:

角色模型职责
leadFable 5.1 / GPT-6 Astra制定计划、解释歧义、最终审查,可随时收回任务
sidekickSWE-2(Cognition 推荐)探索代码、实现改动、跑测试、回报结果

两个 Agent 各自持有独立的持久化上下文,之间只交换任务简报、结果、反馈三样东西,而不是完整对话历史。Cognition 给的理由很实在:在单个会话中途切换模型会打断 prompt 缓存——这正是很多模型路由方案失败的原因。

第三方实测(Artificial Analysis)比官方口径更值得看:

配置指数得分每任务成本对比
Claude Code + Fable 5.1 max62.212.40 美元基线
Devin Fusion(Fable 5.1 + SWE-2)61.77.90 美元−36%
Devin Fusion(Astra + SWE-2)59成本低 43%、快 31%

用 0.5 分的差距换 36% 的成本,在多数业务场景里是划算的。 但要冷静看三点:一是这些数字跑在精选任务集上,生产环境的模糊需求与半坏测试集会显著削弱路由准确率;二是 Astra 组合虽便宜 43%,分数掉了 3 分;三是 Fusion 仅限付费计划(CLI 3000.10.20+ / Desktop 3.10.0+),且配对中的两个模型分别按各自费率计费

同期 Factory 的 Factory Router 宣称任务级路由省 60% 以上 token(官方口径)——两家从不同方向给出了同一个答案:把「用哪个模型」从一个全局设置,变成一个按任务决定的运行时决策。

三、Anthropic 的 43 条工作流:模型竞争已经打到「开箱即用」层

Claude for Small Business 这次更新的信号不在数量,在形态:

  • 只选任务,不写提示词。 每周简报(现金状况、销售对比、管线进展、逾期发票)、线索智能响应、智能提案生成、营销内容引擎、月末对账与结账——五大场景全部预置。
  • 默认「人工审批」模式。 Claude 先起草并暂存,等 owner 确认后才真正发送、发布或付款;可以逐条放开自动运行,也能随时收回。
  • 权限继承。 员工在 QuickBooks 或 Google Drive 里看不到的东西,通过 Claude 也看不到。

这套设计把「中小企业主不会写提示词」当成既定前提,而不是待教育的问题。 90 万次安装与「约三分之一企业主希望 AI 帮他们增长业务」的反馈,说明这条路走对了。

把它和本周另外两条放在一起看会很清楚:Devin 在优化企业的单位任务成本,Anthropic 在优化非技术用户的上手成本,Factory 在优化可度量性——三家打的是同一场仗的不同侧面:把 AI 从「能力」变成「可采购的交付物」。

对开发者的影响

  • 有内部 skill / 插件的团队,本周就把 claude plugin eval 接进 CI。 先跑 claude plugin eval init 生成用例,重点看 Δ——Δ ≈ 0 且 tool_used: Skill 失败的,优先改 skill 描述,而不是改实现。CI 里务必固定 --model--judge-model,否则上游静默升级会让分数漂移,被误读成插件回归。
  • 别只看 WITH 分数。 双臂对比是这套工具的核心价值,只跑带插件那一臂等于白跑
  • 评估双模型编排时,先定义「哪些任务可以外包给便宜模型」。 Devin Fusion 的效果取决于路由准确率,在你自己的任务分布上验证,比看厂商基准更有意义。参见 Devin
  • 成本对比请按「每任务」而不是「每 token」。 本周三条消息全在用每任务成本说话——榜单分差已经小到不足以构成采购理由
  • 模型静默升级仍在发生(待核实 GPT-6 Sol 路由)。 用 Model ID 而非模型名对接的,实际跑的可能已经换了。把关键路径的回归评测固化成定时任务,别等 changelog。参见 Claude CodeCodex CLI
  • 中小企业场景的集成清单值得抄作业。 如果你在做面向非技术用户的 AI 产品,「默认人工审批 + 权限继承 + 预置任务」这三条组合是被 90 万次安装验证过的设计。

AI 之家 观点

  1. 本周真正的分水岭是「可度量性」。 claude plugin eval 的 Δ、Devin Fusion 的每任务 7.90 美元、Factory 的 Agent Effectiveness,指向同一件事:AI 正在从「我们相信它有用」走向「我们能证明它值多少钱」。 这一步跨过去,AI 才真正进入企业采购的正规流程。
  2. Δ 这个设计比它看起来更重要。 它把「这个 skill 有没有用」从风格问题变成了统计问题。我们预计未来一年,Agent 生态会出现类似单元测试的「贡献度回归」文化——没有 Δ 的 skill 将不再被信任。
  3. 双模型编排会从「Cognition 的特性」变成行业默认。 前沿模型做判断、便宜模型做执行,这个分工在成本结构上太占优了。接下来的竞争点不是谁支持双模型,而是谁的路由更准——路由准确率会成为新的核心指标。
  4. 「榜单分差小、成本差 40%」正在成为 2026 下半年的标准形态。 这意味着采购决策的主导权会从技术团队转向财务团队。对工具厂商是坏消息(溢价空间被压缩),对使用者是好消息。
  5. 对国内团队:别追「双模型 harness」这个词,先追「每任务成本」这个数。 国产工具在气隙与信创上有优势,缺的恰恰是把 AI 花销换算成业务价值的度量层。先把单位任务成本测出来,再谈优化。

相关阅读

来源

待核实:GPT-6 Sol 灰度、GPT-5.5 于 10-14 下线均为媒体转述的用户反馈与预告,OpenAI 官方尚未确认;Devin Fusion 的 36% / 43% 成本降幅来自 Artificial Analysis 与厂商合作的评测,任务集与对照配置由 Cognition 选定;Factory Router 省 60% token 为官方口径。本资讯由 AI 之家 编辑部整理,非厂商付费内容。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Augment Code vs Cursor:企业 AI 编程怎么选?Context Engine vs AI IDE 对比

Augment Code vs Cursor 2026 选型对比:Context Engine 全仓索引的企业 AI 平台 vs SpaceX 收购的 AI IDE 天花板,从形态、Context 覆盖、长任务、价格、合规、中文支持和适合人群 8 个维度判断,帮你选对企业 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

相关评测