跳到主内容

Anthropic 自曝家底:Claude 已主导公司 26% 的 AI 研发,3 万个 Agent 同时在线

2026-09-20 · Anthropic 官方报告 / 彭博社 / Channel NewsAsia / 中新经纬 / AI Briefing

要点

  • 2026-09-18,Anthropic 发布一份关于「递归自我改进(Recursive Self-Improvement,RSI)」的透明度报告,首次系统性公开「AI 参与自家研发」的量化指标。
  • Claude 已主导公司 26% 的 AI 研发工作(截至 2026 年 8 月)——所谓「主导」,指 Claude 能在人类监督下从头到尾完成大部分任务;而在今年年初,这个比例还接近于零。
  • Claude 与员工协作完成的研究任务超过 90%
  • 任意时点有 3 万多个 Agent 在进行研究或工程工作——Anthropic 同时在搭建一套框架来跟踪这些 Agent 在平台上完成的工作量。
  • 6% 至 12% 的计算资源用于安全监控,具体比例取决于研究类型。
  • Anthropic 重申将引入多个第三方评估组织并授予后台访问权限,理由是「人工智能系统正指数级增强并开始自我进化,随着全球考虑放缓前沿人工智能的发展步伐,公众需要了解更多信息」。
  • Anthropic 明确说明:Claude 尚不能完全自主运行,「模型加速自身研发可能让人类更难理解和控制这些系统」,因此分享这些指标是为了让外界看清距离「模型完全自主构建其继任者」还有多远

背景与分析

一、这份报告的真正主角是「指标」,不是「26%」

单看 26% 这个数字容易滑向两个极端解读——「AI 已经接管研发」或「不过是营销话术」。更值得关注的其实是 Anthropic 把什么做成了可持续追踪的指标

指标数值(2026-08)量的是什么
Claude 主导的研发占比26%端到端完成度(人类仅监督)
协作参与的研究任务>90%渗透广度
在线研发 Agent 数3 万+自动化规模
安全监控算力占比6%-12%治理成本

这是一套可重复测量、可被外部核对的口径,而不是一次性声明。Amodei 上周刚提出「给前沿定速」,一周后自家就交出量化底账——节奏上是在为「第三方常驻检查」的提案铺路:先让公众习惯看数字,再谈让外部机构进后台。

二、发布时机:安全辩论最激烈的一周

把这条放在最近两周的时间线里看,指向性非常明显:

时间事件
09-12Amodei 发文呼吁「协同放缓」,Altman、Musk 表态支持
09-16OpenAI 发布失准披露框架与 6 起案例
09-17三大实验室被曝筹建 FINRA 式自律机构
09-18Anthropic 公布 RSI 指标 + 承诺第三方评估准入

Anthropic 是这轮安全叙事里最激进的呼吁者,也是唯一交出量化自查数据的实验室。对它来说这几乎是最优策略:既推动了「公众需要更多信息」的议程,又把「透明」做成了自家的品牌资产——而 Anthropic 预计年内启动的 IPO,恰好需要一个这样的叙事。

三、对「AI 造 AI」的工程含义

3 万个在线 Agent、26% 主导占比,这些数字对工程团队的参考价值可能高于对监管的价值:

  • AI 参与研发的形态是「协作面全渗透、主导面仍有限」——90% 的协作意味着它已经嵌进几乎所有环节,但端到端独立扛任务的只有四分之一。
  • 治理成本是有量级的:6%-12% 的算力花在监控上。这给所有做 Agent 平台的团队一个参照——你的 Agent 预算里,安全与可观测性占多少? 低于个位数大概率是不够的。

对开发者的影响

  • 把「AI 占研发多少」纳入团队度量。 Anthropic 给出了可抄的指标定义:主导占比(端到端)、协作渗透率、在线 Agent 数。多数团队连第一项都没有度量,而这恰恰是判断「AI 是助手还是主力」的唯一硬指标。
  • 监控算力按 6%-12% 做预算参照。 无论是自建 Agent 平台还是用托管方案(参见 OpenAI Agents API),可观测性与安全监控的投入比例应该显性化,而不是事后补。
  • 第三方评估会变成供应链问题。 Anthropic 承诺向第三方评估组织开放后台访问——如果你重度依赖 Claude Code(参见 Claude Code),评估结论将直接影响你的模型选型风险表,关注哪些机构拿到权限。
  • 别把 RSI 当远期科幻。 Anthropic 自己都在为「模型构建继任者」设置可追踪指标了,「Agent 写代码、人做监督」已经是现在时——Codex CLI(参见 Codex CLI)与 Claude Code 的日常用法已经长成这样。

AI 之家 观点

  1. 这份报告最重要的价值是「把 RSI 从形容词变成了仪表盘」。 26%、90%、3 万、6-12% 四个数一摆,「AI 造 AI」就从口号变成了可审计的账本。谁先建立可信的度量口径,谁在这场安全辩论里就有话语权。
  2. 透明度正在成为差异化竞争武器。 OpenAI 披露失准案例、Anthropic 公开 RSI 指标、Google 被动披露入侵事件——三家的「披露姿势」不同,但方向一致:安全叙事已经是前沿实验室的必答题。Anthropic 抢答最积极,这与它年内 IPO 的时间表高度吻合。
  3. 对 26% 要保持冷静。 「主导」的定义是「人类监督下完成大部分任务」,这个口径下的 26% 与「AI 自主研发」之间还有相当距离——报告自己都说了 Claude 还不能完全自主。真正需要盯的是这条曲线的斜率,而不是当前点位。
  4. 对国内团队的启示:先补度量,再谈治理。 国内团队用 Agent 的比例不低,但几乎没人能量化「AI 主导了多少产出」。从「本周合并的 PR 里有多少由 Agent 端到端完成」这个最粗糙的口径开始记,一个月后你就有自己的 26% 曲线。

相关阅读

来源

待核实:「26% 主导」的准确定义与测量方法以 Anthropic 原始报告为准,本文数字为彭博社/AFP 转述口径;「年初接近零」为 AI Briefing 引述的 3 月数据点;第三方评估组织的名单与准入时间表尚未公布。本资讯由 AI 之家 编辑部基于公开报道整理,非厂商付费内容。

相关对比

Aider vs Claude Code:终端 AI 编程双雄怎么选

Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。

Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比

Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。

Claude Code vs Codex CLI:终端 AI Agent 双雄对比

Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。

Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)

Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。

Claude Code vs Gemini CLI:终端 AI Agent 怎么选?(2026 选型指南)

Claude Code 和 Gemini CLI 都是终端原生的 AI 编码 Agent。一句话结论 + 决策树 + 价格 + 国内可用性对比:长任务与 CLAUDE.md 生态选前者,免费额度与接入门槛选后者。

Codex CLI vs Crush:OpenAI 官方 vs 多模型 TUI(2026 实测选型)

Codex CLI vs Crush 2026 选型对比:OpenAI 官方终端 Coding Agent(GPT-5.6 + Windows 原生沙箱 + Apache-2.0)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、平台、生态、价格、国内可用性帮你选对终端 AI 编程工具。

相关评测