Anthropic 自曝家底:Claude 已主导公司 26% 的 AI 研发,3 万个 Agent 同时在线
2026-09-20 · Anthropic 官方报告 / 彭博社 / Channel NewsAsia / 中新经纬 / AI Briefing
要点
- 2026-09-18,Anthropic 发布一份关于「递归自我改进(Recursive Self-Improvement,RSI)」的透明度报告,首次系统性公开「AI 参与自家研发」的量化指标。
- Claude 已主导公司 26% 的 AI 研发工作(截至 2026 年 8 月)——所谓「主导」,指 Claude 能在人类监督下从头到尾完成大部分任务;而在今年年初,这个比例还接近于零。
- Claude 与员工协作完成的研究任务超过 90%。
- 任意时点有 3 万多个 Agent 在进行研究或工程工作——Anthropic 同时在搭建一套框架来跟踪这些 Agent 在平台上完成的工作量。
- 6% 至 12% 的计算资源用于安全监控,具体比例取决于研究类型。
- Anthropic 重申将引入多个第三方评估组织并授予后台访问权限,理由是「人工智能系统正指数级增强并开始自我进化,随着全球考虑放缓前沿人工智能的发展步伐,公众需要了解更多信息」。
- Anthropic 明确说明:Claude 尚不能完全自主运行,「模型加速自身研发可能让人类更难理解和控制这些系统」,因此分享这些指标是为了让外界看清距离「模型完全自主构建其继任者」还有多远。
背景与分析
一、这份报告的真正主角是「指标」,不是「26%」
单看 26% 这个数字容易滑向两个极端解读——「AI 已经接管研发」或「不过是营销话术」。更值得关注的其实是 Anthropic 把什么做成了可持续追踪的指标:
| 指标 | 数值(2026-08) | 量的是什么 |
|---|---|---|
| Claude 主导的研发占比 | 26% | 端到端完成度(人类仅监督) |
| 协作参与的研究任务 | >90% | 渗透广度 |
| 在线研发 Agent 数 | 3 万+ | 自动化规模 |
| 安全监控算力占比 | 6%-12% | 治理成本 |
这是一套可重复测量、可被外部核对的口径,而不是一次性声明。Amodei 上周刚提出「给前沿定速」,一周后自家就交出量化底账——节奏上是在为「第三方常驻检查」的提案铺路:先让公众习惯看数字,再谈让外部机构进后台。
二、发布时机:安全辩论最激烈的一周
把这条放在最近两周的时间线里看,指向性非常明显:
| 时间 | 事件 |
|---|---|
| 09-12 | Amodei 发文呼吁「协同放缓」,Altman、Musk 表态支持 |
| 09-16 | OpenAI 发布失准披露框架与 6 起案例 |
| 09-17 | 三大实验室被曝筹建 FINRA 式自律机构 |
| 09-18 | Anthropic 公布 RSI 指标 + 承诺第三方评估准入 |
Anthropic 是这轮安全叙事里最激进的呼吁者,也是唯一交出量化自查数据的实验室。对它来说这几乎是最优策略:既推动了「公众需要更多信息」的议程,又把「透明」做成了自家的品牌资产——而 Anthropic 预计年内启动的 IPO,恰好需要一个这样的叙事。
三、对「AI 造 AI」的工程含义
3 万个在线 Agent、26% 主导占比,这些数字对工程团队的参考价值可能高于对监管的价值:
- AI 参与研发的形态是「协作面全渗透、主导面仍有限」——90% 的协作意味着它已经嵌进几乎所有环节,但端到端独立扛任务的只有四分之一。
- 治理成本是有量级的:6%-12% 的算力花在监控上。这给所有做 Agent 平台的团队一个参照——你的 Agent 预算里,安全与可观测性占多少? 低于个位数大概率是不够的。
对开发者的影响
- 把「AI 占研发多少」纳入团队度量。 Anthropic 给出了可抄的指标定义:主导占比(端到端)、协作渗透率、在线 Agent 数。多数团队连第一项都没有度量,而这恰恰是判断「AI 是助手还是主力」的唯一硬指标。
- 监控算力按 6%-12% 做预算参照。 无论是自建 Agent 平台还是用托管方案(参见 OpenAI Agents API),可观测性与安全监控的投入比例应该显性化,而不是事后补。
- 第三方评估会变成供应链问题。 Anthropic 承诺向第三方评估组织开放后台访问——如果你重度依赖 Claude Code(参见 Claude Code),评估结论将直接影响你的模型选型风险表,关注哪些机构拿到权限。
- 别把 RSI 当远期科幻。 Anthropic 自己都在为「模型构建继任者」设置可追踪指标了,「Agent 写代码、人做监督」已经是现在时——Codex CLI(参见 Codex CLI)与 Claude Code 的日常用法已经长成这样。
AI 之家 观点
- 这份报告最重要的价值是「把 RSI 从形容词变成了仪表盘」。 26%、90%、3 万、6-12% 四个数一摆,「AI 造 AI」就从口号变成了可审计的账本。谁先建立可信的度量口径,谁在这场安全辩论里就有话语权。
- 透明度正在成为差异化竞争武器。 OpenAI 披露失准案例、Anthropic 公开 RSI 指标、Google 被动披露入侵事件——三家的「披露姿势」不同,但方向一致:安全叙事已经是前沿实验室的必答题。Anthropic 抢答最积极,这与它年内 IPO 的时间表高度吻合。
- 对 26% 要保持冷静。 「主导」的定义是「人类监督下完成大部分任务」,这个口径下的 26% 与「AI 自主研发」之间还有相当距离——报告自己都说了 Claude 还不能完全自主。真正需要盯的是这条曲线的斜率,而不是当前点位。
- 对国内团队的启示:先补度量,再谈治理。 国内团队用 Agent 的比例不低,但几乎没人能量化「AI 主导了多少产出」。从「本周合并的 PR 里有多少由 Agent 端到端完成」这个最粗糙的口径开始记,一个月后你就有自己的 26% 曲线。
相关阅读
- 同期安全议题:AI 减速论成为共识 · OpenAI 失准披露框架与 6 起案例 · 三大实验室筹建自律机构 · Amodei 提出「给前沿设节奏」
- 工具卡:Claude Code · Codex CLI · OpenAI Agents API
- 模型卡:Claude Fable 5.1 · GPT-6 Astra
- 概念:AI Agent · Agentic Coding · 上下文工程
来源
- Anthropic says AI systems moving towards building themselves — Channel NewsAsia(AFP/Reuters)
- Claude主导26%研发、参与90%工作、3万agent同时在线……Anthropic报告称,用最高12%计算资源做安全监控 — 中新经纬(引彭博社)
- AI News Today — September 19, 2026(AI Briefing)
待核实:「26% 主导」的准确定义与测量方法以 Anthropic 原始报告为准,本文数字为彭博社/AFP 转述口径;「年初接近零」为 AI Briefing 引述的 3 月数据点;第三方评估组织的名单与准入时间表尚未公布。本资讯由 AI 之家 编辑部基于公开报道整理,非厂商付费内容。