博客 AI / Agent

Anthropic 最新披露:Claude 已参与 26% 的 AI 研发工作,AI Agent 如何协作完成模型开发?JSON 数据流与 Agent Workflow 解析

2026 年 9 月 17 日,Anthropic 在 Institute 文章里公开了一组内部度量。标题容易被读成:Claude 已经包办四分之一的模型研发。

原文更窄:截至 2026 年 8 月,Claude「主导」Anthropic 26% 的 AI 研发工作;达到「协作」及以上的份额超过 90%;在任何被测子集上,都还没有全自主。

本文将介绍:

先记住这一点:主导是 AL4,不是 AL5。工程师丢过来一条失败告警,Claude 自己查日志、写补丁、跑回归、写报告;上不上线仍由人决定。3 万个 Agent 能同时干活,是因为每条动作绑着身份、开放消息和执行前监控。没有结构化记录,这个数字无法复核。

26% 到底量的是什么

出处是 Anthropic Institute 的Measurements for understanding the pace of AI development inside frontier labs。他们同时交出三组数:AI 自己做了多少 AI 研发、Agent 的动作被看管到什么程度、算力怎么分。

第一组叫 Anthropic R&D Automation Index。做法是:列出公司里每一种 AI 研发工作,给每类工作打自动化等级,再按人时加权汇总。

截至 2026 年 8 月,公开数字是:

数字 含义 不是什么
26% Claude「主导」的 AI 研发份额(AL4) 无人值守、自动部署、递归自我改进已经完成
>90% 达到「协作」及以上(AL3+) 90% 的工作已经没有人盯
0% 被测子集里达到全自主(AL5)的份额 「还差一点就全自动」的暗示

Reuters 把同一组数写成「Claude 主导四分之一下一代模型的建造工作」。标题更冲,定义没变:主导仍是高层次提示加人类监督。图表里,这一档从 2026 年 2 月的不足 1% 抬上来,速度快,但台阶没有跳过。

自动化等级:协助、协作、主导、自主

评级用的是 Epoch AI 的 Automation Level。Anthropic 把它写成六档:无 AI、极少、协助、协作、主导、自主。脚注里用「夜间数据管道坏了」把中间三档钉死:

等级 谁起头 谁处理意外 谁决定上线
AL3 协作 工程师带着日志和假设来找 Claude 半路出新问题,Claude 停下等人拍板 工程师逐行看、自己再跑、自己部署
AL4 主导 工程师丢过来失败告警 Claude 自己查、修、测、写报告 工程师读报告、扫一眼 diff,决定今晚发不发
AL5 自主 Claude 自己发现故障 自己定范围、实现、测试 自己部署;人可以看,但不是必须在场

26% 停在 AL4。Claude 已经能把「修管道」这类任务从告警做到复盘,但部署权还在人手里。这和日常 Coding Agent 的形状一致:模型发出 Tool Calling,harness 执行,人在门禁和高风险动作上留下否决权。循环怎么转,见AI Coding Agent 如何工作?;谁拥有从 JSON 到副作用的那一跳,见从 JSON Tool Calling 看 Agent Harness

任务树:15,000 件工作如何收成一个指数

没有人能手写完一家前沿实验室的全部研发动作。Anthropic 自下而上收:2026 年 7 月每周从模型研发相关部门随机抽 20% 员工,让 Claude 研究 Agent 去读 Slack 和内部文档,列出这些人当周做的事。四周下来大约 15,000 条细粒度任务。

再用 Claude 把清单收成一棵树:根是全部模型研发,往下分训练、产品、预训练、强化学习,直到叶子。冻结后的树有 542 个节点,其中 378 片叶子,例如评估平台缺陷诊断、RL 沙箱出站与网络策略、服务事故复盘。

每个节点再由一个 Claude Agent 深挖:谁在做、用什么工具、AI 做了多少。独立的 Claude 评审只看当月及更早的证据,打出 AL0–AL5。加权不靠领导拍脑袋,而靠人时:每人每周一票,平分到当周做过的任务上。

他们也写了局限。评审模型和人类完全一致的比例是 59%,人类彼此完全一致只有 35%;但 97% 的情况下,模型和人类相差不超过一档。「协作」和「主导」的边界仍会吵。篮子冻结后,指数上升只说明 2026 年 7 月那批工作被自动化了,不自动证明人类没有挪到全新工种上去——他们用 1 月篮子对照,没看到新任务数量上升,仍计划定期重建。

示意:任务节点上的自动化评级(按公开方法重建,不是内部原件)
{
  "index": "anthropic-rd-automation",
  "as_of": "2026-08",
  "node": {
    "id": "rl-sandbox-egress-policy",
    "leaf": "RL sandbox egress and network policy",
    "automation_level": 4,
    "label": "leads",
    "weight_person_weeks": 12.4,
    "human_gate": ["deploy", "policy_change"]
  },
  "aggregate": {
    "leads_share": 0.26,
    "collaborates_or_above": 0.90,
    "autonomous_share": 0.0
  }
}

字段能 parse、等级是枚举、权重是数字,指数才能按月重算。散文式周报做不到这件事。

Agent 如何协作完成模型开发

26% 不是一个超级 Claude 坐在中间写完整个训练栈。公开描述更像一张编排图:人给出目标,多个 Agent 半自主跑很长一段时间,并且会把工作委派给别的 Agent。

  1. 1
    采样与编目

    研究 Agent 读工作记录,把当周任务写成可汇总的条目。没有这一步,后面的等级没有分母。

  2. 2
    分枝与委派

    训练、评估、基础设施、事故复盘被拆开。一个 Agent 可以继续深挖,也可以把子任务交给另一个有独立身份的 Agent。

  3. 3
    执行与回写

    读日志、改代码、跑测试、比对照跑。结果回到会话,而不是只留下一句「修好了」。

  4. 4
    互相校正

    消息走开放信道,并链回原始材料。别的 Agent 把来自同伴的话当「待核验的主张」,而不是自己的想法。

  5. 5
    人类门禁

    AL4 停在上线之前。AL3 更早:意外一出现就交回人。门禁失败,磁盘和集群上不该发生不可逆动作。

这和「聊天框里一个助手」不是同一层产品。它更接近实验室内部的 Agent 运行时:身份持久、消息可追溯、工具受监控。技术栈怎么分层,见2026 AI Agent 技术栈

JSON 数据流:身份、消息、工具、门禁

附录把内部脚手架的两个设计写得很具体。它们决定了 3 万个 Agent 为什么还能被审计。

身份。用户习惯和一个叫 Claude 的对象聊天。多 Agent 协作时,每个 Agent 必须有自己的身份,并且它产生的数据都绑在这个身份上。身份不绑死某一个模型版本,升级后履历还在。从监督看:每个动作能按 Agent 纵向追查,每条记录能指回具体执行者。

开放通信。Agent 不走私聊。每条消息带发送者身份,并能链到原始引用,减少传话失真。别的 Agent 看得见,才能纠错和协调。消息和会话转录交叉引用,行为监控才能穿过 Agent 之间的对话。

把这两条和日常 Tool Calling 叠在一起,一条可审计的记录大致是:

示意:一次被监控的 Agent 动作(公开描述的结构重建)
{
  "agent_id": "agt_4c91",
  "model_ref": "claude-internal",
  "identity_persists_across_models": true,
  "action": {
    "type": "tool_call",
    "name": "apply_patch",
    "arguments": "{\"path\":\"pipelines/nightly_etl.py\",\"intent\":\"fix_schema_drift\"}"
  },
  "message": {
    "channel": "open",
    "from": "agt_4c91",
    "links": ["transcript://run-8821#step-17"],
    "treat_as": "claim_to_verify"
  },
  "monitor": {
    "online": { "coverage": 1.0, "decision": "allow", "latency_s": 1.8 },
    "offline": { "ingested": true, "flagged": false }
  },
  "human_gate": { "required_for": ["deploy"], "status": "pending" }
}

arguments仍经常是字符串。业务层要先 parse,再按 schema 校验,再交给监控和权限。契约怎么写,见AI 为什么需要 JSON Schema?。工具面变大之后谁负责安全,见MCP 安全漏洞全面解析

没有这层 JSON,监控只能读散文。3 万个并发 Agent、十亿次决策,散文无法按身份聚合,也无法回答「谁在主导哪一类叶子任务」。

3 万个 Agent,谁在看管

2026 年 8 月,Anthropic 最常用的内部平台上,大约 30,000 个 Agent 同时在做研究与工程。度量只覆盖这个平台。动作受两层监控约束:

在线监控 离线监控
做什么 执行前拦截或纠偏,针对来不及撤销的伤害 事后读活动,抓缓慢、可逆的异常
覆盖 100% 动作执行前经过,通常在数秒内 100% 动作事后被摄入
人何时介入 被拦截的动作一周内由人复核 每周约 10 万条转录先过分类器;最高优先大约 50 条交给人
比例 8 月超过 10 亿次决策里,0.002%(约 1/47,000)被拦 大约每千条转录里有 1–2 条被标出来

拦得少,不等于门可有可无。覆盖是 100%,拦截是例外。少了执行前那一跳,AL4 的「主导」会滑向无人看管的部署。JSON 如何成为安全边界,见AI Agent 开始「自己攻击互联网」

算力账本:安全只占 6% 说明什么

第三组数是 2026 年 7 月 13–20 日那一周的算力快照。进入 AI 研发的算力里,大约 6% 划给安全;进入「由 AI 驱动的 AI 研发」的算力里,大约 12% 划给安全。分类刻意保守:能力和安全各占一半的 token,不算进安全。

Anthropic 自己提醒:安全研究往往比前沿训练更吃人时、更不吃卡,算力份额不是「公司有多重视安全」的充分统计。它的价值是可比较——跨实验室、跨时间,用同一套桶。

分类本身也是一条 Agent 工作流:分类器读作业元数据、代码和会话转录,输出桶、理由和置信度。抽了当周近 10,000 次运行中大约 14%,并按算力加权。边界写进提示词,人类复核和机器相差一两个百分点。开发者若要复现,先要把「什么叫安全工作」写成可校验的 JSON 定义,而不是一句口号。

用 JSONNote 拆开一条工作流记录

你拿不到 Anthropic 的内部树。你拿得到自己仓库里的同类材料:tool call、监控日志、Agent 消息、任务评级。这些都可以在浏览器本地拆开。

  1. 1
    先看 arguments 能不能 parse

    把字符串里的转义拆开,丢进JSON 格式化。缺逗号、多尾逗号,监控还没上场就已经坏了。

  2. 2
    用声明的 schema 校验动作

    把工具的 parameters 和解析后的对象放进JSON Schema。等级必须是枚举,身份必须是稳定 ID,部署必须显式留在 human_gate。

  3. 3
    对比「批准时」和「现在」

    把上周的任务树或工具清单丢进JSON Diff,专门找叶子任务、监控决策和 schema 的静默改动。

  4. 4
    需要给同事看时用 Hash 分享

    数据留在 URL fragment,不经过服务器。见用 URL Hash 分享 JSON

常见问题

Claude 参与 26% 的 AI 研发,是不是已经在无人值守地造下一代模型?

不是。26% 对应 Epoch AI 的 AL4:Claude 能从高层次提示把大部分任务做完,人类监督并决定是否上线。Anthropic 写明:在任何被测的 AI 研发子集上,Claude 都还没有达到 AL5 全自主。

超过 90% 协作和 26% 主导是什么关系?

90% 是 AL3 及以上:Claude 至少能在人类密切指导下做大块工作。26% 是其中已经升到 AL4 的份额。主导包含在协作以上,不是另一套互斥的工作。

30,000 个 Agent 怎么协作,又怎么被看住?

它们在内部平台上半自主跑研究与工程,还能互相委派。每个 Agent 有独立身份,消息走开放信道。动作 100% 先过在线监控、事后再进离线监控。2026 年 8 月超过 10 亿次决策里,约 4.7 万分之一被拦住。

这条工作流里 JSON 出现在哪?

任务树节点、自动化评级、Agent 身份、开放消息、Tool Calling 参数、监控放行或拦截,几乎都是结构化记录。没有可解析的契约,3 万个 Agent 无法审计,也无法复盘「谁主导了哪一段」。

开发者现在最该从这条披露里带走什么?

先分清协助、协作、主导、自主。再给每次 tool call 和每次 Agent 消息留下身份、时间和可校验的 JSON。门禁放在执行前,复盘材料留在执行后。数字会变,契约层不会过时。

小结

Anthropic 愿意把 26%、90%、3 万、0.002%、6% 摊在桌上,是因为这些数能量、能复核、能按月重算。它们量的不是「模型有多会聊天」,而是模型开发这条生产线里,人和 Agent 各站哪一档。

26% 是主导,不是自主。协作已经铺开,门禁还在人手里。Agent 能一起造模型,是因为身份、开放消息、Tool Calling 和监控决策走的是同一条可解析的数据流。

标题会继续把 26% 读大。看原文的人,应该先看等级定义,再看那条 JSON 还在不在。

下一步:把一条 Agent 工作流记录粘进 JSONNote

← 返回博客