当地时间9月17日,Anthropic发布一组罕见的内部数据,试图量化AI究竟已在多大程度上参与自己的研发。结果显示,截至2026年8月,Claude已能够“主导”Anthropic约26%的AI研发工作;超过90%的AI研发工作至少达到“AI协作”水平。在Anthropic使用最广泛的内部Agent平台上,约3万个Agent正在同时执行研究和工程任务。
更值得注意的是变化速度。Anthropic公布的图表显示,今年2月,Claude能够达到“主导”水平的模型研发任务占比还不到1%,半年后已升至26%,增长超过25个百分点。Anthropic将这套衡量体系直接与RSI(AI自主构建继任者)联系起来。
这里的“主导”需要特别解释。Anthropic构建了内部“R&D Automation Index”,采用Epoch AI提出的AL0至AL5六级自动化标准。AL3为“协作”,AI可在人类密切指导下承担大块工作;AL4为“主导”,工程师只需给出高层目标,AI即可完成一项任务的大部分端到端工作,人类主要负责监督和最终决策;AL5才意味着无人类介入的完全自主运行。因此,“26%”并非指Anthropic四分之一研发已完全无人化,而是约四分之一AI研发进入“人类定目标和监督、Claude完成大部分执行”的阶段。
为得出这一数字,Anthropic在2026年7月每周随机抽取参与模型研发循环各部门20%的员工,由Claude Research Agent阅读其Slack和内部文档,整理出约1.5万项细粒度研发任务,再整理成包含542个节点、378个叶节点的任务树,涵盖预训练、强化学习、评测平台故障诊断、RL沙箱网络策略和推理服务事故复盘等工作,并按人力时间加权。Anthropic也承认方法存在局限:评估Claude自动化程度的“裁判”同样是Claude,模型与人的评级完全一致率为59%,不同人类评估者之间为35%,相差不超过一个等级时一致率达97%。
为管理这3万个同时工作的“AI员工”,Anthropic为内部Agent引入两项设计:一是独立身份,每个Agent拥有自己的身份,数据和行为记录均与身份绑定,底层模型升级后身份仍可延续;二是开放通信,Agent之间通过共享消息系统交流,每条消息绑定发送者身份并链接原始资料,其他Agent可查看、纠错和协作,同时与完整运行轨迹交叉关联,便于监控跨Agent协同行为。