「AI 什么时候能自己研究 AI」,这个问题的回答过去靠立场,现在开始有仪表盘了。Anthropic 在 9 月 17 日发布了一套研发自动化指标,把公司内部「AI 参与研发」的程度做成了可量化、可定期披露的数字。这是前沿实验室里相当早的一次系统性披露。

先说数字,因为它确实超出了大多数人的体感。截至今年 8 月,Claude「主导」了 Anthropic 约 26% 的 AI 研发工作——这里的「主导」有明确定义:人类给出高层目标,模型端到端完成大部分工作,人类负责监督和把关。今年 2 月,这个比例还不足 1%。半年时间从近零到四分之一,斜率比大多数预测都陡。

Anthropic 内部 AI 研发的自动化分层(2026 年 8 月)26% 由 Claude 主导(AL4)90% 以上达到协作及以上(AL3 起)全部研发工作读法:AL4 指人类给高层目标后模型端到端完成大部分工作;AL5(完全自主)目前没有任何被测任务达到2 月不足 1%8 月升至 26%来源:Anthropic 9 月 17 日发布,指标体系参考 Epoch AI 自动化等级
图|研发自动化指数:26% 的构成与读法

分层的口径借用的是 Epoch AI 的自动化等级框架:AL0 到 AL5,从完全无 AI 参与到完全自主。26% 的研发达到 AL4(AI 主导),九成以上至少到 AL3(AI 协作),而 AL5——无人在环的完全自主——目前没有任何被测任务达到。Anthropic 也特意标注了方法局限:评级由一个 Claude 智能体调研、另一个 Claude 独立评审,自评自判可能犯同类错误;各实验室也没有统一测法,横向比较暂时无从谈起。

规模数字更能说明这套系统的真实形态。8 月,内部平台任意时刻约有 3 万个智能体在跑研发和工程任务,单月决策量超过 10 亿次;自动化监控系统拦截了其中约 0.002%——大约每四点七万次决策有一次被标记出来交人工复核。算力分配上,整体研发约 6% 投入安全研究,若只统计 AI 主导的部分,这个比例约 12%——公司在刻意让自动化程度更高的工作承担更高的安全冗余。

报告里给的场景案例读起来已经很像日常:夜间数据管道故障,工程师把报告丢给 Claude 说「修好它」,模型自己查日志、定位原因、写修复代码、跑测试、处理冒出来的新问题,最后重跑管道、对比结果、写完说明文档。这不是演示,是 26% 里一个普通的工作日。

2026 年 8 月内部平台运行面约 3 万个智能体任意时刻并行开展研发超 10 亿次决策单月累计执行量拦截率约 0.002%自动监控标记后人工复核安全算力占比整体研发约 6%;仅统计 AI 主导的研发则约 12%自评的局限跨实验室没有统一口径,自评自判可能犯同类错误
图|三万智能体的运行与监督数字

放在更大的图景里,这份披露把几条线拧在了一起。智谱的 Infra Agent 在国产集群上两周把推理吞吐提升了三倍多,模型开始改进承载自己的系统;OpenAI 设定了自动化 AI 研究员的时间表;而 Anthropic 上一周刚把评估员请进办公室,这一周就交出了自我量化的仪表盘——递归自我改进不再只是论文里的概念,它在变成一组可以每月对账的数字。

需要保持清醒的地方同样明确。26% 是一家公司用自己的模型、自己的评级流程算出来的数,它的价值在于建立披露的先例,而不在于数字本身的精确度。真正值得期待的后续是:更多实验室跟进同样的披露,第三方评估机构接入验证,让「AI 参与研发的比例」从各家自报的口径变成可比、可审的公共指标。在那之前,把 26% 当作趋势信号,比当作精确事实更稳妥。