Anthropic 没有宣布奇点,它做了一件更少见的事:把「AI 造 AI」变成了可以测量的仪表盘。
9 月 17 日,Anthropic 首次公开三组内部指标:截至 2026 年 8 月,Claude「主导」了公司 26% 的 AI 研发工作,比 2 月的不足 1% 半年涨了 26 倍;约 3 万个智能体同时在内部平台做研究和工程;安全研究占研发算力约 6%。
媒体的标题集中在前两个数字。但真正的新闻不在数字本身,而在「数字可以被公开」这件事。
过去两年,关于递归自我改进(Recursive Self-Improvement,RSI)的讨论几乎全部停留在预测层面:乐观者说还需要十年,悲观者说只剩几个月。而这份报告做了一件此前没人做过的事——给整个行业装上了温度计。当 AI 参与研发下一代 AI 从想象变成一个有方法、有抽样、有误差说明的测量对象,监管者、竞争者和公众第一次有了可以持续追踪的锚点。
一、26% 这个数字是怎么来的,比数字本身更重要
先看方法。Anthropic 没有让高管拍脑袋报一个数,而是构建了一个叫「Anthropic R&D Automation Index」的原型指数。
7 月的每一周,公司随机抽取模型研发相关部门约 20% 的员工,让一个 Claude 研究智能体去读这些人的 Slack 记录和内部文档,最终整理出约 15,000 项具体研发任务,再归纳成一棵 542 个节点的任务树,其中 378 个是叶子节点——比如「评测平台缺陷诊断」「RL 沙盒网络策略」「推理服务事故复盘」。每类任务的权重不由管理层决定,而按员工投入的工时分配。
分级标准借用的是 Epoch AI 的六级自动化量表:AL0 完全无 AI 参与,AL3 是 AI 在人类密切指导下承担大量工作(「协作」),AL4 是 AI 接到一个高层指令后端到端完成大部分任务、只在关键节点接受监督(「主导」),AL5 则是完全自主闭环。
26% 指的是 AL4 级别的工作占比。报告里那个夜间数据管道故障的例子很能说明差别:AL3 之下,工程师要陪着 Claude 查日志、给方向、逐行审代码;AL4 之下,工程师只需要把告警扔给 Claude,后者自己分析日志、定位故障、写补丁、跑测试、输出复盘——人类保留的只剩最后的部署决定权。
另一个容易被忽略的数字是:达到「AI 协作」及以上水平的工作占比超过 90%。也就是说,Anthropic 内部九成以上的研发流程已经深度绑定 AI,问题只剩下绑得多深。
同样值得注意的是边界:截至 8 月,没有任何一类研发工作达到 AL5,Claude 不能自主监控所有故障,也不能未经审批把修改部署到生产环境。26% 是「AI 主导、人类拍板」,不是「AI 闭环」。
这个测量方法本身并不完美。Anthropic 自己承认:用来判断自动化等级的裁判也是 Claude,相当于让学生给自己阅卷。验证数据显示,Claude 裁判与人类评估者的完全一致率是 59%——而人类彼此之间的完全一致率只有 35%。允许一个等级的误差后,一致率升到 97%。也就是说,协作和主导之间的边界仍有解释空间,26% 应该被读成一个量级判断,而不是精确审计结果。
二、3 万个智能体的真实课题:不是失控,是可见性
第二个指标更容易被标题党带偏。3 万个智能体同时运行、8 月共做出超过 10 亿次决策,听起来像失控前夜。
但 Anthropic 披露的拦截率是 0.002%——大约每 4.7 万次决策被实时监控拦截一次。事后监控每周标记约 10 万份对话记录,多层分类器过滤后,只有约 50 份最高优先级记录进入人工审查。
这组数字的真正含义,不是「AI 很危险」或「AI 很安全」,而是一个更冷峻的事实:当智能体规模从 3 万走向 3 亿甚至 30 亿,0.002% 的罕见事件也会天天发生。监控体系的价值不在今天拦了多少次,而在它能不能随规模等比扩展。
为此 Anthropic 在架构上做了两个耐人寻味的设计。其一,每个智能体拥有独立身份,数据、消息、操作全部绑定,且身份不随底层模型升级而消失——这让任何一次操作都可以按智能体逐个审计。其二,智能体之间通过共享的开放消息系统通信,没有私聊。每个智能体看到的他人发言都是「待验证的声明」而非事实,可以互相纠错。
翻译成工程语言:Anthropic 不是在防止 AI 产生自我意识,而是在防止 3 万个分布式系统产生「传话游戏」式的集体失真。这是组织工程问题,不是哲学问题。
三、真正的头条:算力分配把话语权从叙事手里夺了回来
第三个指标最不性感,也最重要。7 月 13 日至 20 日这一周,Anthropic 把全部算力使用做了分类:约 6% 的 AI 研发算力流向安全研究;在 AI 驱动的研发算力中,这一比例约 12%。
这个数字看起来不体面——一家以安全为立身之本的实验室,安全算力只有 6%?但 Anthropic 主动解释了保守口径:凡是对能力和安全同样有帮助的工作,一律不算安全;安全分类器的算力也未计入。安全研究本质上靠人类研究员设计实验,天然不吃算力,6% 是一个诚实的低估值,不是冷淡的证据。
关键在于这一招的结构意义:算力是 AI 研发流程中最难造假、最可验证的输入。能力可以靠演示挑着展示,评测可以挑着跑,唯独电表和芯片使用记录骗不了人。当「安全算力占比」变成一个可公开、可对比、可被监管要求披露的指标,行业竞争的话语权就从「发布会叙事」手里转移到了「可验证数据」手里。
这不难看出指向谁。OpenAI 在同一天也发布了六份异常模型行为报告并承诺定期发布透明度报告——不管是不是巧合,这说明「透明度军备竞赛」已经开始。Anthropic 的 CEO Dario Amodei 此前公开呼吁给前沿 AI 降速,而这份报告就是降速讨论的第一份操作手册:你想管理一个东西的速度,先得能测量它。
Anthropic 同时宣布将引入多个机构的独立评估人员,让他们获得与内部风险评估团队相当的系统和数据访问权限。自报数据加第三方核验,这是把「透明」从姿态变成机制。
四、框架:AI 研发的「三仪表盘」
把这份报告抽象一下,它实际给出了一个可复用的评估框架。判断任何一家 AI 实验室离自动化研发有多近、风险控制有多实,看三个仪表盘:
仪表盘一:自动化率。AI 主导了多少研发工作?关键不是单一数字,而是斜率——Anthropic 从 1% 到 26% 用了半年。斜率比存量更能说明问题:哪怕今天只有 5%,半年翻十倍的曲线和停滞不前的 20%,含义完全不同。
仪表盘二:监督覆盖率与升级率。智能体的操作有多少比例经过实时审查?拦截和标记的比例是多少?人类审查的延迟是多长?覆盖率 100% 但人工延迟一个月,和覆盖率 90% 但延迟几秒,是两种完全不同的风险结构。
仪表盘三:安全算力占比。最难造假的一项。公司嘴上说什么不重要,GPU 用在哪不会撒谎。
这个框架的迁移能力很强。评估一家用 AI 写代码的公司,同样适用:AI 主导的代码占比(及斜率)、代码审查的自动化覆盖率、以及验证基础设施投入占比——Anthropic 自己的 CI 危机恰好证明第三个仪表盘最容易被忽视:写代码的能力暴涨 8 倍,验证基础设施没跟上,整个系统反而更脆。
三个仪表盘齐转,才算真的在负责任地自动化;只报第一个不报后两个的,是在讲故事。
五、不同角色分别该做什么
对 AI 实验室和模型厂商:透明正在从公关姿态变成竞争资产。现在开始建立自己的研发自动化测量体系,赶在监管强制要求之前发布基线数据,是成本最低的合规投资。等监管来定义指标,定义权就不在你手里了。
对采购 AI 的企业:评估供应商时,把「你们用 AI 自动化了多少自己的研发」加入尽调清单,并且要斜率不要存量。一家连自己内部自动化程度都说不清的厂商,很难让人相信它的企业级承诺。
对投资者:第一仪表盘的斜率是判断 AI 公司护城河变化速度的最直接指标。研发自动化率每上一个台阶,人力成本结构和迭代周期就重构一次——这比演示日上的 demo 可信得多。
对政策研究者:算力占比可能是目前唯一可验证、可比对、难以粉饰的抓手。安全算力定义的行业标准化,值得抢在各国监管框架落地之前推动。
对普通从业者和开发者:这份报告最实际的信息是——「AI 主导、人类拍板」的分工已经在最前沿的实验室成为常态。你的价值不在于和 Claude 比写代码的速度,而在于成为那个「读复盘、做部署决定」的角色。部署决定权,是这条自动化曲线上最后被收走的权限。
递归自我改进还没有到来。但它的早期形态已经从科幻叙事,变成了一个有数字、有方法、有第三方的工程系统。能被测量的东西,才谈得上被管理——这才是这份报告真正的野心。
来源备注:Anthropic Institute《Measurements for understanding the pace of AI development inside frontier labs》(2026 年 9 月 17 日);Reuters 报道;36 氪爱范儿、新智元中文报道交叉核对。
