当写代码不再稀缺,稀缺的是什么
过去的共识是:AI 编程的终极问题是「程序员会不会被替代」。9 月 14 日 Anthropic 发布的两份材料,把这个问题的前提掀翻了。工程师季度交付代码量是 2021–2025 年平均水平的 8 倍,80% 合入生产代码库的代码由 Claude 编写——写代码早已不是瓶颈,连代码审查都不再卡脖子。真正先崩溃的,是持续集成(CI)系统:测试用例半年涨了 10 倍,CI 任务量 6 个月暴涨 25 倍。
这篇文章的论点只有一个:AI 编程的真实瓶颈,已经从「生成代码」迁移到「验证与交付体系」。当产能指数化增长,一切以人类节奏设计的工程基础设施,都会从后台变成主战场。
一、为什么先倒下的是 CI
Anthropic 的 CI 事故细节,比任何生产力宣言都更有信息量。负责决定「每个 PR 该跑哪些测试」的测试影响分析服务,由两个组件组成:Listener 记录每次 CI 运行的测试结果,Selector 根据历史结果筛选测试。这个在人类时代运转良好的架构,有一个致命假设——提交是稀疏的、有低谷期的。
AI 把这个假设摧毁了。三个结构性变化同时发生:
一是 PR 变碎。Claude 偏好更小、更细粒度的 PR,一个小修改就是一个 PR,单位时间触发的流水线频次呈几何级增长。二是低谷期消失。Agent 不睡觉,深夜和周末持续推代码、跑重构,人类时代的「夜间消化窗口」被彻底抹平。三是测试爆炸。Claude 写完逻辑会顺手写出密密麻麻的单元测试和集成测试,整个代码库的测试规模激增 10 倍。
结果就是:单进程写入的 Listener 落后 20 分钟,意味着数万次测试状态无法同步给 Selector。错误代码被合入,全公司陪着排查与自己无关的报错;偶发失败的测试阻塞合流;新修复的测试迟迟不能生效,回归风险飙升。 写得快的世界里,验证排队。
二、三次补丁,寿命一次比一次短
Anthropic 工程师 Sachin Malhotra 在博客里复盘的路径,几乎是一部「补丁失效史」。
Patch 1:换更大的机器。把服务核数翻倍。所有人都知道这是临时的,但没人想到它只撑了 70 天。
Patch 2:分片。不再要全局单一写入者,改为每个 package 一个独立的 shard worker,让 Claude 生成拆分代码。这个方案撑了 29 天。
Patch 3:每日重启。到 2026 年 3 月,这台单体服务每个工作日午后就触发内存上限(OOM)。团队只找到 4 个微小 Bug,换 Go/Rust 内存分配器优化 GC 全部无效,又不敢对高负载下的单点服务做生产环境内存分析。于是启用每日定时重启——在 AI 每秒倾泻的并发下,连一天都没撑住,Listener 经常连续落后 1 小时以上,测试选择器只能拿陈旧数据瞎猜。
70 天、29 天、不到 1 天。补丁寿命指数级衰减,这才是 AI 时代的真实节奏。Malhotra 自己总结:这些经典扩容手法——加机器、并行化、重启——今天买到的时间,只是去年的零头。
最后的解法反而是最简单的:听 Claude 劝了几个月的话,把整个单体推倒重来。引入内存数据存储,任何 listener worker 处理完结果就追加到日志里、不在内存里持有任何状态,彻底无状态化、可横向扩展;一个小型消费进程每隔几秒把日志汇总成每测试历史,Selector 秒级只读查询。切换后,此前每周攀升、动辄堆积数十万的未处理事件队列,被拉成一条贴地的水平直线。这个项目一名工程师只花了三周——一年前要一个季度。因为写代码不再昂贵,昂贵的是决定该不该重写。
三、一个框架:验证带宽 = 新的交付吞吐
把这次事故抽象成一个可复用的框架:任何研发体系的交付吞吐,不由产能最高的环节决定,而由「验证带宽」决定。验证带宽包括三件事——测试能否及时反馈、结果能否可靠流转、故障能否快速定位。
这个框架还有一个推论:当重写本身变得便宜,「凑合」就成了负债。Anthropic 团队对那个单体服务打了一年补丁,不是因为他们想不到终局方案——Claude 几个月前就建议推倒重来——而是旧时代的直觉告诉他们「重写太贵」。当三周就能完成过去一个季度的重写,补丁的相对成本被反转了:每一次续命,都在为更大的债务付利息。
在人类时代,写代码是最慢的环节,验证带宽永远过剩,没人把它当资源看。AI 把生成成本打到接近零之后,验证带宽成了硬约束:它是稀缺的、不可压缩的、而且不像代码那样可以指数增长。Anthropic 的教训是,他们把 AI 产能当作线性增量去扩容,而它实际是指数增量。
框架还有一个推论:当重写本身变得便宜,「凑合」就成了负债。Anthropic 团队打了一年补丁,不是想不到终局方案——Claude 几个月前就建议推倒重来——而是旧时代的直觉告诉他们「重写太贵」。当三周就能完成过去一个季度的重写,补丁的相对成本被反转了:每一次续命,都在为更大的债务付利息。Verbatim 对话里,Claude 反复主张 overhaul,人类反复选择 patch。
这个框架可以迁移到几乎所有「AI 加速某环节」的场景。AI 客服把工单生成提速 10 倍,先崩的是人工质检队列;AI 辅助医疗影像,先满负荷的是病理医生的复核;AI 生成营销文案,先失控的是品牌审核流程。规律一致:谁上游被 AI 加速,谁的下游验证环节就会先过载。
四、更大的图景:RSI 的第一现场
这次 CI 事故不是孤立的,它和 Anthropic 同期发布的《When AI Builds Itself》报告拼在一起看,才是完整信号。那份报告披露:在最开放式的任务上,Claude 成功率 6 个月内从约 26% 升到 76%;2026 年 4 月,Claude 一次性交付 800 多个修复,把一类 API 错误降低了 1000 倍,监督工程师估计人类做同样的事要四年;在固定目标的实验优化任务上,Claude 从 2025 年 5 月的约 3 倍加速跃升到 2026 年 4 月的约 52 倍,而熟练人类研究员在同样任务上 4–8 小时只能做到 4 倍。
还有两个数字值得单独拎出来。其一,Anthropic 用自动化的 Claude 审查器回溯分析发现,它能拦下过去约三分之一的 claude.ai 生产事故 Bug——写出这些 Bug 的,是全世界最擅长构建这些系统的人。其二,GitHub 在 2025 全年收到约 10 亿 commits,而 2026 年中已达到每周 2.75 亿,折合全年约 140 亿——整个行业都在被 AI 产能冲击。
更细的信号在弱到强监督实验里:两名人类研究员花一周时间恢复了约 23% 的性能差距,而 Claude 智能体用累计 800 小时、约 1.8 万美元算力恢复了 97%。方向由人定,方法由 AI 自己设计。这正是 CI 事故的微观版本——人类退到「决定要不要重写」,AI 负责「怎么重写」。
Anthropic 把这条链路叫递归自我改进(RSI)的前置阶段,并罕见地公开呼吁:如果这一趋势失控,需要多国前沿实验室共同设计减速机制。技术上可行吗?报告自己承认,训练运行比导弹井更容易隐藏,核查体系要以十年计,而我们没有十年。
五、落到行动
如果你是工程管理者:
- 按「两个季度内负载 ×25」给核心服务做容量规划,v0 设计预留 10–20 倍于当前感知规模的余量。
- 从第一天起把状态放在进程外,拒绝任何关键服务跑单实例。
- 给系统装上「AI 的眼睛」——充分的 instrumentation,让 Agent 能自主定位问题;确保 CI 进出任务数对等。
如果你是执行者:
- 你的价值正在从「写代码」转向「定义什么值得写」和「判断验证结果是否可信」。主动接管 AI 做不好的方向选择。
- 审查你所在团队里「人类节奏」的隐含假设——低谷期、批处理、人工排队,每一个都可能是下一个 Listener。
如果你是基础设施/平台团队:
- 验证带宽是你接下来一年的核心 KPI。测出它现在的上限,乘以 25,就是 Agent 化半年后的需求。
- 横向扩展的测试选择架构,正在从「重负载公司的专利」变成行业标配。
代码可以一夜暴增,交付能力必须跟上。当所有人都在比谁的 AI 写代码更快时,真正的分野在于:谁的体系接得住。
