388 个 PR,180 个被合并,代码全是 AI 写的。Claude 之父 Boris Cherny 在 X 上公布了 Anthropic 内部跑了数周的实验:一个叫 proj-claude-maintains-apps 的 Slack 频道里,Claude 每天自动上班——找问题、改代码、提 PR,然后等人来审。工程师剩下的工作,只有一个合并按钮。
这不是演示,而是一个结构信号:软件工程的瓶颈已经从「写代码」转移到「审代码」。背后的数据比口号更有说服力。
Claude 接手的 11 项杂活:没有一项是「做新东西」
Cherny 给 Claude 配了覆盖 iOS、Android、桌面、Web、CLI 和 Agent SDK 六类环境的例行任务,共 11 项,全部是开发中最不愿意干、干了也不出绩效的脏活:
- 崩溃巡检。在模拟器里打开真 App 一通乱点,点到崩为止,然后定位原因、开修复 PR,附复现步骤和真值表。原始指令里特意写了:必须跑真的 App,不许拿替身糊弄。
- 重复抽象合并。扫出代码库里长得像又不完全一样的实现,合并成一个。
- 死代码清理。静态能证明跑不到的立即删;只是疑似跑不到的,先埋日志观察一天,确认真没人走,第二天再删。
- 修抽象泄漏、删永远通过的测试、定位时好时坏的测试、移除全量上线开关、按使用量决定废弃功能的去留。
「先加日志观察一天再删」——这是老工程师才有的手感。Claude 被用 token 付工资,干着没人愿意干、干完也不涨绩效的活。
瓶颈反转:生成变便宜了,审查变贵了
Anthropic 今年 3 月发布 Code Review 时给出第一个数字:人均代码产出一年涨了 200%,代码审查随之成为瓶颈。
独立的证据更硬。Faros AI 的 2026 年报告《The Acceleration Whiplash》基于 2.2 万名开发者、4000 多个团队两年遥测,高 AI 采用度下:
- 人均 epic 完成量 +66.2%,任务吞吐 +33.7%,PR 合并率 +16.2%。
- 但每周部署数 −11.7%;人均 bug 数 +54%,每个 PR 对应线上事故 +242.7%。
- 合并后又被删掉的代码 +861%;PR 平均体积 +51.3%。
- 等一个人来审的中位时长 +441.5%,还有多 31% 的 PR 一次审查都没经过就合了进去。
合并得更多,发出去的反而更少——全都堵在审查环节。开发者的日常变成:按一下按钮五分钟生成上千行,然后花一整个下午逐行读完。AI 拿走了写代码,人留下了读代码。
Anthropic Code Review 的数字解释了原因:上线前只有 16% 的 PR 能拿到实质性审查意见,上线后是 54%;超过 1000 行的大 PR 84% 能查出问题(平均 7.5 个),50 行以下的小改动平均只有 0.5 个。审一个 PR 约 20 分钟、烧 15–25 美元 token。系统从不批准任何 PR——批准是人的事。边界划得很清楚:AI 可以主动找问题、改代码、提 PR,全程无需批准;但合并和上线,最后一下必须是人的手。
系统怎么搭的:不修结果,修规则
四层结构:Claude Tag 是入口,挂在 Slack 频道里(8 月 13 日刚升级,会结合整个频道上下文判断何时出手);Routines 是执行层——4 月 14 日推出的功能,一次性配好提示词、代码仓库和连接器,按时间表、API 调用或 GitHub 事件触发,跑在 Claude Code 云端设施上;Claude Code Review 是审查层;人类是批准层。
最值得抄走的是 Cherny 的调优方式:某类 PR 老是不过关,他不去一个个改失败的 PR,而是回头改生成它们的 Routine,再观察接下来几天的表现。提示词不再是一次性输入,而是要长期运维的资产:写好、上线、观察、迭代,跟养一个线上服务没区别。每次调整都沉淀进规则里,第二天生成的 PR 就少几个不该出现的错误。
产业含义
- 审查经济正在形成。生成接近免费,稀缺的是又快又准的读代码能力。Anthropic 已把 Code Review 定价为产品;审查工具、审查即服务、「合并管家」类角色会越来越多。
- 规则在追赶。Rust 项目 8 月初立了 LLM 政策:AI 生成的贡献必须事先披露、不碰关键路径、测试要充分,且维护者没有义务审查 AI 提交的 PR——可以直接关掉。「可以关掉」成为新的治理底线。
- 工程师的身价换算法。从「写得多快」转向「审得多快、审得多准」。能在 388 个 PR 里快速分流而不 burnout 的人,会吃下这轮红利。
这条线也接上了我们前两天聊的:CLAUDE.md 为什么只长不短、多 Agent 打地盘战。Agent 的产出已经不是约束,治理才是。
现在就能做的四件事
- 先把验收标准明确的活交出去。崩溃复现、重复检测、死代码——这些能当场验对错的活,AI 已经接得住;「这个抽象层算不算过度设计」这种凭品味的判断,AI 还接不住。
- 先补测试,再上 Agent。审查瓶颈本质是测试覆盖不足。测试越稳,信任 AI 的 PR 就越便宜。
- 把提示词当生产资产运维。版本化、观察、迭代。修规则,别修结果。
- 重审自己的审查流程。如果 PR 队列长得比部署快,解法不是更多生成,而是更快更便宜的审查。