Claude写完代码开始自查了:AI编程的真正瓶颈,已经从「写」转移到了「验」

一句话破题

Anthropic让Claude写完代码后自动跑四道检查再交付——AI编程的竞争焦点,正在从「谁写得快」转向「谁验得准」。

发生了什么

7月22日,Claude Code团队公开了一套内部的「验证循环」(Verification Loop):Claude写完代码后不再直接交差,而是自动依次执行四个Skill——

  • /code-review:揪出潜在bug,生成review意见
  • /simplify:清理冗余实现,简化代码结构
  • /verify:端到端跑一遍,确认功能真的完成了
  • /design:如果动了UI,对着DESIGN.md逐条核对视觉实现

四道跑完,才算交付。换句话说,AI开始从「会写代码」进化到「会检查自己写的代码」。

深层变化:瓶颈转移了

过去几十年,软件工程所有的流程——写需求、做规划、层层评审、开不完的会——本质上都是因为一件事:写代码太慢,工程师的时间太值钱

当AI把写代码这一环变快、变便宜,这个前提就不复存在了。Claude Code团队自己的判断是:

瓶颈没有消失,它只是转移了——从「写代码」转移到了验证、代码评审、安全这些环节。

代码生成得太快,新的问题变成了:这些代码到底对不对?谁来维护?人还跟不跟得上审代码的节奏?

这不是一个工具优化,这是AI编程赛道的竞争焦点在发生结构性迁移。

验证循环的架构:四档自动化

Anthropic把验证的触发方式分成了四档,从松到紧:

  1. Standalone:手动调用,想起来就跑一次
  2. Embedded:嵌入某个任务流程,跟着一起跑
  3. Chained:多个验证Skill串成链,自动依次执行
  4. On every PR:每次提交都自动过一遍

官方把中间那层跃迁叫做「从习惯到契约」——本来是「我每次记得在/simplify后面补跑一次/verify」的个人习惯,串成链之后,就变成了系统级的固定流程。

整条链自己把开发循环走完,只在需要你拍板时才回来找你。链条拉得越长,可靠性越高——但官方也提醒:链式验证会实打实地烧token,正确姿势是先验证稳定性,再逐步升级。

Skill不是提示词,是能力模块

这里要纠正一个常见误解:Skill不是一段Markdown提示词。

它是一个能力模块,里面装着指令、文件结构、脚本、工具调用、配置和一整套工作流程。它把团队的检查步骤、设计规范、踩过的坑,沉淀成一个随叫随到的包。

更关键的是,Skill正在从Claude Code的一个特性,变成跨厂商的开放标准。据业界梳理,GitHub Copilot、Cursor、OpenAI Codex、Gemini CLI都已经采用同一套格式。这意味着你为团队沉淀的Skill,不会被锁死在某一家工具上。

推演:同一个模型,效率差距可达数倍

这引出一个扎心的现实:同一个Claude,不同团队用出来的效率,可能差出好几倍

造成差距的不在模型,而在工作流:

  • 你有没有把检查写成Skill?
  • 有没有搭起验证循环?
  • 有没有让智能体自己把反馈闭环跑通?

智能体的能力是一道加法题:模型 + 工具 + 验证机制 + 工作流程。模型这一项各家越来越接近,真正拉开距离的是后面三项——它们全掌握在用户手里。

落到行动:怎么写你的第一个验证Skill

Anthropic给的方法很简单:

  1. 把你每次都要手动做的那一步,用大白话写下来——就当你在给一个第一天入职的新同事交代注意事项
  2. 如果描述不出来,先让Claude给一版通用最佳实践,再在上面改。你的版本跟通用做法不一样的那几个点,恰恰就是最该被记下来的东西
  3. 检查不一定是模糊判断。比如「任何删掉数据库字段却没配套数据迁移步骤的改动,一律打回」——这是一条通用linter永远抓不到、却是你项目专属的土规矩
  4. 凡是你一直靠手动死盯才守得住的红线,都值得写成一个循环

写完怎么办?丢给skill-creator让它反过来采访你几句,或者干脆往.claude/skills/里扔一个Markdown文件。最简单的验证Skill,就是几行说明加一段正文。

编辑判断

这不是一篇关于「AI已经能独立写软件」的报道——它仍离不开工程师,也没法脱离人去做生产级交付。但方向已经很清楚了:过去我们一直在教AI怎么写代码,现在要开始教它验证自己写得对不对。

等到「下班前还得手动复查一遍」这件事终于能安心交给AI的那天,它才算真正开始替你扛活。

滚动至顶部