写代码这件事,AI 已经替你干了。可验收这件事,还压在你身上。
一段代码到底写没写对,AI 不负责,最后还得你一行行看过去。这道坎,卡住了许多人。
7 月 22 日,Anthropic 把这道坎也填上了。
他们让 Claude 写完代码之后不直接交差,而是自己跑四道检查:/code-review 揪 bug,/simplify 清冗余,/verify 做端到端验证,/design 核对视觉实现。四道跑完,才算交付。
这意味着 AI 开始从「会写代码」,进化到「会检查自己写的代码」。
验证循环:智能体闭环的关键一环
Anthropic 给这套东西起的名字叫 验证循环(verification loop)——一个 Claude 检查并尝试修复自己工作的迭代过程。
它改动的,是智能体干活的闭环结构:
- 以前:收集上下文 → 执行动作 → 人工检查
- 现在:收集上下文 → 执行动作 → 自动验证 → 修复 → 再验证
检查和修复被塞回了循环里面,末端才触达到人。
有些检查 Claude 本来就会做。代码库里那些确定性的信号——type checker、linter、测试报错、运行时异常——它读得懂,也会顺手改掉。
真正麻烦的是另一类:界面改得对不对、用户流程顺不顺、这次改动有没有埋下看不见的坑。这些过去只能靠人盯着,同样的检查做上几十上百次。
Anthropic 的解法,是把你每次都要手动做一遍的那些检查,一条条写下来,封装成 Skill,交给 Claude 在每次任务里自动执行。
Claude Code 团队每天在用的 4 个自查 Skill
/code-review——代码评审
专审代码改动,把潜在的 bug 揪出来,顺带给一份 review 意见。等于给自己配了个不知疲倦的审稿人。
/simplify——化繁为简
清理这次改动的 diff,把绕来绕去的复杂实现删掉,让结构变简单。它不给你加功能,而是清掉冗余、简化实现,把日后的维护成本向下压。
多数人写代码都是往上堆,能主动做减法的工具,尤为难得。
/verify——端到端验证
真刀真枪跑一遍,确认功能是真的完成了,而非「看起来完成了」。
/design——视觉核对
只在动了 UI 时上场。它对着仓库里的 DESIGN.md,逐条核对你的视觉实现有没有跑偏。
这 4 个 Skill 不是凭空长出来的。底层,Claude Code 已铺了一层现成的验证支持:内置的 /verify 能把应用跑起来观察变化,你在 CLAUDE.md 里写清楚构建和测试命令,它就照着执行。团队那 4 个 Skill,等于在这层通用地基上又加了一道自己的工序。
怎么写一个自己的验证 Skill?
Anthropic 给的办法很简单:把你每次都要手动做的那一步,用大白话写下来,就当你在给一个第一天入职的新同事交代注意事项。
示范:任何删掉数据库字段、却没配套数据迁移步骤的改动,一律打回。这是一条通用 linter 永远抓不到、却是你项目专属的「土规矩」。
凡是你一直靠手动死盯才守得住的红线,都值得写成一个循环。
写完往 .claude/skills/ 里扔一个 Markdown 文件,最简单的验证 Skill 就是几行说明加一段正文。然后在一个新任务上调一次,确认这步检查真的跟着跑了,不对再改。
验证不是一刀切,它有 4 档自动化
Anthropic 给了从松到紧的4 档自动化程度:
- Standalone(独立)——想起来手动调一下
- Embedded(嵌入)——嵌进某个任务流程,跟着一起跑
- Chained(串联)——好几个验证 Skill 串成一条链,一个接一个自动跑完
- On every PR(提交门禁)——最狠的一档,每次提交代码都自动过一遍
官方管中间那层跃迁,叫「从习惯到契约」。
本来是「我每次都记得在 /simplify 后面补跑一次 /verify」的个人习惯,串成链之后就变成「/simplify 跑完自动就调 /verify」的固定契约。整条链自己把开发循环走完,只在需要你拍板时才回来找你。
链条拉得越长可靠性越高,但官方特意嘱咐了一句:链式验证会实打实地烧 token。正确的姿势是先看它稳不稳,再一步步往上加。
AI 编程正在从「生成」转向「验证」
4 个 Skill 背后,AI 编程的竞争正在换赛道。
Claude Code 之父今年 6 月发推说过:在强大模型能长时间自主运行的时代,自我验证是让模型跑得更久、结果更贴近你预期的关键。验证做得越扎实,智能体才敢放开了跑;跑得越久,人越省心。
过去我们靠提示词,但提示词有天花板:只解决这一次的任务,下次还得从头再来。
这里需要纠正一个常见误解:Skill 不是一段 Markdown 提示词。它是一个能力模块,里面装着指令、文件结构、脚本、工具调用、配置和一整套工作流程,是把团队的检查步骤、设计规范、踩过的坑沉淀成一个随叫随到的包。
更值得注意的是,Skill 正在从 Claude Code 的一个特性变成跨厂商的开放标准。据业界梳理,GitHub Copilot、Cursor、OpenAI Codex、Gemini CLI 都已经采用同一套格式。这意味着你为团队沉淀的那些 Skill,不会被锁死在某一家工具上。
这引出一个扎心的现实:同一个 Claude,不同团队用出来的效率可能差出好几倍。造成这个差距的不在模型,而在于工作流——你有没有把检查写成 Skill,有没有搭起验证循环,有没有让智能体自己把反馈闭环跑通。
智能体的能力就是一道加法题:模型 + 工具 + 验证机制 + 工作流程。模型这一项各家越来越接近,真正拉开距离的是后面那三项,它们全掌握在用户手里。
过去我们一直在教 AI 怎么写代码,现在要开始教它验证自己写得对不对。
等到「下班前还得手动复查一遍」这件事终于能安心交给 AI 的那天,它才算真正开始替你扛活。
