上周,Anthropic 做了一件看着很小、实际上很大的事:把 Fable 5 重新放了出来,然后把 Claude Tag 接入了 Slack。
两件事放在一起看,就不是一个小更新了。
Fable 5 在 6 月 9 日首次发布,6 月 12 日就因出口管制被叫停,直到 7 月 1 日才重新解禁。而 Claude Tag 是 6 月 23 日悄悄上线的,Anthropic 甚至没怎么宣传——只是在自己的 Slack 里用了几天,发现团队 65% 的代码已经由它生成,才决定对外发。
但真正的信号不是这些数字。真正的信号是 Boris Cherny——Claude Code 的创造者——在官方视频里随口说的一句话:
"现在我每天做的事,就是看 PR 一个个提上来,看数据一份份发过来。"
两年前,他在用输入联想(typeahead)写代码。AI 帮你补半行,落笔的决定权还在你手上。
今天,他手上跑着几十个 Claude Tag 会话,有的已经连着跑了几周。方向盘直接递到了 AI 手里。
这不是渐进式的改进。这是软件工程的"驾驶权交接"——从"AI 辅助人写代码",变成了"人验收 AI 写的代码"。
一、"65%"背后的三层产品架构
Anthropic 这次放出来的,不是一个产品,是三件东西拼成的一个系统。
Claude Code 是那个埋头干活的老师傅。它管的是改代码——读懂你的代码库、编辑文件、修 bug、跑测试。你把代码库丢给它,它闷声不响就改好了。
Claude Tag 是群里那个揽活的工头。你在 Slack 里 @ 一下它,说清要什么,它就把任务拆成几个阶段,一段一段往下推。干完,在 Slack 线程里回你一句它办成了啥。
Fable 5 是真正的发动机。它管的是"能扛多重的活"。在 Claude Code 和 Claude Tag 的框架里,Fable 5 能连着跑好几天——自己排布阶段,忙不过来就把子任务甩给子智能体,末了还回头检查自己干过的事。
这三个东西凑一块,等于一个人有了一支 AI 小队。
Anthropic 内部版 Claude Tag 已经为产品团队写出了 65% 的代码。Boris 说这个比例还会持续攀升。
请注意,"65% 的代码"不等于"65% 的 PR 自主完成"。代码写出来了,要不要合进主分支,决定权还在人手上。但问题恰恰就在这里——当 AI 一天能提十几个 PR,你还有时间逐个审查吗?
二、PR 成了新的交付单位
过去,给 AI 派活的最小单位是一个函数。"帮我写一个排序算法"、"帮我修这个 bug"。
后来,变成了一个功能模块。"帮我加一个用户登录页面"。
现在,最小单位是 一个 PR。
Boris 描述他的日常:谁报了个 bug,按钮偏了几像素,他一句"帮我修一下"就甩过去;碰上个数据问题,扔给 Tag 先跑一遍。而那些跑了好几天的会话,本质是一个长期实验:Tag 每天替他查数据,偶尔冒个 bug 就顺手发个修复,PR 自己就一个个提上来了。
注意这个变化的关键点:AI 提上来的 PR,终究要有人点下 merge。把分支上的代码合进主分支,相当于给这份代码盖章放行。
所以在 Claude Tag 的世界里,"写代码"的门槛在降,"验收代码"的门槛在升。
给 AI 派活之前,你得先想清楚:你要什么?验收标准是什么?边界在哪里?怎么知道自己没被 AI 带偏?
这就引出了一个更深层的问题。
三、"验收者":一个新的工程师能力模型
Fable 5 按最新的 METR 评估,自主任务时长已经爬到 16 小时这条线附近,甚至进入了"连它到底能跑多久都测不准"的区间。16 小时是什么概念?一个工程师的完整工作日,AI 自己从头跑到尾,不需要你盯着。
Anthropic 还披露了一个细节,解释了为什么 Fable 5 能跑这么久。
长期运行的 AI 智能体最大的坎,是它只能分段干活,每开一个新会话都失忆——就像一个工程项目轮班倒,每个新来的工程师都不记得上一班干了啥。Anthropic 的解法是给它配一套"班组交接"机制:一个初始化智能体先搭好环境,写好进度文件和功能清单。后面每个编码智能体只干一件事,干完把进度提交到 git、写清楚交接说明,再交给下一班。
这个机制的背后是一个重要的认知:Fable 5 能跑 16 小时,不是模型的功劳,是"模型+框架+工具链"的系统能力。
而人在这个系统里的角色,也从"生产者"变成了"验收者"——或者更准确地说,变成了"系统设计师"。你要设计的是:任务怎么切、标准怎么定、AI 产出怎么评估、出了问题怎么回滚。
Boris 在 Lenny's Podcast 上说得更直白:
"最能考验候选人能力的,不再是 Leetcode 题,甚至不是系统设计题。而是:他能不能快速理解自己所处的环境,识别值得解决的问题,并在约束下解决它们。"
换句话说,未来最重要的技能,不是"写代码",是"发现问题并分配资源"。
四、这不是 Anthropic 的故事,是整个行业的方向
把视野拉宽一点,Anthropic 的三层架构并不是孤例。
几乎同时期,OpenAI 也在把 Codex 和 ChatGPT 合并成一个"超级应用"。Andrew(OpenAI 的 Codex 负责人)在 Lenny's Podcast 上提出了一个概念叫"Home Base"——一个用户可以在这里开始工作、结束工作、把工作自动化、需要用什么工具就去调用什么工具的"大本营"。
他的团队发现了一个有趣的信号:Codex 最早是命令行开发者工具,但市场、公关、财务、法务部门的人也在用它——尽管界面里全是代码,对他们极不友好。这些人宁愿忍受一个为开发者设计的工具,也不愿意去用那些"专门为他们打造"的应用。
说明什么?说明开发者工具和通用知识工具之间的边界正在坍塌。
再看另一个方向。OpenMontage——一个在 GitHub 上狂揽 15.4k stars 的开源项目——本质上做的是同一件事:把视频制作的 52 个工具模块、12 条流水线、400+ 可组合技能,打包成一个由 Agent 驱动的生产系统。用户说一句需求,脚本、素材、配音、字幕、剪辑全自动完成。一条视频的制作成本约 0.69 美元。
三个看似完全不同的产品——Anthropic 的 Claude Tag、OpenAI 的 Codex 超级应用、OpenMontage——指向的是同一个结构变化:AI 正在从"帮你做一件事的工具"变成"替你管一整条生产线的系统"。
而人在这个系统里的位置,正在从流水线上的操作工,变成生产线的设计师和质检员。
五、三类人的行动指南
如果你是工程师:不要把时间花在跟 AI 比写代码上。
AI 写代码的速度会继续指数级增长。你真正的竞争力不在于"我写得比 AI 好",而在于"我能判断它写得对不对、好不好、该不该合"。培养自己的验收能力——代码审查、架构评估、风险判断——这些才是未来十年越来越值钱的技能。
如果你是技术管理者:停止问"AI 能替掉多少人",开始问"我的团队怎么把 AI 用起来"。
Anthropic 的产品团队 65% 的代码由 AI 生成,不是因为他们裁掉了 65% 的人,而是因为他们把人从重复劳动中解放出来,去干更高价值的事——架构设计、产品判断、策略思考。重新设计团队的 workflow,让 AI 成为团队的编外成员,而不是替代品。
如果你是创业者:关注"验收"这个新 bottleneck。
当 AI 能一天产出几十个 PR,谁来做验收?这是一个巨大的空白。在 AI 编程工具爆发的同时,AI 代码审查、AI 质量评估、AI 风险控制这些领域才刚刚起步。谁能帮团队管好"AI 生产线的质检关",谁就抓住了下一波机会。
Fable 5 重新上线那天,Boris 在内部说了一句话,大意是:"过去我们说 AI 写代码,现在我们得开始思考——代码被写出来以后,谁来对代码负责。"
这可能是 2026 年下半年,软件工程领域最重要的问题。
来源:
