Anthropic 删掉了 Claude Code 80% 的系统提示词。
这不是一个优化。这是一个信号。
Tariq Shihipar,Anthropic 的技术团队成员,在最近的演讲中解释了原因:新模型 Fable 5 "想要更小的系统提示词",示例"反而会限制它,因为它实际上比我们给出的示例更有想象力"。
翻译一下:过去两年积累的 prompt 工程智慧,在更强的模型面前,正在从竞争力变成负债。
一、Prompt 债:堆得越多,欠得越多
过去一两年,AI Coding 圈形成了一套惯性思维:上下文越大越好,工具说明越多越好,system prompt 越完整越好。
模型不知道项目怎么组织?写 Agents.md。模型不知道工具怎么用?写 tool descriptions。模型不够主动?写行为引导。模型不够稳定?继续往 system prompt 里加约束。
每一次增加都有理由。Cursor 曾花大量时间做 system prompt 的 A/B 测试,针对不同模型微调提示方式,benchmark 提升高达 10% 到 30%。差别核心往往就是那几段 prompt。
但问题在于:prompt 不是免费的。
Claude Code 把所有工具和功能内置进去之后,system prompt 一度膨胀到 65,000 个 token;即便关闭大部分功能,也还有 12,000 个 token。模型还没开始写一行代码,就已经背上了一本说明书。
对比来看,Pi(一个轻量级 coding agent)启动时上下文不到一千个 token。
更麻烦的是,prompt 债比代码债更隐蔽。代码老了,会在改功能、跑测试、处理 bug 时暴露出来。Prompt 老了,却只是让模型悄悄变差。用户看到的是"Claude Code 最近好像不如以前聪明了",但真实原因可能是旧的 system prompt 没有跟上新模型。
当 prompt 从竞争力变成负担时,删掉 80% 不是激进,是理性。
二、Token 末日:从炫耀到恐慌
今年三四月份,大家还在炫耀自己用了多少 token,甚至把它当成一种排行榜。
几个月后,业界有了一个新词:Token Apocalypse(Token 末日)。
转变来得很快。原因很简单:账单到了。
Anthropic 自家公司花在算力上的钱,已经达到其薪资支出的 2.3 倍。按照一名高级工程师 22.4 万美元的完全成本来算,Anthropic 每位工程师每年对应的算力支出约为 51.5 万美元。
人还没模型贵。
这不是 Anthropic 独有的问题。亚马逊、Adobe、Atlassian、花旗集团已经开始对 AI 使用实施严格管控:限制模型等级、设定个人限额、甚至彻底停用权限。Uber 为每位工程师每月设定了 1500 美元的 token 上限。Walmart 最近也停止了一些工具的使用。
员工收到的信息极其矛盾:一边是"AI 能让你效率翻 100 倍,必须用",一边是"别再把公司用破产了"。
这个矛盾背后,是一个更根本的设计哲学分歧。
三、两条路线:烧 token 换体验 vs 省 token 换利润
Claude Code 本质上不是一个效率工具。它是一个营销工具。
它的设计目标很明确:让你感觉自己在高产。Boris,Claude Code 的项目负责人,在做这个产品时最初的思考是:"如果模型变得足够聪明,代码会变成什么样?"——出发点不是"如何帮开发者省 token",而是"如何展示模型的聪明"。
五分钟花掉 200 美元,对 Claude Code 来说不是事故,是设计。所有 sub-agent、所有花哨的 UI 动画、所有冗长的 reasoning trace,都不是为了效率,而是为了让你盯着屏幕时,觉得"这模型真聪明"。
这背后是一个精心设计的营销闭环:你烧掉大量 token,换来"高产"的感觉,于是觉得 Claude 好用,然后继续用它。
而 OpenAI 走的是完全相反的路。
OpenAI 一直在拼命压 token。从 reasoning trace 的压缩,到模型本身的效率优化,它们的哲学是:用更少的 token,干同样的活。Codex 5.5 是最好的例子——GPT-5.5 medium 只用了 2 万个 token,就拿到了惊人的 benchmark 分数;而 Opus 4.8 用了 5 万个 token,得分反而更低。
更极端的例子藏在 reasoning trace 里。泄露出来的 OpenAI 内部推理内容不像普通英语,更像压缩过的工程速记:
"Use core new nodes. Need infer. Need add VAE encode for images. Try. Try period."
这些句子看起来好笑,但重点不在可读性,在 token 效率。模型在内部推理时,不需要保持礼貌、完整和流畅。它只需要保留动作、对象、判断和下一步。
压缩 reasoning token 的收益更大,因为 agent 是多步执行的,前一步的思考会变成后一步的输入。模型每少"想"一段,省下来的就不只是当下这几个 token,而是后面整条执行链上的重复开销。
这就是两条路线最直接的写照:Claude 在烧,OpenAI 在省。
一个值得品味的细节:如果 Anthropic 修复了"废话太多"这个问题,它们的收入会明显下降。如果开发者可以用模型完成同样的工作,但生成的 token 更少,那就是它们赚不到的钱。
四、Caveman 效应:当用户自己动手省 token
今年有一个叫 Caveman 的插件迅速走红。
它的名字直译是"穴居人",意思是像原始人一样说话——不讲礼貌,不加多余语法,不放填充词,只保留核心意思。
"Caveman save you token, save you money. Star cost zero."
乍一看像个玩笑。但它解决的是 LLM 里一个非常真实的问题:废话太多、token 太多、成本也不必要地变高。
Caveman 的创建者 Julius Brussee 说:"我是在 4 月初做出 Caveman 的,因为那段时间我重度使用 Claude Code,并且注意到我的很多 token 花费都浪费在了不必要的文字上:寒暄、模糊措辞、过渡语。"
Brussee 的评测显示,Caveman 相比默认输出能减少 65% 到 75% 的输出 token。
更有意思的是,OpenAI 的工程总监 Shayne Sweeney 也为该项目贡献了代码。
当用户开始自己动手省 token 时,说明行业已经过了"只要好用,多贵都行"的阶段。
五、落到行动:三个角色的不同选择
这个转折对不同的人意味着不同的事。
如果你是 AI 工具的产品经理: 停止把"烧 token 换体验"当作默认设计哲学。下一个竞争维度不是模型有多聪明,而是同样的聪明用多少 token 实现。Anthropic 砍掉 80% 的 prompt 只是一个开始——接下来每个 AI 产品都要过一遍"token 审计"。
如果你是开发者: 别再往 system prompt 里堆规则了。模型越强,prompt 越应该轻。检查你的 CLAUDE.md、你的 agent 配置、你的 tool descriptions——哪些是真的必要的,哪些是"以防万一"加上去的?后者正在悄悄吃掉你的 token 预算。
如果你是 AI 公司的决策者: 注意一个结构性信号——当 Anthropic 自己都在砍 prompt、OpenAI 在压 reasoning trace、用户在用 Caveman 省 token,说明 AI 行业正在从"能力竞赛"进入"效率竞赛"阶段。下一个赢家不是模型最强的公司,而是 "每单位智能成本最低" 的公司。
参考来源:InfoQ《Claude Code 80%的提示词说删就删》、The Decoder、Caveman 项目文档、Anthropic 官方公告
