“Claude Code 太费 token 了”——这是过去半年开发者社区里最常见的抱怨之一,但一直没人拿出像样的账本。7 月 29 日,Agent 基础设施公司 Composio 把账算明白了:同一个模型、同一批任务,只因为跑在不同的 agent 框架(harness)里,token 消耗最多能差 30 倍。
这不是一次针对某个产品的吐槽,而是一个信号:当模型能力逐渐趋同、价格被打到白菜价之后,Agent 的成本竞争正在转移到模型外面那层看不见的“壳”上。
一、拆解:三个实验,把账算到骨头里
实验一:Composio 实测——成功率差不多,账单差 6 倍。
Composio 用同一个模型 Kimi K3,分别放进三个 harness——Claude Code、Hermes、Kimi Code——跑 28 个完全相同的任务。结果很有意思:
- 成功率几乎打平:Kimi Code 22/28,Hermes 21/28,Claude Code 20/28;
- token 消耗彻底分家:中位数 Kimi Code 约 6.1 万、Hermes 约 6.7 万、Claude Code 直接飙到 34 万,是 Kimi Code 的 6 倍,个别任务差距高达 30 倍;
- 换算成钱(按 K3 每百万输入 token 3 美元、agent 工作流输入占 95% 计):每个任务平均成本 Kimi Code 0.22 美元、Hermes 0.28 美元、Claude Code 2 美元;
- 速度也不重合:最快的是 Hermes(中位 179 秒),最省 token 的却是 Kimi Code(297 秒),Claude Code 最慢(348 秒)。
也就是说:模型的能力表现几乎一样,harness 本身就把成本拉开了 9 倍。想省钱,先换壳,不用急着换模型。
实验二:Sebastian Raschka 的观察——多出来的全是输入 token。
知名机器学习研究者 Sebastian Raschka 表示,这和他用 Qwen 3.6 做的观察一致:Claude Code 在成功率相近的情况下,token 用量往往是其他 harness 的 2 到 3 倍。他上个月分析过一个具体案例:某次 Claude Code 跑完用了约 57.8 万输入 token,但输出只有约 4500 token,横跨 25 轮。问题不在模型“话多”,而在 harness 在多轮交互中反复把历史消息、工具调用、命令输出、文件内容整段塞回模型——输入端的上下文像滚雪球一样膨胀。
实验三:Writer 的控制变量——只换编排层,成本降 41%。
做企业级 Agent 平台的 Writer 用更严格的方法验证了这一点:固定 22 个企业任务和 6 个基础模型(Claude Sonnet 4.6、Gemini 3.1、Gemini Flash 3.5、Qwen 3.6、GLM 5.1、Palmyra X6),只替换编排层。结果:每任务平均成本降 41%(0.21→0.12 美元),中位延迟缩短 44%,token 消耗减少 38%,而任务完成质量基本持平(0.78→0.81)。每美元成本获得的质量提升高达 82%,每百万 token 能完成的任务数从 54.9 跃升到 92.0。
三个独立实验指向同一个结论:harness 的效率,已经和模型能力一样,成为决定 Agent 经济性的关键变量。
二、建框架:Harness = Agent − Model
“Claude Code 之父”Boris Cherny 给过一个极简公式:Harness = Agent − Model。模型外面那层壳——界面交互、工作流编排、权限治理、记忆、观测——就是 harness。
把今天的三个实验放进这个公式,会得到一个双层图景:
第一层,效率轴:harness 决定你的 token 账单。工具调用、重试、多轮循环一旦进入 loop,成本不是线性增长,而是复利式膨胀——有人已经在呼吁给 benchmark 加上“harness 税”这一项。模型变成“水电煤”之后,harness 就是决定你电费单的空调。
第二层,时间轴:harness 的保质期只有半年。在 7 月 28 日 YC 的访谈中,Boris 抛出了更激进的观点:模型越强,外层壳越薄。他甚至建议做 AI 产品的人“把整个系统提示词全删掉,然后一行一行加回来,看看每一行到底有什么影响”——这正是消融实验(ablation study)的思路。他声称对于 Opus 5,这些脚手架已经基本不需要了。Anthropic 内部有个案例:给 Opus 5 接上 OpenCV,模型自己就画出了人物肖像——没人训练过它画画。这就是“模型激发”(model elicitation):能力本来就在权重里,harness 的作用只是把它放出来,而不是替模型思考。
这两层叠加,指向一个反直觉的结论:harness 很重要,但 harness 不值得你押上护城河。它今天能帮你省 9 倍的钱,明天就可能被模型原生能力吸收、被开源平替抹平。Boris 的另一句话更狠:编程已经解决了,真正的护城河是 Domain——垂直领域的知识、数据和组织方式。
三、推演:Agent 竞赛的三个阶段
把时间线拉长,Agent 产业的竞争重心正在经历三次转移:
- 上半场:模型竞赛。比参数、比基准分、比谁便宜。这一阶段基本结束——开源模型追平闭源,价格战打到每百万 token 几毛钱,模型本身已经很难构成壁垒。
- 中场:harness 竞赛。比编排效率、比 token 经济性、比工具生态。Composio、Writer 的实验就是这场竞赛的信号枪。但注意:这个阶段窗口很短,因为 harness 层门槛不高、迭代极快,Boris 说的“保质期半年”正在应验。
- 下半场:domain 竞赛。比谁手里有垂直数据、比谁的组织能围绕 Agent 重构流程。Agent 协作模式下,产品、设计、数据、财务都能直接写点代码,信息流和决策流被大幅压缩——护城河开始长在组织里,而不是代码里。
对创业者来说,这里有个残酷但清醒的推论:如果你今天的产品价值主要建立在“我们做了一个更好的 harness”上,那么你的窗口期大概只剩半年到一年。把精力投向数据飞轮和行业 know-how,才是在这场成本战争中真正活下来的方式。
四、落到行动:三个立刻能做的事
1. 给自己的工作流做一次消融实验。别信 benchmark,信自己的账本。把系统提示词、工具列表全部删掉,一行一行加回来,记录每一步对成功率、token、延迟的影响。你大概率会发现:80% 的脚手架在最新模型上已经没有正收益。
2. 改用“每任务成本”而不是“每百万 token 单价”来选型。模型单价只是标价,harness 的上下文管理方式才决定实际花费。算账时盯住输入 token 占比和重试率——Agent 工作流里 95% 的 token 是输入,这是最容易漏钱的地方。
3. 给长期运行的任务装上“熔断器”。多 Agent 循环、无人值守的夜间任务,是 harness 税的重灾区:上下文膨胀 + 循环重试会让账单非线性增长。设定 token 预算上限和循环检测,比事后看账单便宜得多。
模型是水电煤,harness 是空调,而真正值钱的是你屋子里装了什么。Agent 的下半场,比的是谁用同样的电,干更多的活。
