Harness 比模型更重要:AI Agent 竞争的真正变量已经换位

副标题:当六个前沿模型在基准上只差 0.8 分,决定成败的不再是权重,而是包裹权重的那个系统。

破题

一个流传极广的假设是:Agent 的能力上限由模型决定。想要更强的自动化?等下一次模型发布。

2026 年的数据把这个假设拆穿了。SWE-bench Verified 上,六个最强的前沿模型——Claude Opus 4.5/4.6、Gemini 3.1 Pro、MiniMax M2.5、GPT-5.4、Sonnet 4.6——的成绩全部挤在 79.6% 到 80.9% 之间,最大差距 0.8 分。这不是接近,这是噪音。

而在同一时期的 SWE-bench Pro 上,同一个 Claude Opus 4.5,放进标准化的 SEAL 脚手架里得 45.9%,放进 Cursor 里得 50.2%,放进 Claude Code 里得 55.4%。分数没换模型,换了壳,差了近 10 分。

模型之间的差距小于一所以不是模型决定结果。是 harness——模型外面那层执行系统。

这就是本文的论点:Agent 性能的第一决定变量已经从模型换到了 harness。这不仅是评测口径问题,它改变了整个行业价值的流向:谁掌握 harness,谁就掌握分发和利润,模型本身正在变成引擎仓里的一个可替换零件。

一、拆解:分数从来不是模型的

先看数据到底在说什么。

同一模型、同一基准,harness 不同,分数差异是系统性的,不是个例:

  • Terminal-Bench 2 上,仅更换 harness,同一模型的 pass@1 从 69.7% 升到 77.0%。
  • 第三方基准监测报告,仅因脚手架不同,GPT-5 在 SWE-bench Verified 上的成绩波动最高 11 个百分点,Kimi K2 Thinking 达 15 个百分点。
  • Holistic Agent Leaderboard(HAL)在同一模型、不同脚手架的条件下记录到接近 48 个百分点的极端摆动。
  • 最戏剧性的案例:Grok Code Fast 在编码基准上从 6.7% 跳到 68.3%——改动只有一处,edit 工具回传给模型的结果格式。没有换权重,没有重训,一个工具输出格式换来 10 倍成绩。

2026 年 5 月的一篇 arXiv 位置论文把这称为「约束条件命题」(Binding Constraint Thesis):在长程任务上,性能方差主要受 harness 配置支配,而现行评测把 harness 带来的提升系统性记到了模型头上。

为什么结构上必然如此?因为 Agent 是一个闭环系统,而模型是开环的。

模型在任何一步都看不到完整状态,它只看到 harness 喂给它的上下文投影;它没有跨步记忆,除非 harness 注入;它没有自我纠错机制,除非 harness 构造反馈回路。稳定性、上下文漂移、纠错延迟——决定长程任务成败的三个量——全部是 harness 的属性。升级模型能降低错误的基线发生率,但错误发生之后系统如何响应,与模型无关。

一句话:开环系统的可靠性从来不靠更大的执行器,靠的是反馈控制。

二、反例检验:是不是模型不重要到可以随便选?

一个诚实的框架必须经得起反例。

模型当然仍重要。同样的 harness(Claude Code)下,Opus 5 在 Terminal-Bench 4.0 上拿 51.8%,Sonnet 5 只有 12.4%——模型差距可以巨大。而且前沿内部 0.8 分的收敛是「前沿内部」的收敛,二线模型与一线之间仍有断层。

所以更准确的表述是分层的:

  • 前沿之内,模型已无差异,harness 是唯一杠杆。
  • 前沿之外,模型仍是门票,但好 harness 能让二线模型越过一线模型。Meta 与哈佛的 Confucius Code Agent 用 Sonnet 4.5——比 Opus 4.5 便宜得多的模型——配自研脚手架,在 SWE-bench Pro 拿 52.7%,反超了 Opus 4.5 跑在 Anthropic 官方脚手架上的 52.0%。

便宜模型 + 好壳,赢贵模型 + 平庸壳。这一条比「前沿收敛」更能说明问题:harness 不仅决定上限,它已经在改写排名。

三、建框架:引擎—整车—赛道

把行业结构画成三层:模型是引擎,harness 是整车,评测与分发是赛道。

引擎层的经济学正在重演一百年的汽车史。引擎曾经是核心竞争力,后来变成了高度商品化的部件——今天没有消费者因为「这台车发动机好 0.8 匹马力」而改变购买决策。用户买的是整车体验:操控、安全、售后。Agent 市场正在走进同一个阶段:六个引擎马力相同,胜负在整车。

而 harness 的护城河比模型更深,原因有三:

1. 迭代成本不对称。改模型需要预训练或后训练,以月计、以千万美元计;改 harness 是普通软件工程,以天计、以工程师薪资计。Grok Code Fast 那次 10 倍提升,成本可能不到一次模型训练的万分之一。

2. 数据闭环在 harness 手里。轨迹数据、错误恢复模式、用户偏好信号,都在 harness 层产生和沉淀。OpenAI Codex 团队三名工程师五个月合出约 1500 个 PR、约百万行代码,靠的不是更强模型,而是把 Agent 锁死在「类型→配置→仓库→服务→运行时→UI」的受控序列里——这些约束全是 harness 层的资产。

3. 切换成本在 harness 侧。模型的 API 是标准的,随时可换;harness 承载着工作流、记忆、权限和团队习惯,这才是用户粘性的真正来源。

由此可以给「Harness 壁垒定律」一个可检验的形式:当模型商品化时,价值向掌握闭环数据与切换成本的层级迁移——Agent 时代,这个层级就是 harness。

四、推演:框架的跨场景验证

这个框架不只解释编码基准。

评测与研究:HAL 的双位数脚手架方差意味着,任何不披露 harness 的 Agent 榜单都在测量一个混合物,却按模型来解读。学界已经开始呼吁披露标准:要么锁定统一 harness,要么把 harness 作为受控因子做方差分解。下一波评测基础设施的投资逻辑随之改变——做「harness 基准」比再做一次模型榜单更有信息量。

企业采购:选型问题从「接哪家模型」变成「跑在哪个 harness 里」。同样的预算,一支团队换到更好的 harness 并保持模型不动,另一支团队追着模型发布升级,前者大概率赢。企业该问厂商的问题不再是「你支持哪些模型」,而是「你的上下文压缩策略、错误恢复路径、验证回路是什么」。

模型厂商的 vertically integration:为什么 Anthropic 死磕 Claude Code、OpenAI 死磕 Codex CLI?因为当引擎商品化,引擎厂商必须自己占住整车位置,否则利润被整车厂抽走。模型发布会的意义正在从「我们的模型更强」滑向「我们的模型配上我们的 harness 更强」——后者才是可卖的完整产品。

开源与地缘:开源权重模型(如 GLM、DeepSeek 系)在模型层追平需要巨量资本,但开源 harness 生态可以把任何开源引擎装进好壳里。Confucius 的结果就是这个路径的证明。模型管制卡住的是引擎,而整车图纸在全球开发者手里。

五、落到行动

  • 如果你在构建 Agent 产品:把工程预算的默认顺序倒过来——先穷尽 harness 优化(并行检索、结构化错误恢复、激进上下文压缩、规划与执行分离、衰减预算重试),模型升级放最后。多数团队的 harness 远未到 frontier 模型榨干的程度。
  • 如果你在企业里做技术选型:用「同模型跨 harness 对比」做评估,别看厂商宣传的绝对分数。要求供应商披露 harness 设计;六个 harness 跑同一个你最关心的真实任务,胜过六个模型跑一个玩具任务。
  • 如果你是研究者:引用任何 Agent 分数时注明 harness;做消融时把 harness 当作与模型同级的因子。你的引用行为在决定激励流向。
  • 如果你在模型厂商:护城河不在下一个 checkpoint。把轨迹数据闭环和 harness 产品线当成一级战略资产,否则你会成为整车产业链上游那个利润最薄的零件商。

结语

「模型是引擎,harness 是整车」不是修辞,是 2026 年基准数据给出的结构判断。引擎层 0.8 分的收敛宣告了权重竞赛的边际收益归零,而 harness 层 10 到 48 分的摆动宣告了新的竞争主场。

下一次有人问你「该用哪个模型」,正确的回答是:先告诉我你打算用什么 harness——因为那才是成绩的决定项。

(注:文内数据截至 2026 年 9 月,来自 SWE-bench、Terminal-Bench 及 HAL 等公开基准的多方公开报告。)

滚动至顶部