同一个模型,两次考试,差出 36 个百分点
9 月 3 日,ARC Prize 公布了 ARC-AGI-3 的一组新成绩:同一个模型 GPT-6 Astra,同样的推理强度,放进两套不同的 Harness,得分一个是 62.7%,一个是 98.6%。
更反直觉的是成本:得分更高的那一组,花费反而从约 2.61 万美元降到 1.73 万美元,降了约 34%。
大脑没换,只是换了工作方式,Agent 几乎变成了另一个水平。
几天后,YC 专门办了一场 Paper Club,主题就叫《Why the Harness Matters More Than the Model》。一场分享下来,基本结论只有一句:AI 竞争的胜负手,正在从「谁的模型更强」,转向「谁能把模型更好地组织起来」。
过去两年,行业的注意力几乎全押在模型上。这个共识可能正在失效——差距会越来越多地产生在模型之外。
Harness 是什么,为什么被轻视了这么多年
Harness 本义是「马具」——把马的力量传导到车上的那套装置。放在 AI 语境里,它是大模型完成真实任务时外面那一整套运行框架:系统提示词怎么写、上下文怎么组织、能调用哪些工具、记忆存在哪、子 Agent 怎么分工、会话怎么管理。
一个朴素的区分:模型决定「大脑有多聪明」,Harness 决定「这个大脑干活时手里有什么」。
这类工作过去在机器学习圈子里一直不上台面。改提示词、接工具、套任务循环,听起来像工程优化而不是模型研究。但现在,这个被轻视的环节已经能直接拉开成绩——上文那 35.9 个百分点,就是它的价值空间。
YC 合伙人 François Chaubard 的经历是个注脚。今年 3 月他试用 Karpathy 的自动研究项目,最初只想加个界面看清 Agent 在做什么,结果资料检索、实验、评审、写作、进度管理陆续被接进来——他后来才发现,自己无意中搭出了完整的 Harness。模型没有更新换代,但 Agent 交付的论文质量越来越好。
一句话:模型决定上限,Harness 决定你能不能摸到这个上限。
更值得注意的,是 Harness 和模型的边界正在被打通。DSPy 把调提示词从手艺活变成搜索问题;Darwin Gödel Machine 直接修改 Harness 代码,把 SWE-bench 成绩从 20% 提到 50%;Continual Harness 让历史任务经验沉淀进下一版 Harness。优化的方向,正从 Harness 往模型里面走——Agent 的进步,开始依赖 Harness 的迭代。
框架:Agent 差距的三层结构
把这场分享里散落的证据摆到一起,可以看到 Agent 能力差距其实分三层,越往外越容易被忽视:
第一层:模型本身。它决定上限,但在前沿模型之间,这层的差距正在收窄,且越来越像「给定条件」。
第二层:单 Agent 的工作方式。上下文怎么分层、工具怎么组织、记忆放在哪。Prime Intellect 的 Prime Agent 是典型:不把流程写死,而是做「信息分层」——当前信息进上下文,程序和进度存进持续运行的 REPL,长期记忆放外部存储按需取用。
第三层:一群 Agent 的组织方式。部署、状态管理、权限。这一层在 Agent 进企业后才暴露,也是现在最缺答案的一层。
一个重要的限定:Harness 放大模型已有的能力,不凭空创造能力。在 ARC-AGI-3 上,Prime 搭配 Claude Opus 5 的 RHAE 得分 95.5%,换成 Terra 只剩 25.7%——同一套 Harness,底层模型不同,仍能差出近 70 个百分点。模型仍是地基。
换句话说,过去被视为「调参杂活」的那套东西,现在有了自己的产业位置。模型厂商继续往上堆能力,而围绕模型的组织层——提示词工程、上下文管理、工具编排、多 Agent 调度——正在变成独立的竞争力。这不是新故事:云计算时代,卖服务器的和做编排的(Kubernetes)是两家公司;移动时代,做出芯片的和做好系统的分成两层。AI 正在复制同一个分层过程,只是这一层直到最近才被 ARC-AGI-3 的成绩单第一次量化出来。
框架放到三个场景里检验
长周期任务。Prime 团队让 Agent 连续玩七天《异星工厂》:共调用 633 个子 Agent,产出超 2300 万输出 token,完成 196 项技术中的 24 项。中途发生过一次严重失误,进度从 5 项技术倒退到 1 项,但系统没有清空重来——状态和记录都在,模型基于新局面重新决策继续推进。对长周期任务来说,模型负责根据当前结果决定下一步,Harness 负责让这些决定可以连续发生。
个人 AI 本地化。斯坦福的 OpenJarvis 实验很直接:把 Hermes Agent 用的 Claude Opus 4.6 换成 Qwen3.5-9B,其他不动,两项测试准确率分别掉 24.8 和 38.8 个百分点。然后只优化模型外面那五层(模型选择、运行方式、Agent 工作方式、工具与记忆、持续学习),性能损失分别追回约 56% 和 77%。八项测试里最好的本地方案平均 80.3%,与 Opus 4.6 的 83.5% 只差 3.2 个百分点,其中四项已追平或反超;边际成本约为云端的八百分之一。小模型不够强,可以先用 Harness 补。
企业场景。YC 曾在虚拟机里部署 50 多个 Hermes Agent,每个单独配置,出了故障逐个排查,维护成本立刻失控。他们的内部 Harness「QM」把对话和状态集中保存,虚拟机变成按需调用的资源。但规模化后暴露的三个问题更有信息量:Agent 会把局部问题当全局问题(「主角综合征」);太容易提前放弃(YC 用 Grind Tool 设最低运行预算兜住);权限最难办——数据库默认只读、写入需人确认,但随着信任加深,人工审核本身会退化成形式。企业 Agent 下一阶段要补的,不是更多能力,而是能管住权限和状态的那层 Harness。
如果你在做 AI 产品或管理团队
这个框架落到行动上,不同角色该抓的点不一样:
- 技术决策者:选型时把 Harness 质量和模型分数放在一起评估。同一个模型在不同 Harness 下能差 36 个百分点,只比模型跑分等于漏掉了最大的变量。也别急着为长任务换更强的模型——先检查上下文管理和状态保存是不是瓶颈。
- Agent 开发者:控制欲收敛一点。模型越强,越不该把每一步流程写死;把资源准备好(分层信息、持续 REPL、外部记忆),让模型自己决定路径。同时给失败兜底:最低运行预算比「重试三次」更能对抗提前放弃。
- 团队管理者:不要把「权限」留到出事之后。Agent 进 Slack、进数据库之前,先定只读边界和写入确认流程,并默认人工审核会退化——设计成不依赖人一直警觉的机制。
- 成本敏感的用户:本地小模型 + 好 Harness,可能已经比「云端大模型裸跑」更接近可用的性价比解。差距未必等到模型追平才消失。
过去两年大家比的是谁的地基更深。接下来两年,差距会出现在地基之上——模型决定你能走多快,Harness 决定你能走多远。
来源备注:ARC Prize ARC-AGI-3 成绩、YC Paper Club《Why the Harness Matters More Than the Model》、Prime Intellect(Prime Agent/RHAE)、斯坦福 OpenJarvis、YC 内部 QM 等素材综合自 36 氪编译报道《YC最新判断:Harness比模型更重要》。
