一个模型,两次考试,差出 36 个百分点
9 月 3 日,ARC Prize 公布了 ARC-AGI-3 的一组成绩,数据反直觉到值得单独拎出来讲:同一个模型 GPT-6 Astra,同样的推理强度,放进标准 Harness 得分 62.7%,换成 Provider Adapter Harness 得分 98.6%。
注意,这不是两个模型的对比,是同一个模型的两次考试,分差 35.9 个百分点。更反直觉的是成本:得分更高的那一组,花费反而更低,从约 2.61 万美元降到 1.73 万美元,降了约 34%。
几天后,YC 专门办了一场 Paper Club,主题就叫《Why the Harness Matters More Than the Model》。由 YC 的 François Chaubard 主持,请来了 Prime Intellect 的 Seth Karten、斯坦福的 Jon Saad-Falcon,以及 YC 自己的 Josh France 和 Regan Bell。几组人研究方向不同,但盯的是同一件事:模型外面那套东西。
大多数报道会把这当成一次benchmark花絮。但这件事揭示的结构变化要严重得多:AI 竞争的胜负手,正在从「谁的模型更强」转向「谁能把模型更好地组织起来」。模型能力正在变成一种给定条件——条件相同的情况下,Agent 之间还能差出 36 个百分点。这 36 个百分点,就是 Harness 的价值空间,也是接下来最被低估的护城河。
模型决定上限,Harness 决定你能不能摸到上限
Harness 的本义是马具——套在马身上、把马的力量传导到车上的那套装置。放在 AI 语境里,它是大模型完成真实任务时的整套运行框架:系统提示词怎么写、上下文怎么组织、能调用哪些工具、记忆存在哪、子 Agent 怎么分工。一句话:模型决定大脑有多聪明,Harness 决定这个大脑干活时手里有什么。
Chaubard 自己亲历过这种变化。今年 3 月,他在试用 Karpathy 的自动研究项目时,最初只想加个界面看清 Agent 在做什么。结果资料检索、实验、评审、写作、进度管理陆续被接进来——他后来才发现,自己无意中搭出了一套完整 Harness。现在他只需给出研究方向和评价指标,多个 Agent 持续推进,过一阵回来收结果。模型没有更新换代,交付质量却越来越好。
这里有个被轻视已久的背景:改提示词、接工具、套任务循环,在机器学习圈子里长期「不上台面」,甚至有人质疑这算不算真正的 AI 研究。但现在,这个环节直接拉开成绩。
不是模型变弱了,是模型变强之后,剩下的差距全在模型外面。
三层阶梯:从调提示词到改写 Harness 本身
Harness 正在经历一条清晰的优化阶梯,值得记住这三个台阶。
第一层,提示词自动化。DSPy 这类系统自己尝试不同写法,用测试结果挑出最优版本——「调提示词」从手艺活变成了搜索问题。
第二层,修改 Harness 代码本身。Darwin Gödel Machine(DGM)不只调提示词,而是直接改写运行 Agent 的框架代码,再用测试结果判断新版本是否更好。论文实验里,它把 SWE-bench 成绩从 20% 提到 50%——翻了一倍以上,而模型一克重量都没换。
第三层,经验沉淀。Continual Harness 让 Agent 回看过去的任务记录,决定要不要修改提示词、增加技能、更新记忆。过去一次次跑任务留下的教训,开始写进下一版 Harness。
更激进的方向已经出现:让模型在运行中继续学习,把 Agent 刚产生的数据重新用于训练,甚至在测试阶段直接更新权重。这意味着优化的方向正从 Harness 往模型里面走——Harness 和模型之间的边界,正在被打通。
可以给这套阶梯起个名字:组织层套利。当模型能力趋同时,谁先把「组织层」做到位,谁就在同价位的模型上套取出更高的交付水平。它在结构上很像云计算时代的基础设施红利:模型是算力,Harness 是调度层,而利润长期沉淀在调度层。
三个场景验证:从个人本地化到企业运维
这个框架的解释力,在这场分享的三个场景里都能验证。
长周期任务。Prime Intellect 的 Prime Agent 不给模型写死流程,而是做「信息分层」:当前信息进上下文,程序和进度存进常驻 REPL,长期记忆放外部存储。团队让 Agent 连续玩七天《异星工厂》,一共调用 633 个子 Agent、产生超过 2300 万输出 Token,完成 196 项技术中的 24 项。期间发生过一次严重倒退——进度从 5 项技术跌回 1 项——但系统没有清空重来,模型基于保留的状态重新判断路线继续推进。长周期任务的核心不是流程,是状态的连续性。
个人 AI 本地化。斯坦福的 OpenJarvis 想把个人 AI 搬回本地设备,但本地模型和前沿模型有 6—12 个月的能力差距。他们做过一个直白的实验:把 Claude Opus 4.6 换成 Qwen3.5-9B、其他全不动,两项测试准确率分别掉 24.8 和 38.8 个百分点。然后把整个系统拆成五层逐层优化——大模型负责分析失败案例并改配置,小模型负责日常执行。结果 Qwen3.5-9B 一克未改,两项测试分别追回约 56% 和 77% 的损失;八项测试里最好的本地方案平均 80.3%,与 Opus 4.6 的 83.5% 只差 3.2 个百分点,边际 API 成本约为云端的八百分之一。
企业规模化。YC 曾在虚拟机里部署 50 多个 Hermes Agent,每个单独配置、坏了逐个登录排查。他们的内部 Harness「QM」改成:对话和状态集中保存,虚拟机变成按需调用的资源。但规模化暴露了三个更麻烦的问题——Agent 会把局部问题当全局问题(他们称之为「主角综合征」);太容易提前放弃(YC 做了 Grind Tool 设最低运行时间);以及最麻烦的权限:Agent 能看到 Slack 里的所有上下文,却未必理解哪些话不能转述。YC 现在的答案是数据库默认只读、写入需人确认——但人工审核本身也可能退化成形式。
三个场景指向同一个结论:Harness 放大模型已有的能力,而不是凭空创造能力。同一套 Prime Harness,配 Claude Opus 5 得分 95.5%,换成 Terra 只有 25.7%——模型仍是地基,差距产生在地基之上。
你的下一步:把预算从换模型挪到换 Harness
过去两年,行业注意力几乎全押在模型上。接下来,最划算的杠杆在别处。分三种角色给可执行建议:
- 如果你是技术决策者:换模型前先做 Harness 基线审计。用同一个模型跑两套 Harness 对比(就像 ARC-AGI-3 那组数据),如果你的两套差距小于 5 个百分点,说明组织层还没被认真优化过——这通常是最大的免费午餐。
- 如果你是 Agent 开发者:把「信息分层」当成默认架构——上下文只放当前所需,状态进常驻环境,记忆放外部存储。同时给任务设最低预算(Grind Tool 思路),别让 Agent 在第三次尝试后就举手投降。
- 如果你是企业部署方:优先解决权限而不是能力。数据库默认只读、写入需人确认是起点,但要提前设计审核退化的对策——例如对高危操作抽人工复检,而不是全量点「通过」。
- 如果你是创业者:模型层别恋战。组织层套利的窗口期就在当下——当模型能力完全趋同那天,Harness 的差异就是产品的全部差异。
模型决定你能走多快,Harness 决定你能不能一直走下去、走多远。
来源备注:本文事实与数据基于 36氪授权转载之「硅基观察Pro」对 YC Paper Club《Why the Harness Matters More Than the Model》的报道,涉及 ARC Prize 2026 年 9 月 3 日公布的 ARC-AGI-3 成绩、Prime Intellect Prime Agent、斯坦福 OpenJarvis 及 YC 内部 QM Harness 等素材。
