赢过贵57倍旗舰的,不是模型,是Harness

AI 圈早就承认一个等式:Model + Harness = Agent。等号左边被反复计量——每次发新模型都配一张榜单;等号右边——模型之外的那半个系统:模型能碰到什么、每轮循环怎么收敛、工具返回什么、状态存在哪里——从来没有一把尺子。

8 月 7 日,Floatboat(AOE Tech Labs)把这半边摆上了榜单。底座用的是市面上最便宜的模型之一 DeepSeek V4 Flash,在五项第三方基准上全面超过了一众海外顶尖模型。其中对 Claude Opus 4.8 的对照最刺眼:单价贵 57.1 倍的旗舰,五项全输。

这不是“便宜模型真香”的老故事。它是一次刻意设计的单变量实验:证明差距在模型之外。

数字

DeepSeek-V4-Flash 官方 API 输入 $0.14/M、输出 $0.28/M,按 Agent 场景 3:1 输入输出比折算,混合价 $0.175/M。对面是 Claude Opus 4.8,$5/$25,混合价 $10/M。五项 Agent 基准(含软件工程、终端任务、工具调用),$0.175 的系统全胜。

最能排除“模型功劳论”的对照组:同一个 DeepSeek-V4-Flash,跑在 DeepSeek 官方自己的 Harness 上,DeepSWE 只有 54.4,低于 Opus 4.8 的 58.0;放到 Floatboat 上,跑到 67.25。Terminal Bench 2.1 上,官方 Harness 与 Opus 4.8 打平(82.7:82.7),其余四项全输。权重没变、单位成本没变,变量只有一个——Harness。

方法学是这份数据的命门:双方统一用 DeepSeek-V4-Flash 0731 底座;DeepSeek 官方公开基准用自家 Harness 极简模式(max 档、top_p=0.95、temperature=1.0);Floatboat 用自家评测 Harness,多数推理仍走 DeepSeek 官方 API;所有任务在完全隔离、开箱即用的环境里执行。

编译器时刻

贴切的类比不是“便宜货追平了”,而是编译器。同样的硅片,同样的指令集——把裸硬件变成真实性能的,是几十年里被反复打磨的工具链。两台相同 CPU 的机器,真实负载下性能可以差出数倍,因为一套工具链成熟、另一套没有。Agent 正在重演这一幕:模型是硅片,Harness 是编译器。没人会说编译器“就是”芯片,也没人该说 Harness“就是”模型——但真实性能的差距,恰恰是这一层决定的。

这份评测的价值不在某家公司赢了,而在这个行业终于有了量右边那半边的尺子。等式大家承认了好几年,评分却一直只报一边。现在 Harness 设计——能碰到什么、工具返回怎么组织、循环怎么收敛、状态存哪——变得可度量、可对比、可优化了。

改变了什么

三件事。

其一,模型价格战被重新定价。如果 $0.175/M 的模型配上好的脚手架就能交付旗舰级 Agent 效果,“用哪个模型”退化成二阶问题,一阶问题是“你在哪个 Harness 里跑它”。还在为旗舰权重烧预算的团队,可能一直在解错误的变量。

其二,Agent 基础设施正式成为竞争维度。Harness 基准、Harness 即产品、Harness 护城河,会像模型榜单一样卷起来。Floatboat 之前的三次发布(Agent 原生桌面工作台、Agent 办公网络、日程驱动的自主 Agent)看似产品创新,底下动的都是同一层底座——现在它把这层底座直接摆出来接受计量。

其三,度量本身就是话语权。谁掌握 Harness 优劣的尺子,谁就定义这个领域往哪优化。完整报告与方法学已在 floatboat.ai/news/harness-benchmark 公开。

可以立刻做的事

  • 搭自己的单变量 Harness 评测:锁死模型、只换脚手架。这一周比一个月挑模型有用。
  • 把 Agent 评测放进 CI,别只看 RAG 准确率:跟踪任务完成率、循环收敛和单任务成本。
  • 换更贵的旗舰前,先把自己的模型放进更强的 Harness 里跑一遍——便宜的杠杆通常更有效。
  • 在做 Agent 产品,就把 Harness 当产品做。那是用户真正感知到的那半边。

结论有点扎心,也很有用:模型之间的差距正在变得越来越便宜地填平,真正的分水岭,发生在 Harness 之间。

滚动至顶部