核心不是「便宜模型真香」,而是行业终于给 Harness 上了把尺子。
8 月 7 日,Floatboat(AOE Tech Labs)公布了 Floatboat Evaluation Harness 在五项第三方基准上的完整评测。底座用的是市面上最便宜的可用模型 DeepSeek-V4-Flash($0.14/$0.28 每百万 token,按 3:1 输入输出折算混合价约 $0.175/M)。对面是 Claude Opus 4.8($5/$25,混合价 $10/M),贵了 57.1 倍。
结果:五项全胜。
真正的看点不在价格,而在「Model + Harness = Agent」这个大家都承认的等式里:左半边每次发布都带一张榜,右半边——模型能碰到什么、每一轮循环怎么收敛、工具返回什么、状态存在哪里——从来没有一把尺子。这次是第一次有人给右半边报价。
单一变量:唯一变的只有 Harness
方法学是整件事成立的关键。两边用同一个模型底座(DeepSeek-V4-Flash 0731 正式版),唯一区别是 Harness。对照组甚至不是「裸 API」,而是 DeepSeek 自家官方 Harness:DeepSWE 只有 54.4,低于 Opus 4.8 的 58.0;接上 Floatboat 后,同一个模型跑到 67.25。Terminal Bench 2.1 上,DeepSeek 官方 Harness 与 Opus 4.8 打平(82.7:82.7),其余四项全输;Floatboat 五项全赢。模型权重没变、单位成本没变,变量只有一个。
两处细节说明他们刻意把证明条件做难了:一是用 0731 正式版而非 Preview——用 Preview 的话 DeepSWE 是 7.3→67.25(+821%),数字好看得多,但混进了模型自身的后训练,归不到 Harness 头上;二是故意选最便宜的模型——顶级模型跑顶级 Harness 会得到「高分+归因不清」,锁死最便宜底座,差值就只能落在 Harness 上。
像只量引擎马力、却不管整台车
过去两年行业像在只量引擎的马力。模型是引擎,Harness 是变速箱、悬架和驾驶辅助——上下文管道、工具返回整形、循环收敛、状态管理,Agent 级的真实性能其实是在这里被造出来的。这份数据说:$0.175 的引擎加上对的底盘,可以抹平甚至反超 $10 的引擎。
对产业的三点推演
1. 竞争单位从模型转向系统。 买家现在可以用 1/57 的 token 成本拿到旗舰级 Agent 表现,「能干活的太贵、敢放开用的干不动活」这个交换被工程取消了。
2. 护城河移到 Harness。 过去两年所有人卷权重,这是第一个信号:差异化住在了系统层,而且它开始变得可计量。Harness 质量会像今天的模型质量一样,成为采购标准。
3. 模型厂在商品化层被挤压。 当 $0.175+好 Harness 能打赢 $10 旗舰,「旗舰更贵」就得拿出别的理由来支撑。
给开发者的行动建议
- 别默认旗舰模型就是 Agent 最优解,先在自己栈上跑 Harness 级评测(DeepSWE、Terminal Bench 等)再决定付不付溢价。
- 把 Harness 当一等公民而不是管道——它是等式里现在可计量的那一半。
- 采购层面:便宜模型+强 Harness 从「妥协」变成了「合理架构」。
一句话:模型竞赛不是全部竞赛,另一半终于有尺子了。
