这周的三条独立新闻,指向同一个方向:AI 竞争的重心正在从「模型」转移到「模型周围的那套系统」——Harness。
先看最硬的一条:一个混合价只要 $0.175/M token 的模型,在五个 Agent 基准上全部击败了混合价 $10/M 的旗舰模型(贵 57.1 倍)。而决定胜负的变量,跟模型本身一点关系都没有。
给「从没被量过的右半边」造了一把尺子
行业早就认下这个等式:Model + Harness = Agent。等号左边(模型)每次发版都被反复计量;等号右边——上下文管理、工具调用、沙箱隔离、状态持久化、异常恢复——从来没有一个榜单。8 月 7 日,Floatboat 发布了第一份测量右半边的数据。
实验设计是刻意做成的单一变量:双方用同一个底座 DeepSeek-V4-Flash 0731(官方 API 就能调,输入 $0.14、输出 $0.28,按 3:1 折算混合价 $0.175/M),对面是 $5/$25 的 Claude Opus 4.8。结果 Floatboat 的 Harness 五项全胜,DeepSWE 打到 67.25 : 58.0。
真正的证明藏在更里面一层:同一个 DeepSeek-V4-Flash,跑在 DeepSeek 官方自己的 Harness 上,DeepSWE 只有 54.4——打不过 Opus 4.8。权重没变、单价没变,唯一变的是套在模型外面的系统。换一层 Harness,一个在自己主场都赢不了的便宜模型,瞬间五项全胜。
最有信息量的是增益的分布。按任务长度排序,Harness 带来的增益单调递增:1.9% → 9.6% → 12.6% → 19.9% → 23.6%,没有例外。任务越短,模型说话;任务越长,系统说话。
OpenAI 自己的高管:本地 Harness 两三个月后就过时了
OpenAI 产品兼平台总经理(管着 ChatGPT 和 Codex)的 Thibault Sottiaux 直言:再过 2-3 个月,「Codex 就是个原始工具了」。他的理由是——我们正在用笔记本级的 Harness 去驱动下一代模型,这是「小脚穿大鞋」。三堵物理墙:
- 算力/内存:Agent 并发 20 个子任务(一边跑测试、一边爬数据、一边编译大项目),本地内存、CPU、Docker/VM 沙箱瞬间爆满。
- 不能关机:几小时甚至几天的长任务,要求用户笔记本不关机、不断网、不合盖——工程上反人性。
- 上下文与工具链并行爆炸:支持超长上下文和高并发推理的下一代模型,本地轻量 Harness 根本扛不住大规模并发的上下文压缩与状态同步。
迁移已经在发生:Codex 支持云端异步运行(任务丢进隔离容器自治跑);E2B、Daytona、Fly.io、Modal 这类云端微沙箱可以让 Agent 动态弹起数百个独立环境平行验证;「本地轻指挥、云端重执行」正在成为默认架构。Anthropic 今年 2 月的里程碑是:16 个 Claude 在 2000 个云端 Session 里并行写出了一个 C 语言编译器——1 个架构师 Agent 设计 AST、4 个编码 Agent 分模块、2 个测试 Agent、1 个审计 Agent。主导研究员 Nicholas Carlini 说:「大部分精力都花在为模型打造环境、测试闭环和反馈基础设施上。」不是模型,是 Harness。
$423 的游戏和 $5 的复刻
同一天,还有一记实锤。有人用 Opus 5 + 一条 2000 字的提示词,one-shot 生成了《INK TIDE》——一款美式卡通风格的赛艇竞速游戏,模型、纹理、声音全部由代码生成,成本 $423、6.9 亿 token。那条提示词写得像份需求文档:硬约束、视觉标准、功能需求、开发流程、交付标准,外加明确的子 Agent 分工(水面、卡通渲染、赛艇物理、AI 对手、音频各管一块)对抗「注意力稀释」,还配了一个视觉质检子 Agent——每完成一个模块就截图验收、循环迭代到无话可说。
然后有人用 Codex + GPT-5.6 Sol/Luna 复刻了它,只花 $5(两个提示词、约 5 小时,周额度 20%)。复刻版糙一些,但关键是这个比值:约 85 倍的成本差,靠的不是模型,是 Harness 里的子 Agent 编排、自动质检循环和云端执行。
打个比方:F1 车队不是靠换引擎拿冠军的——场上的引擎都是近乎同规格的。冠军来自底盘、空动套件、维修区团队和遥测。过去十年 AI 是「引擎赛」:谁的模型更大更聪明谁赢。这周的三个信号合起来说明:我们正在进入「底盘时代」。引擎差距每代都在缩小,Harness 差距却很大、可测量、且随任务变长而放大。
这也重新解释了价格战:当 $0.175/M 的模型 + 好 Harness 能打赢 $10/M 的旗舰,「便宜模型」不再是妥协,而是策略。Agent 任务的真实成本在下降,不是因为模型造得更便宜,而是因为外围系统把它们用得更好。
对产业意味着什么
- 竞争从「谁的模型更聪明」转向「谁把模型潜力释放得更彻底」——护城河将长在这里,这对没有几十亿美元训练预算的团队是好消息。
- 本地笔记本 Harness 触顶,云原生 Agent 基础设施(沙箱、编排、状态管理)成为长任务的默认形态,Agent 基础设施会像当年的云基础设施一样整合。
- 基准需要改革:没有 Harness 控制的裸模型分数几乎无意义。单一变量(同模型、换 Harness)才是诚实的尺子,采购方应该这样要求厂商。
- 提示词工程进化为「系统工程」:胜负手已经从巧妙的提示词,变成带明确边界和自动评审循环的多 Agent 工作流。
你现在可以做什么
- 升级旗舰 API 之前,先用强 Harness 试一遍便宜的前沿模型。这周的数据说,你可能用 1/50 的成本拿到旗舰级的 Agent 表现。
- 把长任务迁到云端沙箱(E2B / Daytona / Fly.io / Modal 这类,或厂商自带的云异步),别让笔记本陪跑一整夜。
- 多 Agent 工作流要钉死边界、配质检 Agent:INK TIDE 的提示词和 Anthropic 的编译器是同一个配方——拆得窄、锁文件、对着自动化检查迭代。
- 评估模型时,要 Harness 控制的对照结果。厂商只给裸分,那你真正在买的那一半就是隐形的。
结论:未来两年,杠杆最高的 AI 工作不在模型卡上,在模型周围的一切里。
