Opus 5 通关 ARC-AGI-3:模型越强,harness 就该越简单

同一套权重,从 30.2% 到 96.2%

ARC Prize 官方给 Opus 5 在 ARC-AGI-3 上的成绩是 30.2%,排行榜第一,几乎是第二名 GPT-5.6 Sol(7.8%)的四倍。

但开发者 Jeremy Berman 在 X 上晒出了另一组数字:25 个公开关卡,单次通关 24 关,正确率从 30.2% 飙到 96.2%;每关给两次机会更是达到 99.3%,25 关几乎一关不漏。

模型没换,权重没动,中间只隔了一台电脑。

一台电脑,剩下的它自己想办法

Berman 的做法简单到离谱:一个 Claude Code 环境、一个动作命令、一份文件系统日志(记录到目前为止发生了什么)。没有精心设计的提示词,没有针对 ARC 写的专用代码。

剩下的,全部交给 Opus 5 自己摸索——自己摸清规则、自己造出需要的工具、自己把关卡一关一关打通,从零开始,打完就扔。

ARC-AGI-3 的刁钻之处在于:每一关都是现场造出来的迷你游戏,模型不可能靠训练数据找到答案,只能现场推理。今年 3 月发布时,最强 AI 只考了 0.37%,而人类通关率是 100%。

这一轮跑下来,Opus 5 现场写了 269 个程序、接近 1.27 万行代码:25 个游戏全部写了解析器,23 个配了搜索函数,9 个直接写出了能跑的游戏模拟器。一关一套定制工具,用完即弃,下一关重新来过。

反直觉的地方在于:模型停下来先写一堆程序,账单反而比硬解每一关更低——因为代码能复用,推理逻辑被压进函数,一次可以跑上千次。全程沙箱断网,总成本只有 540 美元,整套代码已开源到 GitHub(仓库名 arc-code)。

对照组:同一套壳子,别的模型呢?

Berman 把同一套程序原封不动换给 Codex 和 GPT-5.6 Sol(xhigh)又跑了一遍:成绩 73.7%,动作数是 Opus 的三倍左右。25 次会话里,Sol 有 7 次试图逃出沙箱上网找答案,Opus 5 是 0 次。沙箱是断网的——Sol 那 7 次逃逸,相当于在考场里疯狂找场外援助。

脚手架正在变成绳子

同一个模型,分数怎么从 30 跳到 96?四个字:环境变了。官方把模型摁在椅子上,看一道题答一道题,不许动手;Berman 换了个考法:给你一台电脑,能写代码、能存文件、能反复试。

模型还是那个模型,权重没动,但从「只能动嘴」变成了「能动手」,于是现场给自己造考试工具。66 分的差距,全部来自一件事:你让不让它动手

Berman 结尾那句话值得整个 Agent 圈子思考:「模型越强,harness 就该越简单。」harness 就是人给模型搭的脚手架——提示词模板、工具链、流程规则、防呆机制。过去两三年,所有人都在研究怎么搭更精巧的架子,斯坦福甚至专门出了篇《Meta-Harness》论文(我们之前也写过 harness 实操指南)研究怎么优化这些架子。

但他证明了:当模型足够强时,最好的脚手架就是没有脚手架。一台电脑、一个动作接口、一本日记,三样东西比任何精心设计的提示词工程都好使。根因在于:那些精心设计的工具链和流程规则,本质上是人在替模型做决策——你预设它需要解析器,它可能更需要模拟器;你预设了搜索接口,它可能想用完全不同的策略。

架子本意是帮忙,但当模型自己能造出解题需要的一切时,架子反倒成了绳子。

对 Agent 开发意味着什么

趋势还在继续:随着模型能力增强,「简单环境+强模型」碾压「复杂架子+同一个模型」的案例只会越来越多。Prompt Engineering、工具编排、Agent 框架这些手艺的保质期,可能比想象中短得多。预算更应该花在给模型自由的环境上:沙箱、日志、验证闭环。

ASI 的进度条或许不在参数量上,不在训练数据上,甚至不在模型架构上——它在我们敢给模型多大的自由里。

发表评论

滚动至顶部