AI 自己出题自己练,两个月涨 11% 反超 Opus 4.8?先看谁在测

训练一个会写代码的模型,最贵的已经不是显卡,而是题目。光有题和答案不够,还得配一套能跑的环境、一份判得了对错的测试,还得防着模型翻旧提交抄答案。难度也不能瞎给:太简单什么都学不到,太难一道都不会做、攒不下正确轨迹,等于白烧一轮算力。过去这活一直靠人干——慢、贵、还供不上。

这个月,开源模型团队 Ornith 把「出题」这件事交还给了模型自己:模型自己生成训练任务、自己搭解题脚手架、自己跑解题轨迹,三段一起丢进强化学习。

发生了什么

今年 8 月,Ornith 一口气放出 397B MoE、35B MoE 和 9B Dense 三档权重,全部 MIT 许可。训练流程里多了一个前所未有的环节:模型自己生成训练任务,自己搭解题脚手架,自己跑解题轨迹,三段一起丢进强化学习——出题这件事,从人手里交还给了模型。

数字涨得很快。Terminal-Bench 2.1 上,两个月前 1.0 是 77.5,这次的 397B 跑到 86.1,涨了 8.6 个点(约 11%)。同一张表里,Ornith 给出 Claude Opus 4.8 的成绩是 85.0——一个随便下载的 MIT 权重,排到了闭源旗舰前面。版本号也很有意思:1.0 学「怎么解」,1.5 学「练什么」,后者才是原来人做的瓶颈。

核验缺口

但故事在这里分岔。86.1 是自报数字:Ornith 在自己环境、自己配置下跑出来的,官网注明取五次独立运行的平均值。Terminal-Bench 2.1 另有一张官方核验榜单,每条结果由榜单团队亲自复跑核验后才挂上去。截至 8 月 19 日共 17 项,里面没有 Ornith-1.5。同一个 Opus 4.8,官方核验是 78.9%、排第 5(榜首是 Claude Code + Fable 5 的 83.8%),Ornith 表里却是 85.0——同一模型,两张表差 6.1 分。

原因在于智能体基准测的是组合:模型 + 脚手架 + 超时 + 上下文 + 资源配置。换一套配置,分数的含义就变了,所以官方榜单明令禁止改超时和资源配置。这个「谁来核验」的问题,本周在另一个战场也出现了——AI 用近百万行 Lean 代码核验数学证明,验证者的身份正在成为能力的组成部分。

为什么这是信号

这件事底下藏着两个结构变化。第一,数据墙开始「自助」了:训练最稀缺的输入,正从人工标注数据转向算力加验证器质量。模型能自己生成课程,开源团队就能绕开人工标注的供给瓶颈,把 AlphaGo 的自对弈原则搬进最卷的编码榜单——这也和本周算力集中度上升的判断互为印证,最终拼的是算力与验证闭环的复合能力。第二,榜单可信度本身成了战场:自报分和核验分能差 6 分,「谁测的、用什么配置测的」就不再是脚注——官方核验榜单正在变成真正的硬通货。

怎么做

落到行动上:选型先看官方核验榜而不是厂商表格,追问任何分数的脚手架与配置;买前要求在你自己的环境复跑;做训练的话,自生成课程已被验证为可复制的数据工程范式,护城河正从题库存量转向验证器与评测环境的质量。

结论不是「开源赢了」,也不是「数字是假的」,而是:AI 开始自己生产训练材料了,而行业的度量体系正在追赶这个事实。

发表评论

滚动至顶部