本月 Ornith 一口气放出 397B MoE、35B-A3B、9B 三档开源权重(MIT 协议),训练流程里多了一环此前任何公开模型都没有的环节:模型自己生成训练题、自己搭解题脚手架、自己跑解题轨迹,三段一起进强化学习。自测 Terminal-Bench 2.1 从 6 月的 77.5 涨到 86.1(两个月 +8.6 分),同一张表里他们给 Claude Opus 4.8 测的是 85.0。这个数字要带着问号看,但背后的机制——把「训练数据」这道最贵的工序搬进 RL 闭环——才是真正的信号:下一场开源与闭源的竞赛,战场在题库。
最贵的不是显卡,是训练题
训练一个能干活的编码/Agent 模型,成本大头往往不是算力,而是题目:要一套跑得起来的环境、一个判得了对错的判分器、还得防着模型翻旧提交抄答案;难度要正好卡在「差一口气」——太简单学不到东西,太难一道都做不出,攒不下成功轨迹,等于白烧一轮算力;最后量还得够。这套活过去一直是人在干:慢、贵,关键是供不上——你刚整理完一批,模型已经做完了。高质量 Agent 训练数据是当下最稀缺的输入,稀缺程度不亚于算力,尤其是在推理价格不降反升的当口。
Ornith 的做法:让模型自己出题。
出题、搭台、解题,三段全闭环
6 月的 Ornith-1.0 已经干过一件激进的事:把 Agent 脚手架——模型解题时用的「工作台」——变成可学习的对象。每个强化学习步骤分两段:先根据任务和上一版脚手架改出新脚手架,再在上面跑解题轨迹,奖励回传两段。模型学会了搭工作台,但题还是人派的。
1.5 把出题这一环也接了过去:给定一个代码库、一段任务类型的高层描述、加上模型自己的历史解题记录,系统生成一批比它已经做出来的更难一档的新题,专戳自己的能力缺口;题定下来,再为这道题生成或改进专属脚手架(指令、工具、拆解策略、编排逻辑);最后在任务和脚手架的双重条件下跑出解题轨迹。奖励从轨迹反向传回全部三段,统一用 GRPO 更新。出题、搭台、解题从此闭环,难度曲线自己爬升,不再需要人调旋钮。
值得对照的是生产环境里各家正在争的「脚手架标准」:同一个问题,别人在业务现场吵,Ornith 直接把它搬进了训练闭环。
三道信号,拦住「自己给自己出送分题」
最直接的作弊方式:出送分题刷分,训练信号为零。Ornith 把任务奖励拆成有效性 × 前沿难度 × 新颖性三个信号相乘——相乘是关键,任何一项接近零,整道题的奖励直接归零。
有效性是硬门槛:脚手架跑不跑得起来、高置信度的正确解能不能通过、明显错误的解会不会被判失败、判分逻辑跟任务描述对不对得上。不合格直接判零,专门拦截那些「看着很难、其实判不出对错」的废题。
前沿难度是整套设计的亮点:系统对每道题采样若干条轨迹算经验成功率,越接近 20% 奖励越高。十次做对八次,说明已经会了,没有训练价值;一次都做不成,连一条可学习的成功轨迹都攒不出来,强化学习空转。而且靶子会随能力移动:某类题做熟了,奖励自动往下掉,出题端只能继续加码——课程表自动校准,不用人调。
新颖性权重最低,只管一件事:别老出同一道题的变体。官方明确注明它优先于前两项之下,职责是去冗余,不是奖励怪题。
86.1 要带着问号看
这个数字是自测的:自己的环境、自己的配置,五次独立运行取平均——配置包括 4 小时超时、32 核 CPU、48GB 内存,还动了官方榜单明确锁死的超时和资源字段。官方 Terminal-Bench 2.1 榜单(截至 8 月 19 日共 17 项)里没有 Ornith;同一张榜上,Opus 4.8 + Claude Code 官方核验是 78.9(第 5),榜首是 Claude Code + Fable 5 的 83.8。同一个 Opus 4.8,Ornith 表里 85.0,官方榜 78.9,差 6.1 分——Agent 基准测的是模型+脚手架+超时+上下文+资源的组合分,换一套配置,分数就换一层含义。
「开源」也要说清楚:MIT 标的是权重。公开的 GitHub 仓库目前主要是 README、LICENSE 和展示素材,没有完整的训练实现、训练任务集,也没有可复现的评测脚本。开放权重不等于全套开源。
真正被低估的是中间那档 35B-A3B:每个 token 只激活约 3B 参数,Terminal-Bench 2.1 跑 67.8(Gemma 4-31B 是 42.1、Muse Glimmer-30B 是 51.7),SWE-bench Verified 79.0 对 52.0。9B 稠密版(压缩后 5.63GB,有 Apple Silicon 的 MLX 版)在编码和推理上领先同尺寸,但长工具链吃亏:MCP-Atlas 54.2 对 55.0、Toolathlon-Verified 41.2 对 52.8——训练方法能补参数量的差距,补不了多轮工具调用。这与推理效率正在重塑算力经济学的趋势是同一股力量的两面。
下一场竞赛,在题库
过去两年,开源模型追赶闭源旗舰基本就两条路:堆参数、抄配方——本质上都是照别人的卷子抄答案。Ornith 换了条路:自己出卷。数据生产被整体搬进强化学习闭环,谁能持续造出好题,谁就握着持续变强的燃料。模型的上限不再只由算力决定,还取决于它训练所用的课程质量。
三条启示:
- 对读榜的人:自测的 Agent 分数当方向看,别当排名比——等它出现在配置锁死的官方核验榜单上再说。
- 对实验室:题目质量正在变成类似预训练时代数据那样的持久资产,课程表就是新的护城河。
- 对用户:眼下最划算的是 35B-A3B 这档——约 3B 激活参数拿到接近旗舰的编码能力,自托管成本很低。
人留在闭环里的位置,是教学大纲:定义哪些任务类型值得练、把关题目有效性、决定下一课学什么。闭环合上了,课程表还没交出去。
FAQ
Q: Ornith-1.5 真的比 Claude Opus 4.8 编码更强吗?
A: 还不能下结论。86.1 是自测且改了配置;官方 Terminal-Bench 2.1 榜单(截至 8 月 19 日共 17 项)没有 Ornith,Opus 4.8 + Claude Code 官方核验是 78.9。只能当方向参考。
Q: 说它「开源」,到底开了什么?
A: 权重是 MIT 协议,但训练实现、出题用的任务集、可复现的评测脚本都还没公开。开放权重 ≠ 全套开源。
Q: 为什么把题目难度靶心设在 20% 成功率?
A: 十次做对八次说明已经会了;一次都做不成又攒不出成功轨迹。约两成的题刚好卡在「差一口气」的可用区间,而且会随模型变强自动抬升。