新的瓶颈不是想法,而是算力
AI 研究智能体已经能自主提出、实现并评估机器学习实验,但在前沿任务上始终被一个硬约束卡住:写一个候选方案只要几分钟,验证它却要花数小时甚至数天的 GPU 时间。
这种不对称正在成为自动化研究的核心难题——智能体能生成的候选远多于它能负担的执行量。于是问题不再是「还能试哪些实验」,而是「这些实验里,哪个值得花算力」。这正是 Meta FAIR 团队在 arXiv 论文(2608.13940)里提出的 AI 研究偏好模型(RPM)要回答的。
RPM 回答的是排序问题,不是预测问题
RPM 能在不实际执行候选方案的情况下,估算哪个候选最值得投入算力。关键设计在于:语言模型预测绝对指标并不可靠,所以 RPM 不去猜方案最终能跑出多少分,而是把问题重构成相对排序——先排序,再让执行器把预算花在列表最前面的路径上。
两种形态:纯推理版与智能体试点版
团队在冻结的预训练语言模型上构建了两种 RPM,都不做任务特定训练:inference-only 版直接对候选计划、代码和过往执行结果做推理;agentic 版先跑小规模试点实验,再决定下一步。两者都被整合进 AIRA-dojo 搜索智能体。
agentic 版暴露了一个隐蔽的失败模式:试点智能体分配时间预算时过于保守,大量预算闲置。Meta 用两个机制修复——在提示词里刻意夸大剩余预算(报告数值是实际的好几倍),避免过早停止;每次提交后再用一个独立的反馈模型审阅已有发现,提出下一步信息量最大的实验,或判断证据已足够、结束循环。
给科学做的「搜索引擎」
可以把它理解成检索-排序模式在科研上的复刻:搜索引擎不会把查询能匹配的内容全部抓回来,而是排序后只露出最值得打开的几个。RPM 对实验做同样的事——当验证远比生成昂贵时,把便宜的推理花在「选哪个」上。
这与集体智能的组织层是同一个设计直觉:智能体面对更长更难的任务时,边际价值正从「能力更强」转向「决定哪些工作先做、怎么做」。
数据说话:同样的成果,三分之二预算
在 AIRS-Bench 上,两种方案的归一化平均得分从 0.684 分别提升到 0.711 和 0.729;更关键的是,约 15 小时就达到无引导智能体 24 小时的水平,执行预算不到后者的三分之二。最优 RPM 还在两个 AIRS-Bench 任务上拿到 SOTA。
当然要说明局限:研究假设推理成本可忽略(扣除 0.660 小时推理延迟后 0.711 降到 0.708)、评估数据属于离策略、RPM 只接入了子节点创建阶段、且只在单一骨干模型和单一基准上验证。
为什么这会重塑自动化科研
RPM 是「AI 优化 AI」这股大趋势的一环,从基础设施自进化一路延伸到实验选择。AI 研究智能体的下一阶段竞争,可能不再是提出更多候选,而是更准确地判断哪些候选配得上稀缺资源。
对今天就在跑研究智能体的团队,三个动作可以直接落地:在昂贵执行前加一层轻量排序;夸大时间预算避免过早停止;再配一个独立审阅模型为每一步指路。掌握这些智能体核心技能,是区分「把算力花在信号上」和「把算力烧在噪声上」的关键。