怎么评价一个「AI 科学家」?长期以来,答案是「考试」——孤立的 benchmark 题目、单点任务、固定答案。一篇新的 Perspective 论文 《Measuring AI Scientists: From Exams to Discovery》(Du、White、Persson、Arnold、Duan 等,2026)认为这个尺子选错了;而支持这个转向的第一批实践数据刚刚落地:中国的 AI for Science 团队深度原理(Deep Principle)推出的 MIRA,在端到端科研基准上拿第一,同时是全场最便宜的系统。
核心主张:考「完整发现流程」,而不是考「孤立的题」
真实的科研是个循环:读文献 → 提出假设 → 做实验/仿真 → 取数 → 修正 → 再来。考试式 benchmark 只测这个循环里一个冻结的切片,本质是让模型做模式匹配。Discovery Episode(发现流程)测的是整个循环:给一个模糊目标,系统能不能自己把它推进到有证据支撑的结论,并且留下人类可以审计的证据链。
这不止是测量技术问题。评价定义激励——测什么,行业就优化什么。继续给孤立题目打分,得到的是「特别擅长做题的鹦鹉」;按发现流程打分,行业才会被迫去造能端到端跑完一个科研项目的系统。
数据:最好的成绩和最便宜的成本,同时出现
配套的实践样本是 MIRA(Towards a General AI Scientist),深度原理的开源 AI 科学家平台。在第三方评测 ResearchClawBench(覆盖化学、能源、材料的端到端科研基准)上,MIRA 得分 17.51,超过 Codex 的 14.60,对比的 7 个其他智能体中排名第一。
更扎眼的数字在成本列:MIRA 每个科研任务 $0.67,全场最低。第二名 ResearchClaw 要 $0.89 还拿不到第一;成本相近的 Nanobot($0.70)和 OpenClaw($0.72)只拿了 10.90 和 13.63。在药物发现套件 SciAgentArena 上,MIRA 达到 81.1%。这个模式打破了一个舒适假设:最强的科研智能体,不一定是最贵的那一个。
为什么「便宜 + 最强」是结构信号
模型层已经上演过这一幕:DeepSeek 用低成本追平乃至击败昂贵的顶尖模型,粉碎了「能力是算力预算的线性函数」。现在这一幕在往上一层重复——发生在科研智能体层,而且评价体系正在被改写,让这种差异变得可见。
- 成本成为第一等的科研指标。如果发现流程是评价单位,「每美元产出的已验证结果」就是生产力指标,低成本系统会成为默认选项,而不是「预算不够时的妥协」。
- 证据可追溯变成产品能力。按流程打分,就必须要有从假设到测量的可审计轨迹。把证据链做得显式化的系统会赢得新尺子——而这恰恰也是科研严谨性真正要求的东西。
这也是 2026 年的一个大趋势的一部分:登上 Nature 报道的 ERA、The AI Scientist、MIRA 等系统,已经从「推理科学」走向「动手做科学」——生成假设、跑代码、驱动仿真、甚至操作病历数据。问题不再是 AI 能不能做科研,而是怎么区分「好的自主科研」和「便宜的科学表演」——这正是新评价范式要回答的问题。
行动建议
- 如果你评测 AI 科研工具:别再用孤立题目测你的领域。跑一整个 discovery episode——一个模糊目标、开放文献、真实验证,最后审计证据链。
- 如果你在选型或自研科研智能体:每次对比都加一行「单位成本/已验证结果」。MIRA 的数据说明最便宜的可能是最好的,采购逻辑该反过来看了。
- 如果你在发论文:要求系统提供流程级的方法说明——它假设了什么、测了什么、否掉了什么——而不是只贴一张 benchmark 表。
考试时代结束了。发现流程——以及成本那一列——才是 AI 科研真正决胜负的地方。
参考:《Measuring AI Scientists: From Exams to Discovery》(Perspective, 2026, chemrxiv);MIRA: Towards a General AI Scientist(深度原理, mira.deepprinciple.com);ResearchClawBench / SciAgentArena 第三方评测,2026 年 8 月。