数字会重新定义你读论文的方式:ICML 2026 全部 168 篇口头报告论文,被 AI Agent 做了一次系统性的结果复现审计。在拥有至少 5 条可验证结论声明的 92 篇论文里,AI 能成功复现四成以上结论的只有 34 篇;而能复现八成以上结论的,仅有 8 篇。另一项基于 GPT-5 的论文检查系统则给出更惊人的结论:顶级 AI 会议和期刊中 99.2% 的论文至少存在一处可客观验证的错误。
这不是针对个别研究者的打假行动,而是科学验证方式的结构性转向:当论文规模远超任何人的阅读极限,AI Agent 成了历史上第一个能规模化「重读」全部文献的验证者。
为什么会复现失败:从缺文件到永久失联
「无法复现」与「研究造假」之间仍有巨大区别。审计结果显示,复现失败最常见的原因是工程层面:代码缺少关键文件、依赖库版本断裂、运行结果与论文描述不符。
还有更极端的情况——有 4 篇论文依赖的模型已经下线,意味着它们的实验结果永久性地无法被任何人复现。
但也有一些错误错得离谱。一篇论文将「仅训练基础模型 0.77% 的参数」作为核心卖点,其实际开源的 checkpoint 却训练了 6.31% 的参数,相差约 8 倍。另一篇论文放出一张基于某评判模型的可靠性表格,但开源代码中根本没有该评判模型,也没有任何脚本能生成表格里的结果。
错误的解剖:公式最多,且在逐年变多
从错误类型看,数学与公式错误占比最高,达到 54.0%——包括方程式写错、推导逻辑漏洞、证明中的错误假设。约 30.8% 的 NeurIPS 论文和 23.8% 的 ICLR 论文包含至少一个可能影响结果解读的实质性错误。
更值得注意的是时间趋势:NeurIPS 论文的篇均错误数从 2021 年的 3.8 个上升至 2025 年的 5.9 个,涨幅 55.3%。论文越来越复杂,错误也随之累积。
这背后是规模问题。仅 ICLR 一个会议的年度投稿量就从 2018 年的 1013 篇涨至 2026 年的 19619 篇——没有任何个体研究者能人工验证这个体量。于是一处最初出现在某篇论文里的错误,一旦被后续文献反复引用,就会沿着引用链传播,最终固化成「学术共识」。
一个例子很能说明问题:某实验室理论化学家用 AI 预测分子沸点时,发现结果与一份 75 年前的化学数据库明显冲突。他先怀疑自己错了,手动回溯原始文献后才发现——AI 是对的,连一个约一个世纪前被学界公认权威的沸点测量值也是错的。
论文发表不再是终点
过去,复核文献耗时巨大而学术回报有限,绝大多数已进入文献体系的错误从未被系统性审视。如今技术上首次具备了大规模重审过往科学文献的可能。抱抱脸与 AlphaXiv 已联合发起针对 ICML 2026 的「Agent Reproduction Challenge」复现挑战赛,自动化复现正在成为制度化环节。
但也要清醒:以 GPT-5 驱动的 Paper Correctness Checker 为例,检测精确率为 83.2%,且每次检测仍有约四成真实错误未被检出。AI 核查工具的输出最终仍需要人工审核,它还不能担任科学文献的判官。
对研究者意味着什么
- 选题新思路:从「找新选题」转向「找旧论文里的异常点」,优先关注被大量引用但争议较少的经典论文——毕竟 99.2% 的论文至少有一处错误。
- 用 AI 做研究谱系:让 AI 生成知识地图,理清哪些是奠基性工作、哪些结论缺验证、引用关系如何,从而发现过去难以察觉的连接与异常。
- 追问被接受的假设:一个经典实验是否按今天的标准验证过?一个广泛引用的结论是否存在未注意的限制条件?AI 让这类追问的成本几乎归零。
- 发论文的团队:附上完整代码、checkpoint,锁定依赖版本。否则你的下一篇论文,就是下一轮审计的目标。
或许在今后,论文发表不再意味着研究宣告胜利,而只是进入了下一轮 AI 验证的开始。
