AI倒查论文:99.2%的顶刊论文都有问题

顶会论文正在被AI集体「打假」。

今年7月22日,一家美国研究审查公司用AI Agent对ICML 2026全部168篇口头报告论文做了系统性复现审计。在92篇拥有至少5条可验证结论的论文里,AI Agent能成功复现四成以上结论的只有34篇,能复现八成以上的仅有8篇。

复现失败的原因五花八门:代码缺关键文件、依赖库版本断裂、运行结果和论文对不上,还有4篇论文依赖的模型已经下线——实验结果从此永久无法被任何人复现。

有些错得离谱。一篇论文把「只微调基础模型0.77%的参数」当核心卖点,实际开源checkpoint训练了6.31%,差了约8倍。另一篇放了一张某评判模型的可靠性表格,开源代码里却根本没有这个评判模型,也没有任何脚本能生成表里的结果。

这不是孤例。抱抱脸(Hugging Face)和AlphaXiv联合办了ICML 2026的「Agent Reproduction Challenge」,用AI编程Agent自动复现,结果同样不乐观。2025年底一项基于GPT-5的研究扫描已发表顶会论文后发现:平均每篇4.7个客观错误,99.2%的论文至少被标出一个问题。数学与公式错误占比最高达54%,30.8%的NeurIPS论文和23.8%的ICLR论文含有可能影响结果解读的实质性错误。而且趋势在恶化:NeurIPS论文篇均错误数从2021年的3.8个涨到2025年的5.9个,涨幅55.3%。

问题的根源是规模,不是恶意。同行评审默认承担验证职责,却从没有验证的资源——审稿人没有时间下载数据、跑模型、复现每个实验。而ICLR投稿量从2018年的1013篇涨到2026年的19619篇。这个规模下,一个错误一旦进入引用链,就会顺着引用被不断继承,最终变成事实上的「学术共识」。浙江实验室一位化学家用AI预测分子沸点,结果与一份75年前的化学数据库冲突,回溯原始文献后发现AI才是对的——那个被引用了近一个世纪的权威数值本身是错的。

结构变化在这里:论文发表不再是研究的终点,而是新一轮机器验证的起点。科学验证的成本刚刚塌缩,「已发表」的含义正在被改写——同行评审默认把守的门槛,如今被真正能跑实验的Agent挑战了。

对研究者来说这反而是片蓝海。验证成本趋近于零后,审计被大量引用却少有人复核的经典论文、用AI做知识图谱梳理引用谱系、质疑长期被接受的假设,都成了正经且基本没人碰的研究方向。AI问的是「一个被广泛引用的结论,是否存在未被注意的限制条件」。

但要清醒:这些工具当不了判官。GPT-5驱动的论文检查器精确率83.2%,每次检测仍会漏掉约四成真实错误。AI负责第一遍扫描,最终裁决还是得人来做。

滚动至顶部