AI压着数百个数学证明不发表:答案第一次跑赢了人类的理解速度

一道悬了几十年的难题被解开了,要不要立刻告诉全世界?

过去几百年,这在数学界几乎不算个问题——人们担心的只是题太难,没人解得开。9月15日,德州大学奥斯汀分校理论计算机科学教授、曾在OpenAI对齐团队担任访问研究员的Scott Aaronson,把女儿的一句话写进了博客:「如果我想当数学家,看来大概只剩两周了。」

这不是段子,是信号。同一篇博文里,Aaronson列了一份过去一个月被AI证明或协助证明的长期开放问题清单:雅可比猜想的反例、经Lean验证的费马大定理、量子复杂性理论里悬置多年的难题。而清单末尾的一则传闻,才是让数学圈真正坐不住的东西。

据他透露,AI公司在纳维-斯托克斯方程的证明引发一轮带有敌意的公众反应之后,正把一些「非常重大的问题」的解法压在手里,打算等想出更好的处理方式再说。纽约大学数学教授Scott Armstrong随后甩出更惊人的数字:OpenAI至少从7月的国际数学家大会(ICM)起,就压着「数百个」数学证明没有发布。

流行解读是「AI又赢了」。但这个故事真正的重点,不在AI解开了什么,而在答案第一次跑到了人类理解能力的前面,并被锁进了私有的服务器。这不是一次学术八卦,这是知识生产制度的一处结构性断裂。

一、机器按天出结果,人类按年读结果

先看产能差距有多离谱。8月1日,OpenAI一口气发布了十项数学和理论计算机科学成果,宣称每项都解决或实质性推进了长期开放问题。9月1日,OpenAI听到风声:有两道千禧年难题已被人解决。它的做法简单粗暴——既然不知道是哪两道,就把所有未攻克的千禧年难题连同一批高影响问题,一股脑喂给一个能力强于GPT-6 Astra的内部模型。

一个近100个智能体组成的小组,约50小时先解出了无外力版本的欧拉方程问题。随后资源集中到纳维-斯托克斯方程:约1万个智能体并发运行88小时,解法出炉,再花17小时做Lean形式化验证。仅这一道题就消耗了约1300亿个输出token。Aaronson估算,这份166页的证明至少烧掉约1500万美元算力——而目前大概还没有任何一个人类真正读懂了它。

对照另一边:按照克雷数学研究所的规则,千禧年难题的认定需要正式发表、等待两年、再经外部专家严苛审查。直到今天,Clay依然把纳维-斯托克斯列为未解决问题。机器出结果按天算,人类读懂结果按年算。

Armstrong透露,实验室现在几天之内就能拿出一篇160页的论文,外加一份数十万行规模的Lean形式化证明。同行评审、学术报告、写进教科书——这套跑了几百年的流程,接不住这种产出节奏。来不及消化的成果越堆越多,实验室里积压一批未公开的证明,几乎是算力爆发下的必然。

二、四条老规矩同时被撕裂

学术界赖以运转的规则有四条:谁先发表谁拿功劳,谁做出来署谁的名,成果要让同行知道,同行审过才算数。纳维-斯托克斯事件把四条一起撞裂了。

第一,公开。知识正在从「人人可查」变成「圈内人先知道」。Armstrong写道,关于重大成果的传闻满天飞,一个人离实验室的社交距离,决定了他能知道多少。数学之所以能在过去三百多年飞速发展,靠的正是公开交流——如今AI实验室把突破关起门来,无异于一次倒退。

第二,优先权。过去谁先做出来并公开,名声归谁。但纽约大学数学家Tristan Buckmaster与Anthropic的Levent Alpöge此前已在该方向取得进展,OpenAI正是听到风声,才在不到一周内用庞大算力碾压出证明,事后才联系两人提出同时发布。陶哲轩在Mastodon上发出警告:如今只要传出「有人在研究某个问题」,就可能引来大规模AI算力的降维打击,在人类项目长成之前将其碾平。这意味着研究者不再敢与同行分享有前景的思路——几个世纪的开放科学传统可能被逆转。

第三,发表前先被读懂。Lean能保证证明逻辑无误,却保证不了人类能看懂。Aaronson形容,如今的期刊编辑就像《魔戒》里死守城墙的刚铎守军,不把部分审稿工作交给AI,根本接不住。9月11日,陶哲轩等25位菲尔兹奖得主联名发表公开信,批评AI公司把数学难题当跑分工具,一针见血:数学真正的目标是理解,解题只是手段。这是一个死结——发得快没人读得懂,发得慢又被指责压着不发。公开一个答案的成本,第一次高过了寻找答案的成本。

第四,署名。全程没参与寻找证明的人还能不能署名?把GPT-6 Astra写进作者栏算怎么回事?这些问题眼下谁也没有答案。

三、框架:证明剪刀差

把上述变化装进一个可复用的分析工具,我称之为「证明剪刀差」(Proof Gap):当机器产出答案的速度与人类验证、理解、制度化消化答案的速度持续拉开,中间形成的裂缝就是剪刀差。它有三层:

  • 产能层:答案的生产成本坍缩。千禧年难题从「几代人」变成「88小时、1300亿token」。
  • 验证层:确认答案的成本不降反升。166页证明加数十万行Lean代码,没有人类读完,Clay的两年审查期形同虚设。
  • 制度层:荣誉分配与知识传播的规则失效。优先权、署名、公开、评审——全部建立在「答案稀缺且人人可见」的旧前提上。

剪刀差的危险不在于差本身,而在于三层之间没有同步机制。答案锁在实验室服务器里,制度层就会退化:知识从公共品变成私有库存,「离实验室近」成为新的学术特权。Aaronson那句判断值得逐字读:奇点已经开始了,只是分布得极不均匀。不均匀的不只是解题能力,还有知情权,以及做数学的价值感。

OpenAI研究员Noam Brown近日在Dwarkesh Podcast的访谈里,从内部视角印证了这一格局:OpenAI内部模型已能解答多个未解数学问题,外部世界无法获取这些能力;他坦承「这是一个存在不公平优势的情况,我不知道如何恰当地权衡」。他甚至预警:随着进步加快,实验室可能判断内部使用价值足够大而停止外部部署——「默认情况下,AI的外部部署在质量上将显著落后于内部部署。」

四、剪刀差不只属于数学

如果你以为这只是数学圈的内部危机,就低估了它的迁移力。任何「答案可验证、但理解需要时间」的领域,都在复刻同一把剪刀。

药物研发里,AI可以筛出候选分子,但临床试验的验证周期是十年——剪刀差已经出现,只是被监管流程掩盖着。软件安全里,AI能在几天内找到关键系统的漏洞,而修补和生态协调以月计——漏洞披露制度面临的正是数学界同款困境:公开怕被利用,不公开怕永远不公开。法律领域,AI检索判例和组织论证的能力,已经超过了法官和律师消化新判例的速度。

共同结构是:AI冲击的从来不是「谁更聪明」,而是每个领域里「产出」与「消化」之间的时间常数。哪个领域的消化环节越依赖慢速的人类共识流程,剪刀差就越先在哪里撕裂制度。

五、如果你是研究者/管理者/从业者

  • 如果你是科研工作者:重新评估手上「死磕型」选题——一位博士生死磕三年的难题,答案可能早已躺在某家实验室的服务器上。选题时优先考虑AI产能层覆盖不到的方向(提出新问题、构建新分支、实验科学),并把Lean等形式化验证工具纳入工作流,你的证明未来需要机器可验证才谈得上被接受。
  • 如果你是机构管理者(高校/期刊/资助方):同行评审制度必须开始吸收AI审稿,同时建立对「机构私有知识库存」的披露压力机制。陶哲轩等人的公开信指出的原则值得写进政策:解题是手段,理解才是目标——资助与晋升标准应向「可被理解的知识」倾斜,而非「可被宣称的答案」。
  • 如果你是从业者(软件/法律/医药):把你所在领域「验证与消化」的瓶颈环节识别出来——那将是未来十年最稀缺、也最不会被AI替代的位置。审计、复核、制度设计这些「消化侧」角色,价值会随剪刀差拉大而上升。
  • 如果你是普通用户:对「AI解决了X」的新闻保持一个追问——这个答案有没有经过独立验证,还是只锁在一台服务器里?

以前,学术界比的是谁先证明;以后可能还得加一条:谁先知道哪些题已经被证明了。数学一直是人类最慷慨的学科——一个证明写出来,全世界都能读,都能接着往下走。当答案先落进AI实验室的服务器,这份慷慨能维持多久,取决于制度层补上剪刀差的速度。留给大家的时间,可能比AI解题的88小时更少。

滚动至顶部