一个周末,数学界集体破防。
2026 年 8 月 1 日,OpenAI 公布了一份成绩单——其下一代内部模型 Astra 在高维几何、编码理论、群论、量子复杂性、格密码学和极值组合学等领域,给出了 十项新的研究成果。其中一些问题至少十年没有取得核心进展,另一些已经悬而未决数十年。
而全部算力成本,按 Sol API 费率计算,仅约 2000 美元。
OpenAI 研究科学家 Noam Brown 还补了一句:「我们也没有在每个问题上花费太大力气,测试时计算还有很大的提升空间。」
这不是一个模型发布公告,而是 AI 研究能力的一次公开验证。
一、Astra 攻克的十座大山
这十项结果横跨了数学和理论计算机科学的多个前沿领域,每一条都足以单独发表在顶级期刊上。
1. 非 sofic 群的存在性构造
群论领域 27 年的核心开放问题。Mikhail Gromov 于 1999 年提出 sofic 群概念,数学家们一直在问:是否每个可数离散群都必须是 sofic?Astra 构造了一个非 sofic 群,给出了否定答案。
2. Connes 刚性猜想被推翻
1980 年由菲尔兹奖得主 Alain Connes 提出的猜想,涉及冯·诺依曼代数是否「记住」生成它的群。Astra 构造的反例证明,至少对于某些群,代数结构并不能唯一确定生成群。算子代数中数十年的刚性理论需要重新审视边界。
3. 高维球体堆积密度新上限
这是 1978 年以来首次对一般高维球体堆积密度的上界做出改进。Cohn-Elkies 阈值被认为是最优的,Astra 证明了其精确强度。
4. 二进制与球面码界限
在任何给定的最小距离下,极大提升了二进制码最大尺寸的界限,并在高维球面码上取得了类似成果。
5. 算术电路复杂性下界
给出了使用算术电路和公式计算积和式(Permanent)的新下界,算术公式下界达到 n⁴/log n 量级——这是理论计算机科学的核心难题。
6. 量子平行重复定理
针对一般双人量子游戏提出了指数级平行重复定理,将经典复杂性理论的核心原则扩展到了量子领域。
7. 最近向量问题(CVP)的难度证明
证明了该问题的多项式因子近似难度,这是一个与后量子密码学密切相关的基础格问题。
8. Ehrhart 体积猜想
在所有维度上确定了质心是唯一内部格点的凸体的最大可能体积。
9. 多色 Ramsey 数
给出了多色三角形 Ramsey 数的超指数下界,解决了 Paul Erdős 的第 183 号问题。
10. 极值数猜想
在极值图论的紧致性和退化性猜想上取得新成果,解决了 Erdős 的第 146 和 180 号问题。
二、为什么这次不一样?
2025 年 10 月,OpenAI 曾声称 GPT-5 解决了十个 Erdős 问题,但几天内就被数学家 Thomas Bloom 拆穿——模型只是从文献中检索了已有解法。那是一次典型的「新闻稿式证明」。
这次有三个结构性的不同:
1. 跨领域覆盖。 十项结果分布在六个不同的数学领域,而非单一目录;其中 4 个是反例(证伪猜想),而不是简单的正向构造。
2. Lean 4 形式化验证。 这是最关键的差异。每个证明都附带一个 Lean 4 机器可验证证书,任何人只要有笔记本电脑就能独立验证。Lean 4 的信任内核给出二元裁决:要么编译通过,要么不通过。不需要博士学位,不需要等待数月的同行评审。OpenAI 将所有代码以 Apache 2.0 许可证开源在 GitHub 上。
3. 成本透明。 2000 美元——这个数字让整个讨论从「AI 能不能做数学」变成了「AI 做数学的成本有多低」。
5 月 OpenAI 的 AI 推翻 Erdős 单位距离猜想时,验证依赖九位外部数学家的审阅签名——社会信号虽强,但不可再现。Astra 的 Lean 证书让验证权回到了每一个个体手中。Thomas Bloom——那个在 2025 年 10 月拆穿 GPT-5 虚假宣称的数学家——在 X 上评价这些结果「大新闻」,比 5 月的单位距离反例更有分量。
三、数学界的「精神危机」
结果公布后,数学家们反应最强烈的,不是技术细节,而是 存在意义。
青年数学研究者 Kirwin Hampshire 发表了一篇刷屏长文《数学的暗夜》,核心担忧不是职业焦虑,而是一场精神危机:如果 AI 能瞬间给出无数种漂亮的证明,人类仍然可以学习、讲授、评价数学,却可能再也没有机会真正「发现」数学。
他借用博尔赫斯《巴别图书馆》的比喻:假如世界上所有可能写出的伟大小说都已经存在,且 AI 总能选出最好的一本,作家当然可以继续写作,但创作的本质已经改变了。
多伦多大学数学教授 Daniel Litt 坦言自己此前低估了 AI 的能力,认为距离 AI 发表能登上《数学年刊》的成果,不过是时间问题。六届 Kaggle 特级大师、NVIDIA 机器学习专家 Jean-François Puget 则建议,纯符号化的脑力工作正被 LLM 快速吞噬,想避开被替代的风险,就得往和物理实体绑定更深的方向走。
但 Noam Brown 也给出了一个被很多人忽略的细节:Astra 并没有解决千禧年大奖问题(Millennium Prize Problems),也没有开创数学新分支或提出有趣的新猜想。如果一个数学家在这些问题上耕耘,暂时还有很多事可以做。
四、范式转变的深层信号
如果把这次事件放在更大的语境下看,几个信号值得关注:
第一,AI 研究从「辅助工具」走向「独立发现者」。 5 月推翻了 Erdős 单位距离猜想,8 月拿出了十项跨领域成果,而且都在 Lean 4 上完成了形式化验证。这个节奏意味着 AI 在数学发现上的能力正在加速,而不是线性增长。
第二,验证基础设施趋于成熟。 DeepMind 的 AlphaProof Nexus 在 5 月用 Lean 完成了九项 Erdős 问题证明,OpenAI 紧接着用不相上下的规模覆盖了更广的领域。两个实验室不约而同选择 Lean 4 作为标准验证后端——AI 数学领域正在形成统一的机器可验证记分板。
第三,算力消费品的价格信号。 2000 美元解决十个跨领域难题,意味着 AI 作为「研究工具」的边际成本已经低到几乎可以忽略。这不仅仅是效率提升,而是对整个研究范式——从选题、探索到验证——的重构。
五、几点思考
对 AI 从业者来说,Astra 的这次展示传递了几个实操层面的信息:
- 测试时计算(Test-Time Compute)的潜力远未被充分挖掘。 Noam Brown 明确说「没在一个问题上花太多力气」,意味着当前成果只是冰山一角。
- 多智能体长时协作是通向复杂推理的关键路径。 The Information 报道,Astra 的核心能力在于驱动多个 AI 智能体长时间协同运作,处理从项目管理到高阶数学证明的复杂任务。
- 形式化验证让 AI 的输出可信。 没有 Lean 证书,这次成果也会像 2025 年 10 月那样被质疑。可信 AI 输出 + 可验证证明 = 可用的研究工具。
对数学界来说,这场讨论其实在问一个更深的问题:当 AI 已经能做得相当不错时,人类数学到底还在追求什么?
类似的问题,其他学科也可以提前想想。
参考:OpenAI 官方公告、TechTimes、机器之心、36氪、知乎等报道。
