AI 不是变聪明了,是学会「做科研」了

GPT-5.6 一小时攻破 50 年图论难题,比结果更重要的是过程

7 月 11 日,OpenAI 宣布 GPT-5.6 Sol Ultra 在不到一小时内,用 64 个 Agent 并行证明了数学界悬置 50 年的「循环双覆盖猜想」。

新闻一出,主流的反应有两类:一边惊呼「AI 已经超越人类数学家了」,另一边担忧「ASI 越来越近了」。

这两种反应都抓错了重点。

证明一个数学猜想本身,确实令人震撼。但真正值得关注的东西,不是结果——而是 OpenAI 用来达成这个结果的方法论。而且,他们把这个方法论完整地公开了:包括任务提示词和证明全文的 PDF。

这套方法论,可能比 GPT-5.6 这个模型本身更有价值。

一、64 不是算力堆叠,是模拟科研共同体

先简单说一下背景。循环双覆盖猜想的通俗版本是这样的:在一个没有「独木桥」的城市路网中,你一定能找到一组环状公交线路,让每一条路都恰好被两趟公交车经过。听起来像是个交通规划问题,实际上它是图论的皇冠级难题——Tutte、Seymour 等多位大师级数学家各自独立提出后,半世纪无人给出完整证明。

OpenAI 怎么做的?他们不是让一个 GPT-5.6 实例在那孤独地想一个小时。他们启动了 64 个并发的 Agent,组成了一支「科研特攻队」。

如果你只看到「64 倍算力」这个数字,就完全错过了重点。

这 64 个 Agent 的工作方式,更像是一个精心设计的科研实验室。任务提示词里设置了三道关键的规则:

第一,第一轮必须走完全不同的路径。 系统强制要求 Agent 从代数视角、结构归纳法、流场表述、嵌入法到极端参数法等截然不同的方向出发。这与人类科研中最大的问题之一——「大家都在同一个方向卷」——形成了鲜明对比。

第二,禁止透露哪个方向最被看好。 这在人类科研中几乎是不可想象的。一旦某个大牛提出一个看起来很美的方向,资源、人力、注意力会立刻倾斜过去,其他路径几乎被自动放弃。OpenAI 的系统明确禁止了这种「共识传染」。

第三,内置「纠察队」。 64 个 Agent 中有一部分专门负责攻击每一个候选证明。不是友善地提建议,是真的找问题——「这条边真的只被覆盖了两次吗?」「你这个归纳是不是偷偷引入了桥?」「这一步请给出具体构造,拒绝『显然成立』。」

这三条规则合在一起,构成了一个完整的、可重复的科研方法论:多路径并行探索 + 信息隔离 + 对抗验证。

这不是一个更强的模型在推理——这是一个科研共同体在运转。

二、「测试时计算」的版本号:从单线程到多线程

OpenAI 的研究科学家 Noam Brown 在推文中用一个词概括了这次突破的技术基础:并行测试时计算(Parallel TTC)

TTC 这个概念并不新。从 o1 开始,OpenAI 就在探索「让模型思考更久」这个方向。但之前的 TTC 是单线程的——一个模型,一条推理链,随着思考时间增长,延迟线性增加。要把推理时间从几秒拉长到几周,在生产环境下几乎不可用。

并行 TTC 的突破在于:把「时间长」转换成了「人数多」。

就像编程从单线程进化到多线程,推理也从单 Agent 深度思考进化到了多 Agent 并行探索。64 个 Agent 各走各的路,互相交叉验证。更长的思考时间不再是一次性的延迟成本,而是变成了可以横向扩展的资源。

这是一个架构层面的范式转移。

单线程深度的上限受制于推理时间,多线程广度受制于 Agent 数量和计算资源。而 Agent 数量和计算资源,在今天仍然在以指数级扩张。

三、科研的「阿喀琉斯之踵」:共识偏见与路径依赖

为什么要如此大费周章地设计这套协作机制?

因为人类科研在最底层,有两个结构性的缺陷,而多数人没有意识到它们的存在。

第一个缺陷:共识偏见。 当一个权威大牛提出一个方向,所有人的注意力会自然倾斜。这在数学界尤其明显——当一个领域被某个人统治,其他路径几乎就自动被遗忘了。问题是,最热的方向不一定是正确的方向。

第二个缺陷:路径依赖。 一个研究者花了两年的时间跟一个方向死磕,沉没成本已经大到难以放弃。即使直觉告诉他这条路可能是错的,也很难转身。因为转身意味着「过去两年的工作白费了」。

OpenAI 的系统设计,恰好在这两个问题上给出了工程化的解法:

  • 强制多路径 + 信息隔离 → 共识偏见消失
  • 死胡同立刻标记「堵死」,禁止反复 → 路径依赖消失
  • 内置纠察队 → 自我纠错不再依赖个人品格

你看,这不是「AI 比人类聪明」的故事。这是「AI 比人类团队协作效率更高」的故事。而且高出的部分,恰好是人性中那些无法回避的结构性弱点。

四、这个框架可以迁移到哪?

如果并行多 Agent + 对抗验证这套方法论可以被完整复用(OpenAI 已经公开了提示词),那么它的应用场景远不止数学证明。

药物研发: 目前的药物筛选本质上也是多路径探索。但各实验室之间信息不互通,路径重复严重。如果有一个类似的并行架构,让多个虚拟筛选 Agent 同时从不同的化学空间出发,结果交叉验证,发现候选分子的效率和可靠性可能会完全不同。

工程故障诊断: 当一个大型系统的故障原因不明,工程师团队天然会形成「某种猜测占主导」的局面。如果用一个并行 Agent 系统,每个 Agent 从不同的假说出发并被要求相互攻击对方的结论,最终活下来的那个假说,可信度会比团队讨论的结果高得多。

投资决策: 甚至可以把这套框架当作决策工具。当一个重大决策面对高度不确定性时,人为制造多个「独立的分析 Agent」,禁止它们互相参考最被看好的结论,然后内置一个「质疑者」角色反复攻击每个方案——留到最后的方案,大概率会比你一个人或者一群互相影响的人做出的判断更稳健。

这个框架的核心洞见是:并非三个臭皮匠顶一个诸葛亮,而是三个独立的、信息隔离的臭皮匠,加上一个专门找茬的,才顶一个诸葛亮。

五、落到行动

如果你是一个创业者或研究员,这篇文章最实际的建议有两条:

第一,你的下一个复杂问题,可以试着用「并行探索 + 信息隔离 + 对抗验证」三件套去解构。

不是让你去建 64 个 Agent(虽然 GPT-5.6 已经公开可用),而是这个思维框架本身就可以指导决策。下次面对一个难题,先问自己:「我是不是已经默认了一个最热的方向?」然后强制自己去探索三条完全不同的路径。再找一个人专门负责反驳你的方案。你会发现,绝大多数「看起来唯一可行的方案」,在第一轮对抗中就倒下了。

第二,警惕「共识传染」对团队决策的负面影响。

人类团队比 AI Agent 更容易陷入共识偏误——因为人情、资历、面子都会影响判断。如果你管理一个技术团队,可以试着在执行关键决策时引入「信息隔离机制」:要求团队成员在互相看到对方的方案之前,各自独立提交完整的分析和结论。然后再合并讨论。这个简单的流程改变,可能会让团队的判断质量上升一个台阶。

GPT-5.6 用一小时证明了一个 50 年的数学猜想,这确实是一个里程碑。

但更值得记住的是它用来完成任务的那套方法论。因为模型会更新、算力会涨价、价格会下降——而一个有效的科研方法论,可以迁移到任何领域,不止数学。


参考来源:
- OpenAI Ethan Knight 推文(2026-07-10)
- OpenAI Sébastien Bubeck 推文(2026-07-10)
- 新智元 / 36氪报道(2026-07-15)

滚动至顶部