64个AI同时思考,1小时攻破50年数学难题:并行TTC如何改写推理的底层规则

64个AI同时思考,1小时攻破50年数学难题:并行TTC如何改写推理的底层规则

7月10日,OpenAI 做了一件让数学界沉默的事。

GPT-5.6 Sol Ultra 收到了一个提示词,然后被拆解成64个独立的智能体。这些智能体不走同一条路——有的从代数视角切入,有的尝试结构归纳法,有的搬出流场表述。它们各自探索,互相攻击彼此的证明,把每一个"看起来差不多"的论证拆到体无完肤。

不到1小时,一份完整、严谨的数学论文被提交上来。

它证明的,是图论领域困扰了全球数学家整整50年的「循环双覆盖猜想」(Cycle Double Cover Conjecture)。

OpenAI 研究员 Noam Brown 在 X 上连发数条推文,揭示这次突破背后的底层逻辑:并行测试时计算(Parallel TTC)

这个消息在中文科技媒体上被翻译成了"GPT-5.6 1小时攻破50年难题",听起来像是一个更强的模型碾压了一个更难的问题。

但如果你只读了这个标题,你很可能错过了真正重要的东西。


一、突破的不是模型,是推理架构

先看一个事实:GPT-5.6 Sol Ultra 在发布时已经全面开放。它不是某个实验室的秘密武器,而是任何人可用的产品。

这很重要——因为它意味着这次突破不是"又大了一个数量级的模型",而是"同一个模型,换了一种思考方式"。

传统的大模型推理遵循一个简单的逻辑:你问一个问题,模型从开始生成到结束,走一条连续的推理链。链越长,思考越深,结果越好——这就是"测试时计算"(Test-Time Compute, TTC)的基本理念。

但这条链有一个致命的瓶颈:延迟。

如果一个问题需要模型思考10分钟才能答好,那它就只有10分钟延迟。如果一个问题需要10天呢?延迟变成10天——这个产品就没人用了。

Noam Brown 在推文中点明了关键:"增加TTC能让模型更聪明,但思考时间从几秒拉长到几周,延迟就成了瓶颈。GPT-5.6 Sol Ultra 的强大之处,在于它扩大了并行的TTC。"

这就像把一支单线程的科研团队,一夜之间变成了64个独立实验室组成的攻关网络。

不是一个人思考64倍时间,是64个人同时思考,然后汇合结果。


二、OpenAI 的"科研特攻队"架构

这64个智能体是怎么工作的?OpenAI 公开了完整的提示词,其中透露了几个关键设计。

第一,拒绝"分配N个智能体用X策略"的死板方法。

第一轮,64个智能体必须探索截然不同的路径——代数视角、结构归纳法、流场表述、嵌入法、极端参数法。不是"大家分头找,谁找到算谁的",而是"大家去不同的方向,谁也不准跟风"。

第二,禁止告诉大部分AI目前哪个方案最被看好。

这在人类科研中是最致命的认知偏差。一旦某个大牛提出了一个"看起来很美"的方向,所有人都会涌过去。OpenAI 的系统设计直接物理隔离了这种信息流——大多数智能体根本不知道其他人在做什么,避免群体性的路径依赖。

第三,也是最精彩的设计:专门的"纠察队"机制。

64个智能体中,有一部分不负责提出证明,只负责攻击别人的证明。每一个被提出的候选论证,都要被这些"杠精"疯狂攻击:

  • "边真的只被覆盖了两次吗?算错没有?"
  • "你是不是把重复的死胡同当成循环了?"
  • "你这个归纳法是不是偷偷引入了桥?"

只有通过了纠察队残酷审查的证明,才有资格进入下一轮。

第四,严禁"这一步显然成立"的敷衍。

系统严厉警告:必须给出具体的引理、构造、方程式或反例。遇到死胡同立刻标记,除非提出新机制,否则不许再浪费算力。

这四条规则没有一条是"关于数学的"。它们都是关于科研治理的

OpenAI 没有教模型怎么证明这个猜想——他们教模型怎么组织一个高效、多元化、自我纠错的科研团队。


三、框架:并行探索 vs 单链深度

这次突破的真正价值,在于它揭示了一个可复用的方法论。

我把它叫做 「并行探索 × 纵深攻击」框架

传统的大模型推理,无论是 chain-of-thought 还是更复杂的树搜索,本质上是纵深攻击——一条路走到底,走不通再退回分叉点。

但 GPT-5.6 Sol Ultra 的架构是广度优先的并行探索——64条路同时走,每条路都有独立的资源、独立的方向,还有独立的审计机制。

这个框架有两个关键参数:

1. 探索的多样性

不是"64个智能体",而是"64个走不同方向的智能体"。多样性保证了搜索空间的高覆盖率。如果64个智能体都在同一个方向卷,那和1个智能体思考64倍时间没有本质区别。

2. 交叉验证的严谨性

纠察队机制不是"让大家互相检查",而是"让一部分人专职检查,不参与生产"。这种角色分离在人类科研中并不罕见(同行评审),但在AI推理中,这是第一次被系统化地内建。

这两个参数解释了为什么64个智能体只需1小时,而不是24小时。

Noam Brown 说了一句值得反复琢磨的话:"把耗时从一天缩短到一小时,这完全是另一种产品形态了。"

不是量变,是质变。


四、推演:这种架构会改变什么?

如果并行探索 × 纵深攻击的框架成立,它会改变几个方向。

第一,数学和理论科学的首个受益方向。

循环双覆盖猜想不是第一个被AI攻克的数学难题,但它是第一个被并行TTC攻克的。区别在于:之前是"模型够强,恰好能解",现在是"架构可复制,难题可批量解决"。

有网友在评论区问了一个尖锐的问题:64个独立搜索的质量,能否等同于一个漫长的连续深度推理链?广度和深度是否真的可以互换?

这个问题没有标准答案,但 GPT-5.6 的证明过程给出了一个可能的答案:当广度足够大、且交叉验证足够严时,广度可以替代深度。

第二,AI产品形态的重新定义。

如果"让AI思考更久"可以在1小时内而不是几天内完成,那很多"延迟敏感"的应用场景就被打开了。

想象一下:

  • 一个需要AI深度研究2小时的报告,以前需要隔夜才能出,现在可以当场出
  • 一个需要AI模拟1000种策略的金融模型,以前是离线批处理,现在可以实时交互
  • 一个需要AI拆解复杂代码库的编程助手,以前需要跑一夜,现在可以在会议室里完成

"1小时"是一个神奇的时间窗口。 它比"几秒钟"长,但比"一天"短。它恰好落在"可以等,但不能等太久"的产品区间里。

第三,推理成本的重新计算。

并行TTC意味着更多的算力消耗——64个智能体同时工作,耗费的GPU时间远大于单链推理。

但算力消耗和延迟不是同一个概念。

如果价值足够高的用户愿意为"1小时出结果"付费,那并行TTC的商业模型是成立的。毕竟,一个数学研究所花50年没解决的问题,用1小时和64个GPU解决了——这笔账怎么算都划算。


五、落到行动

如果你关注AI能力的边界在哪里,下面几条值得记住:

  • 如果你是AI产品经理: 不要再把"推理延迟"当作不可突破的硬约束。并行TTC打开了新的产品维度——你的产品可以"让AI思考1小时"而不是"1秒钟",这会改变你对功能边界的定义。
  • 如果你是技术决策者: 关注推理架构的创新,而不是模型参数的竞赛。GPT-5.6 的这次突破证明,推理架构的改进可以带来超越模型规模提升的收益。当别人还在比参数,你可能已经在比架构了。
  • 如果你是科研工作者: 并行TTC不是一个AI公司的"炫技",它是一个可以复用的科研方法论。如果你有需要多路径探索、交叉验证的研究问题,这套架构可以直接平移过来。
  • 如果你是普通用户: 下次看到"AI又攻克了一个难题"的新闻,别只看结果。多问一句:它靠的是更强的模型,还是更聪明的推理方式? 这个问题的答案,才是判断AI真实能力边界的关键。

参考来源:

  • Ethan Knight / OpenAI 官方 X 公告:https://x.com/eknight/status/2075643450196971805
  • Noam Brown 关于并行TTC的推文
  • 新智元 / 量子位 报道
  • OpenAI 公开的提示词和证明论文 PDF
滚动至顶部