OpenAI Astra 换上「循环深度」推理架构:用计算深度换参数规模

大模型如果不再靠「变大」取胜,而是靠「多想一会儿」取胜,整个 scaling 的游戏规则就变了。OpenAI 即将发布的旗舰模型 Astra 被曝采用的「循环深度」(recurrent depth)架构,押的正是这个方向。

它不是一个更大的 Transformer,而是一个会「循环」的 Transformer。标准模型像一条 100 个工位的流水线,数据依次被敲打后往下走;循环深度则像一个顶级工匠的专属工作台,数据不往下游,由同一个工匠在原地反复打磨,直到通透才交出成品。

它在技术上做了什么

常规 LLM 以线性流水线方式处理:token 按固定层数向下推进,然后输出下一个词。循环深度打破了这种线性堆叠——文本先进入一个由数学组件合并成的循环块,重复处理多次,才产生输出。本质是参数复用:用计算时间换参数量,小模型在推理时可等效调用大模型的计算规模,同时大幅降低内存和带宽成本。

这条路并非孤立。2025 年一篇论文(Scaling up Test-Time Compute with Latent Reasoning)用 35 亿参数的模型,在测试阶段不断增加内部循环次数,最终把计算预算扩展到约 500 亿参数模型的等效负载——模型没有变大,「思考深度」却可以继续加码。

真正的信号:思考正在搬回模型内部

值得关注的不只是 Transformer 改造,而是它与 Meta、微软等正在探索的潜空间推理(latent reasoning)所指的同一个趋势:大模型正把更多「思考」从 token 空间搬回模型内部,不再强迫每一步推理都翻译成人类语言。微软的 LOTUS 把 Looped Transformer 与潜空间推理结合,在 30 亿参数规模上首次追平显式思维链,同时把思考阶段延迟压缩 2.5 至 6.9 倍。

也就是说:AI 不把推理「说出来」,不仅算得更深,还有机会算得更快。

为什么这是一条产业拐点

除了技术本身,三股力量让它超越一次单纯的新品发布。

资本需要它来证明烧钱值得。 亚马逊、微软、谷歌今年高达 6000 亿美元的数据中心资本支出(算力集中的最前线),需要「模型性能指数级跃升」的故事来背书,而「用时间换质量」正好提供了这个叙事。

竞争压力是真的。 Anthropic 二季度营收估约 116 亿美元、首次反超 OpenAI(两家旗舰竞争进入白热化),后者急需一份「下一代模型值得继续烧钱」的成绩单(OpenAI 同时也在推进自研芯片来压成本)。Astra 内部版本据称攻克了 10 个尘封十年以上的数学与理论计算机难题,其中首次显式构造出非索菲克群,所有证明都形式化为 Lean 证书,按当前 API 费率折算算力成本仅约 2000 美元。

安全是硬币的反面。 循环深度会掩盖部分或全部推理过程——人类可读的思维链变成无法破译的天书,这正是监管最依赖的审计入口。而就在上个月,奥特曼已罕见地因 Astra「能力过强」主动踩下刹车。

怎么读这件事

  • 买推理算力的一方: 把它当作成本信号。若「用计算深度换参数量」成立,「越大越好」的采购直觉会被削弱,中小基座模型与效率型供应商的 API 会更有说服力。
  • 评估安全的团队: 预期「黑箱推理」会成为下一轮监管引爆点,可解释性预算必须适配不透明的内部循环。
  • 看待 scaling 的框架: 别再把进步定义为「参数变多」。前沿已横跨架构与推理时算力,更有用的问题是:模型在答题前能「想多久」,而不是「有多大」。

循环深度是目前最清晰的例证:纯参数曲线的时代可能正在结束,以可交换的计算时间为核心的新时代开始了。

滚动至顶部