循环语言模型本该是推理成本的解药:不必生成成千上万个 token 来「思考」,同一组网络层在隐空间里多循环几轮就行。现实要复杂得多。研究者在 Ouro 上看到的结果是——测试时循环一开始确实有用,AIME 2024 成绩从 0 分一路爬到第四轮的 65 分,可继续转到第八轮,直接跌回 38.67 分。多想的这几轮,全在帮倒忙。这个反常现象,恰恰是当前测试时计算(test-time compute)最重要的边界条件。
两条「多想」的路线
标准 Transformer 像一栋楼层固定的大楼:信息从一楼进、顶楼出,无论面对「1+1」还是复杂数学证明,每生成一个 token 走的网络深度都差不多。于是它解决难题的办法只有一个——多说。思维链(Chain-of-Thought)把多次计算串成输出 token:模型一边说一边想,拆解问题、检查答案、自我修订。简单题少说,难题多说,确实好用,但代价是:连没必要说出来的中间步骤,也得先组织成一段能输出的文本。
循环模型走的是另一条路:不重新走一遍大楼,而是回到同一组网络层、原地更新隐状态,参数复用。Universal Transformer、Deep Equilibrium Model 和近年的循环 Transformer 都在问同一个问题——能不能让模型自己在脑内决定转几圈,不把思考序列化成 token?早期证据是乐观的:2025 年一项研究把循环深度模型扩到 35 亿参数、8000 亿 token 训练,测试时多跑几轮,部分推理任务确实继续提升,最多用到了相当于 500 亿参数模型一次前向传播的计算量。
三道坎:循环模型卡在哪
循环模型要跨三道坎:第一,架构理论上能不能表达这种计算——目前看乐观;第二,训练能不能真正学会这种计算方式;第三,也是真正的瓶颈——训练结束后,推理时能不能稳定地「一直算下去」。
Ouro 就是栽在第三道坎上。早期用 8 轮循环训练,出现损失尖峰和梯度振荡,于是主训练阶段降到 4 轮;测试时把循环加回 8 轮,额外的计算却换不来更好的答案。同一组参数、同样的隐状态更新,但误差在每一轮累积,最后隐状态看似稳定,实际已经撑不起结果。
误差累积是反复出现的反派。2026 年的 Parcae 研究发现,循环语言模型容易出现残差爆炸和损失突升;重新设计循环内的稳定机制后,验证集困惑度最多降低 6.3%,扩展到 13 亿参数时,在固定参数量和数据量下反超传统 Transformer 基线。「模型不想学」的故事出现了转机——不成熟的是训练配方,不是架构。标准 Transformer 背着磨合了几十年的整套装备:残差连接、归一化、初始化、学习率策略、优化器;大规模循环语言模型的架构、优化器、损失函数和中间监督怎么搭配,还在摸索期。
为什么重要:推理成本结构之争
这不是小众架构的学术争论,它决定推理市场哪条路线胜出。思维链烧 token:单个便宜,总量巨大,而且每一步思考都得序列化成输出。循环烧轮数:紧凑、发生在网络内部,但一旦超过训练见过的深度就不稳定。如果循环的稳定性成熟,推理会大幅变便宜——不用交 token 序列化税,计算在网络里完成而不是在输出里展开;如果成熟不了,思维链仍是唯一可靠路线,token 成本继续卡在每个思考模型的咽喉上。同样的逻辑也支撑着 SSI 押注测试时训练 的判断:AI 下一场成本战,打的是模型如何花掉额外算力,而不只是拥有多少算力。
现在能做什么
对评估「思考型」模型的人来说,轮数和思考长度都是虚荣指标——真正该看的是额外算力有没有改变答案。对基于开源权重做应用的团队,盯紧循环模型的训练文献:Parcae 式的稳定性工作是下一个解锁点,值得按月跟踪。对我们大多数人,结论更简单:多想一定有用的假设已经破产,问题变成哪种架构能让额外算力为自己买单——今天的答案仍是思维链,而循环模型离改写这个答案,只差一套稳定的训练配方。