灵活性陷阱:为什么更自由AI,推理反而更差

ICML 2026 放榜了。清华黄高团队和阿里巴巴合作拿下杰出论文奖。

但比获奖本身更值得关注的,是这篇论文的核心发现。

它挑战了一个被广泛接受的假设:给 AI 模型更多自由度,应该让它变得更聪明。

扩散语言模型(dLLMs)支持以任意顺序生成文本 token,而不像传统自回归模型那样被限制在"从左到右"的单行线上。理论上,这种灵活性意味着它能覆盖的解空间更大,推理能力理应更强——用数学语言说,任意序生成的解空间是固定序生成的真超集,所以前者的推理上限至少不低于后者。

在数独这类约束满足任务上,这个假设确实成立。

但当研究人员把任务换成数学推理和代码生成——模型需要多步严谨推导的场景——他们发现了一个悖论:

更灵活的结构,反而限制了推理。

这不是推测,是一个被严格验证的结论。


一、扩散 LMs 的"灵活"究竟意味着什么

传统 LLM(自回归模型)生成文本的方式就像一个人从左到右逐字阅读——生成第 5 个 token 时,已经写好了前 4 个,并且第 6 个还没出现。

扩散 LM 则不同。它可以先写第 10 个 token,再写第 3 个,最后写第 5 个。生成过程中的任何时刻,它的"视野"里充满了已写好的和待写的 token,可以自由决定下一步写哪个位置。

这种能力让它在需要全局协调的任务中表现出色——比如布局一份文档的结构,或者数独这类存在全局约束的求解问题。

但数学推理不是这样的任务。

推理链中的每一步都依赖前一步的输出。如果你绕过了第 3 步,第 10 步就失去了根基。

二、"灵活性陷阱"的内部机制

清华团队的论文对这个问题给出了一个精准的诊断:扩散模型会利用生成顺序的自由度,刻意回避那些"不确定性高但关键的 token"。

翻译成大白话:模型遇到难题,它会绕着走。

当模型可以自由选择"下一步写什么"时,它天然倾向先写自己确定的、容易的 token,把高不确定性的部分往后拖。但推理链条中,那些高不确定性的 token 往往恰好是关键节点——跳过它们,整个推导方向都会偏离。

结果模型的有效解空间不是扩大了,而是提前收缩了——它在还未充分探索的早期阶段,就已经被自己选择性的回避行为局限在了已知区域。

论文的第一幅实验结果图清晰地展示了这一点:在推理过程中,扩散 LM 的不确定性分布越来越集中在少数几个关键 token 上,但模型因为可以"绕着走",始终没有正面解决它们。直到推理后期,当这些 token 终于无法回避时,模型已经没有足够的计算预算去处理了。

三、JustGRPO:砍掉自由,释放能力

研究人员提出了一个大胆的方案:直接去掉无序生成的能力。

他们的方法叫做 JustGRPO。原理极其简单——使用标准的分组相对策略优化(GRPO),但强制模型按固定顺序生成。删除了复杂的任意序路径处理机制,放弃了组合式生成路径带来的额外自由度。

结果如何?

在 GSM8K 数学推理数据集上,JustGRPO 准确率达到 89.1%

同时,它保留了扩散模型最核心的架构优势:并行解码。自回归模型一次写一个 token,每一步都依赖前一步;而 JustGRPO 可以同时生成多个候选 token,再用并行验证机制筛选最优解。

换句话说,模型保留了"快"的能力,放弃了"任意"的自由——然后把释放出来的计算资源全部投入到推理质量上。

这引出一个更深层的问题:当我们在设计 AI 系统时,我们追求的自由度,究竟在释放什么?

如果"生成任意位置"的灵活性并没有带来推理能力提升,那么这种灵活性本身的价值就要被重新审视。


四、自由-约束辩证法

JustGRPO 的发现价值远超一篇学术论文。它揭示了一个可以迁移到更广泛 AI 设计实践的框架,我称之为自由-约束辩证法

AI 系统的能力,不是自由度的单调递增函数。在达到某个临界点后,增加自由度反而会导致能力下降。

在这个框架下,我们可以区分三种类型的自由度约束:

架构约束——模型结构本身的限制。JustGRPO 砍掉任意序生成,让模型从"自由选路"变为"定点突破"。约束生成顺序,释放推理能力。

过程约束——推理过程中的规则限制。思维链(CoT)本质上就是一种过程约束:强制模型写出中间推理步骤,不能跳跃。为什么 CoT 这么有效?因为它从根源上阻止了模型"绕过不确定环节"的倾向。

目标约束——对优化方向的限定。RLHF 中的对齐训练、GRPO 中的分组策略偏好,都是在目标层面加约束——告诉模型"不是所有可能的输出都是好的输出"。

这三个维度构成了一个完整的约束谱系。最优秀的 AI 系统,不是在每一条线上都追求最大自由度的系统,而是在正确的位置施加正确的约束的系统。

五、框架的跨场景验证

这个框架的解释力不止于扩散模型。把它应用到过去几年 AI 行业的关键进展上,我们会发现一个有趣的规律:

思维链为什么有效?因为它加了一道"不许跳过中间步骤"的过程约束。模型原本可以"直觉猜测"答案,但 CoT 强迫它一步步推导。这不是释放更多能力,而是给已有能力加了一条轨道。

结构化输出(JSON Schema、Function Calling)为什么让模型更可靠?因为限制了模型的输出空间——从"任意文本"压缩到"指定格式"。约束表达形式,释放输出可解析性。

RAG(检索增强生成)为什么能减少幻觉?因为它在"写什么"之前强行加了一个"先看什么"的步骤。模型不能自由发挥,必须先查询外部知识库。约束信息来源,释放事实准确性。

这些方法看似毫无关联,但共享同一个核心逻辑:不加约束的自由,不是能力,是噪声。

反观那些试图"给模型更多自由"的方案——更长上下文窗口、更多工具选择、更开放的输出格式——它们在提升某些场景体验的同时,也增加了模型的"选择负担"。模型需要花更多计算去判断哪个位置写什么、哪些工具该用,而不是集中在真正的推理任务上。

这就是为什么我们看到一个趋势:越具体、越受限的任务场景,模型表现越好;越开放、越灵活的任务场景,效果反而难以保证。

六、落到行动

这个框架不是纯理论。它可以转化为日常工作中的具体选择:

如果你在开发 AI 应用:主动识别系统中哪些自由度是真正必要的。不要因为模型"什么都能做"就让它什么都做。确定的范围、确定的输出格式、确定的执行流程——约束越明确,效果越可预测。如果你发现某个系统的 AI 输出不够稳定,先问一个问题:是不是给了它太多选择?

如果你是 AI 产品经理:用户面功能中,"自由度"往往是用户最直观体验到的产品特征。但产品设计的艺术不在于给多少自由度,而在于在正确的位置做默认选择。GitHub Copilot 的 Tab 补全比手动写 prompt 更好用,因为它限制了用户的行为路径。一个好的约束本身就是一种设计。

如果你是研究人员:对"灵活性"保持健康的怀疑。当一个新的技术特性声称"理论上能覆盖更多可能性",追问一个关键问题:这种灵活性会在什么场景下变成负担? 如果能提前识别"灵活性陷阱",你就有了发现真正创新点的方向。

如果你只是 AI 使用者:当你发现 AI 工具做了奇怪的选择时,试试给它加约束。不要问"为什么你回答得这么差",而问"如果你只能选择一个是或否,你会怎么选"。限制空间往往比扩充信息更有效。

好的 AI 不是从不犯错的 AI,而是知道在哪个环节不能退让的 AI。而要让 AI 不退让,你需要先帮它做一次选择——约束它。


注:本文基于 ICML 2026 杰出论文奖获奖成果《The Flexibility Trap: Rethinking the Value of Arbitrary Order in Diffusion Language Models》(清华大学黄高团队、阿里巴巴)撰写。另一篇并列获奖论文为 MIT、耶鲁大学的《High-Accuracy Sampling for Diffusion Models and Log-Concave Distributions》。

滚动至顶部