Transformer 几乎成了大模型的代名词,它身上那些「标配」——QK 归一化、分组查询注意力(GQA)、滑动窗口注意力、预训练上下文长度、输出投影层——被一代代模型原样复制,很少有人回头验证它们到底好不好。
COLM 2026 上,三支独立团队同时做了这件事。三篇论文分别盯住长上下文架构、训练时的输出层、以及层剪枝,结论指向同一个模式:行业默认的「安全设计」都有真实代价,而常规评测根本测不出来。
长上下文裂缝:QK 归一化、GQA 与滑动窗口的「组合陷阱」
第一篇论文《Cracks in the Foundation》来自 AI2 等机构,瞄准的是四个常年被当成标配的架构选择:QK 归一化、GQA、滑动窗口注意力和预训练上下文长度。
为了控制变量,团队训练了 26 个 7B–8B 参数的模型(取名 OlmPool):数据、分词器、上下文扩展方案完全一致,只有这四组开关的取值不同。每个模型先预训练 140B token,再用 10B token 做长上下文收尾,前后烧掉超过 17 万 GPU 小时。
结果:在 HELMET 32K 长上下文评测上,最好配置 56.4 分,最差 29.9 分,相对差距 47%。单独拨一个开关影响不大——预训练用 4096 还是 8192 上下文、加不加滑动窗口,都只差一两分。真正的坑在组合:滑动窗口加 GQA 一起上,平均掉 9 分,比两者单独影响加起来还多;再叠上逐头 QK 归一化,就是测出来的最差组合。
更反直觉的是 QK 归一化。它当初是为训练稳定加进来的,业内默认是好事。但把 Olmo 3 的 QK 归一化和后置归一化去掉、换成前置归一化,HELMET 分数涨了 6 分;同样的改动放到 Llama 3 上,反而掉 3.8 分。同一个「标配」,换个底子模型,结果完全相反。
论文还推翻了另一个直觉:注意力汇聚(模型把大量注意力堆在开头几个 token 上)一直被当成浪费算力的坏毛病,不少新方法靠「消除汇聚」做卖点。但在 OlmPool 这批模型里,汇聚越明显,长上下文表现反而越好——而 QK 归一化恰好会削弱这种汇聚,这可能正是它拖累长上下文的原因。
反向传播里被吃掉的梯度:输出投影层
第二篇论文《Lost in Backpropagation》来自康奈尔大学,盯上的是所有语言模型都有的输出投影层——把隐藏状态换算成词表打分的那一层。
词表通常有几万个词,隐藏状态只有几千维。这个落差被熟知的一面是「softmax 瓶颈」:模型能表达的下一词分布种类有限。论文指出它还有第二层影响:反向传播时,误差信号要穿过输出层才能传回底层,而输出层的结构把能传回去的信息量卡在隐藏状态维度附近,远小于词表。
团队在 GPT-2、Pythia、Llama 3、OLMo 2、Qwen 3 上实测,把误差信号投影到输出层权重的零空间里看还剩多少:95% 到 99% 的梯度范数在这一步被削掉,幸存信号的余弦相似度只有 0.1 到 0.2。也就是说,每一次反向传播,输出层都在悄悄抹掉大部分训练信号,剩下的那点方向还对不上。
剪掉一层,断的是推理链
第三篇论文《When Fewer Layers Break More Chains》来自图宾根大学,针对的是已经广泛使用的层剪枝——直接删掉几层省算力。此前研究显示部分层贡献很小,剪掉四分之一还能保留八成以上准确率,于是剪枝成了公认的效率手段。
但那些评测都是知识类任务,答案短、靠记忆就能答对。论文换了一种测法:长链推理,配合「测试时扩展」——给模型更多思考 token,或多生成几遍再挑对的,正常情况下想得越久、试得越多越准。
团队用三种主流剪枝方法,从 s1.1-7B 和 Qwen3-8B 上各剪一到两层。知识类评测的分数确实掉得很平缓;但换到数学竞赛难度的 AIME24,s1.1-7B 只剪一层就大幅下滑,剪两层直接接近零。更要命的是,剪过的模型上测试时扩展失效了:思考 token 给得再多,准确率也不见起色。微调也救不回来——LoRA 几乎没用,全参数微调只能救回一部分,离剪之前的水平还差得远。
产业含义:当「默认值」开始被重新审计
三篇论文研究对象完全不同,但拼在一起是一个结构信号:Transformer 这套堆栈跑在「被继承、没被验证」的默认值上,而组合效应意味着你不能一个一个开关地推理。
具体影响有三层。其一,评测设计本身成了战略决策——常规知识基准看不见这三篇论文量到的长上下文、梯度健康与推理代价。其二,长上下文竞赛正在撞上架构现实:各家都在拉长上下文窗口,但模型里已经写死的 QK 归一化/GQA/滑动窗口组合,会决定谁先撞到天花板。其三,行业效率压力持续上升,剪枝和量化会越用越多——这篇论文暗示,被剪过的模型可能正在悄悄丢掉 Agent 工作负载最依赖的推理能力。这其实也是 模型公司开始把训练与推理做成协同设计 的原因之一;而在推理需求重塑硬件结构、CPU 与 GPU 配比走向 1:1 的预期下,把每个参数的效率榨干会从优化变成竞争必需。
你可以做什么
- 把架构选择当组合来审计,而不是单个开关。训练或继续预训练时,把 QK 归一化、GQA、滑动窗口看成互相影响的变量;OlmPool 的结果说明,「踩中几个有害默认值」本身就能当长上下文质量的一阶预测器。
- 别用知识基准给剪枝配方盖章。剪枝后必须在推理和数学任务(AIME 类)上复测,并确认测试时扩展在剪过的模型上仍然有效;失效就说明剪枝藏了能力回退。
- 重新审视「消除注意力汇聚」。OlmPool 显示汇聚与长上下文表现正相关,采用消除汇聚的方法前,先测它对长上下文评测的影响。
- 只给推理链完整的模型分配测试时算力。测试时扩展是放大器:在没剪过的模型上放大推理能力,在剪过的模型上放大噪声。
- 关注三篇论文。COLM 2026 论文集可查,OlmPool 的 26 模型对比是公开资源,可以复现。
想补基础设施与经济侧的背景,可以看我们的 本地推理加速指南 和 2026 AI 趋势总览。