英伟达官方推理指南:投机解码如何让模型贴着硬件极限设计

9月2日,英伟达技术博客上线了一篇官方推理指南,主题是「用投机解码做AI模型协同设计」。芯片霸主罕见地以官方姿态,把「模型该怎么贴着硬件物理极限去设计」写成了规范。核心是一张6种主流推理加速方案的选型表,外加一条硬性约束公式——你的注意力分组数,直接决定草稿该猜几个token。

投机解码在干嘛

大模型逐字吐字,每吐一个词,几百GB参数就得在显存里完整跑一圈,大部分算力都在等内存搬数据。投机解码的解法很粗暴:先用轻量小模型一口气猜出几个token,再让大模型一次性验证。猜对直接收下,猜错从断点重来。因为大模型只接受它自己本来就会写的字,所以输出无损,一个标点都不变。

核心就一个数学期望公式:

Speedup = E[L] × T_target / (T_draft + T_verify)

E[L]是期望接受长度(每轮大模型能相中几个字),分母是额外代价(小模型预测时间+大模型验证时间)。想提速,要么猜得更准,要么猜得更快。

四代演进

  • 外置草稿模型:最古老,单独训小模型当助手。英伟达直接亮价:从头训要1T~10T token。它还在表上,是因为英伟达花200亿美元收购的Groq LPU芯片专攻此道。
  • EAGLE-3:北大/滑铁卢团队,把「逐字往下猜」的串行老路做到物理上限。在新表里被挤到参考位,接受长度已被后浪超越。
  • MTP(多Token预测):Meta 2024年首创,DeepSeek-V3把它锤成标配。英伟达评价是GPU上大模型的最佳选择,但必须在预训练阶段就和主模型绑在一起练。
  • DFlash:拿下6倍无损加速的狠角色(Jian Chen、Yesheng Liang、Zhijian Liu)。彻底抛弃逐字串行,借鉴扩散模型,一次前向计算直接生成整段预测token,把耗时分母压到极致。
  • DSpark:DeepSeek和北大24人团队。DFlash并行虽快但越往后越不准,DSpark在并行底座上外挂极轻的串行模块。在DeepSeek-V4生产环境里比MTP快60%~85%,接受长度比EAGLE-3高约30%。

硬件常数反锁模型架构

很多人以为草稿猜得越多越赚,但硅片有物理规则。验证阶段要处理的token总数是1+D(1个真实输入+D个草稿)。GPU底层把Query和KV头分组,每组注意力核分块大小受物理矩阵边界(Tile Size,当前多为128)约束。于是有对齐公式:

G × (1 + D) ≤ 128   →   D = 128/G − 1

G是注意力分组数。模型设计时怎么分组,直接决定草稿该猜几个字才能严丝合缝填满GPU分块。G=8就猜15个,G=32只能猜3个。跨过边界,哪怕最后一个Tile只用了半块,算力照样按整块扣费。

以前投机解码是模型出炉后工程团队外挂的加速包,现在一个硬件矩阵常数直接反推到了模型架构设计参数上。

实操建议

  • 从零预训练,第一天就把MTP绑进去——后面没法外挂,且它是GPU原生最佳。
  • 已有训练好的模型想要6倍收益,看DFlash:ICML 2026已开源,NVIDIA Model-Optimizer文档给了block-diffusion草稿路径。
  • 选草稿长度前,先按 D = 128/G − 1 用你的注意力分组算一遍,精确对齐别瞎猜。
  • 输出死板重复的场景,n-gram查表(免训练)就够,通用生成再上基于模型的方案。

资源

滚动至顶部