单卡 RTX 5090 跑 Wan2.2-A14B:720p 视频生成只要 3.8 秒

以前生成一段 5 秒的 720p 视频,14B 级视频模型要跑数十分钟;现在 LightX2V 团队开源的 LightWan2.2-A14B 把 Wan2.2-A14B 的去噪步数从 40 步压到 4 步,配合 NVFP4 量化感知训练和动态稀疏注意力,单张 RTX 5090 就能跑起来。8 卡下 5 秒 720p 文生视频端到端只要 3.8 秒,比原始 40 步模型最高快 705.8 倍。

为什么值得关注

14B 视频模型在消费级显卡上有两道硬门槛:一是慢——40 步去噪意味着对同一条视频重复跑 40 次完整 DiT 前向,序列约 120K token 时自注意力能占单次推理延迟的 80% 以上;二是装不下——权重、长视频 token、注意力缓冲叠加轻松超过 30GB 显存,直接 OOM。LightX2V 的解题思路可以概括为「少算、少占、少等」。

四步拆解

1. 步数蒸馏:40 → 4

Phased DMD 把信噪比区间拆成多个阶段,让不同专家学习不同噪声区间的去噪行为,每阶段只为一步保留梯度;SGMD 用 teacher stop-gradient Fisher 目标让 fake score 对齐 teacher score,并通过 NR/RC 双势能跟踪持续更新的生成器。最终形成「两步高噪声专家 + 两步低噪声专家」的 4 步推理流程,DiT 骨干少跑 36 次,同时保留运动动态、视觉细节与输出多样性。

2. NVFP4 量化感知训练

NVFP4 用 E2M1 4 比特数值、每 16 个元素共享 FP8 E4M3 块级缩放 + FP32 全局缩放,存储和带宽接近 FP4 但动态范围更好。量化感知训练直接融进步数蒸馏,让学生模型在训练阶段就适应 4 比特误差,再用 CUTLASS 内核映射到 Blackwell Tensor Core(双 NVFP4 Block-Scaled GEMM、FP32 累加、BF16 输出、epilogue 融合列偏置),线性层显存流量和 GEMM 延迟一起降。

3. 动态稀疏注意力

先用 Q/K 块级均值估算注意力重要性,运行时只保留约 10%–20% 的关键块(稀疏率 80%–90%),选中块内部仍稠密计算以保住 GPU 吞吐,并接入 SageAttention2 形成 FP8 稀疏注意力路径,削减密集矩阵乘和注意力双重开销。

4. 融合内核 + 异步卸载 + 多卡并行

3D RoPE、RMSNorm 换成融合/并行内核,减少 Python 调度和临时张量;Block 级卸载按 Transformer 块搬运权重,计算与搬运异步折叠,14B 模型加长视频序列也能塞进单卡显存。多卡侧用 Light-Ulysses 序列并行:FP8 通信、QKV 张量融合成一次 All-to-All、Triton 前后处理融合内核、Head 级异步流水,把长序列注意力的通信量和同步等待压到最低。

快速上手

# 官方镜像(5090 锁定依赖环境)
docker pull lightx2v/lightx2v:26052801-cu130-5090

# 单卡:文生视频 / 图生视频
bash scripts/wan22/extreme/run_wan22_moe_t2v_extreme.sh
bash scripts/wan22/extreme/run_wan22_moe_i2v_extreme.sh

# 多卡序列并行(seq_p_size 按实际卡数设置)
bash scripts/wan22/extreme/run_wan22_moe_t2v_extreme_sp_parallel.sh
bash scripts/wan22/extreme/run_wan22_moe_i2v_extreme_sp_parallel.sh

手动安装可从 LightX2V 源码构建,并用 NVIDIA CUTLASS 编译 NVFP4 Kernel。

实测数据

  • 8×RTX 5090:T2V 720p 3.8 秒(705.8×)、I2V 720p 4.5 秒(599.3×),双双跨过实时生成线(生成时长 < 视频时长)。
  • 单卡:T2V 720p 22.5 秒(118.7×)、I2V 720p 26.7 秒(100.5×)、I2V 480p 10.7 秒。
  • 对比 TurboWan2.2:同为 4 步单卡,I2V 在 480p / 720p 分别快约 3.5 倍和 2.4 倍。

实践建议

  • 先跑官方 Docker 镜像,依赖环境已锁定;源码构建要自己用 CUTLASS 编 NVFP4 内核,别在环境上耗时间。
  • 单卡场景别关 Block 级异步卸载——它是 14B 模型能装进消费级显存的关键。
  • 多卡把 seq_p_size 设成实际 GPU 数,脚本已默认开启序列并行配置。
  • 想达到实时生成,8 卡是门槛;单卡适合草稿和快速迭代。

资源

滚动至顶部