硬件决定上限,软件决定兑现:8 张 PCIe 显卡跑出近 7 倍 DeepSeek 吞吐

一块被锁住的显卡

8 张普通的 PCIe 显卡,跑 DeepSeek-V4.1-Flash,社区 Day0 基线版本的输入吞吐只有每秒 1932 个 token。同样的 8 张卡,同样的模型,一字未改权重,吞吐冲到了每秒 13274 个 token——接近 7 倍。

这中间发生了什么?没有新算法,没有新芯片,只有一件事:把硬件与框架之间那些"本该生效、却因适配问题被静默绕开"的加速路径,一条条重新接上。

多数人看到这条新闻,会读成"某家公司的优化案例"。值得注意的其实是一个结构性判断:在推理环节,硬件的上限由芯片决定,但硬件实际发挥出多少,由软件栈决定。而这个软件栈,眼下远比我们以为的粗糙。

性能不是缺了,是被锁了

要理解这 7 倍空间从哪来,得先看主流推理框架的运行逻辑。

vLLM、SGLang 这类框架内置了大量高性能算子,但它们只对"官方验证清单"里的硬件生效。一块不在清单内的显卡——消费级 PCIe 卡、国产 GPU、长尾服务器卡——框架不会报错,只会静默降级:走通用逻辑,绕开加速路径。服务照常跑起来,只是慢得多。

更微妙的是,很多高性能内核并非缺失,只是元数据定义、页尺寸配置、内核适配不匹配,导致根本无法被触发。性能就躺在卡里,锁没开而已。

这正是 DeepSeek-V4.1-Flash 案例的第一阶段:对齐元数据、修正页尺寸、补齐 sparse-MLA Prefill 快路径、替换 FP8 稠密 GEMM 慢内核、扩大 PCIe-IPC 通信快路径覆盖范围。没有发明任何新东西,吞吐就从 1932 提到 5850 tok/s。

同样的思路复现在 DeepSeek-V4-Flash 和 GLM5.3 上,仅"算模协同"一个阶段,多款模型就拿到 20%-33% 的吞吐增益。

剩下的问题才是硬件本身的:PCIe 卡间通信带宽远低于 NVLink,直接套用面向高速互联硬件的默认并行策略,GPU 会把大量时间花在等待通信上。算子融合、计算与通信重叠、按 Prefill 和 Decode 阶段差异化配置并行策略、重新调校显存容量——这套"通算重构"做完,吞吐再从 5850 到 13274 tok/s。

"能跑起来"是个陷阱

这里可以提出一个判断工具:可用性三层模型——能装、能跑、能卖。

能装,是权重下载得下来、环境依赖装得上。能跑,是服务可以拉起、请求可以返回。能卖,是吞吐、时延和稳定性达到生产服务标准。开源社区的长尾硬件,绝大多数停在第二层:新模型发布,"能跑起来"的工作宣告结束,再往上爬的路被默认不存在。

这个模型的解释力不止于显卡。KTransformers 项目把 6710 亿参数的 DeepSeek-R1 塞进单张 24GB 的 RTX 4090 加系统内存,靠的是把专家网络卸载到 CPU、注意力留在 GPU 的异构调度——同样是把"理论可行"和"实际可用"之间的软件空间填满。反方向的例子也成立:一块顶级 B300,如果并行策略和通信配置不适配负载,照样有相当比例的算力在空转。

三层之间的落差,就是推理经济学的利润带。它不属于芯片公司,属于愿意做脏活的人。

买卡的逻辑,正在被改写

再算一笔更具体的账。GLM5.3 经全套调优后,输入吞吐从 3236.78 提升到 6222.72 tok/s,P95 首 Token 时延从 141.6 秒降到 46.6 秒,上下文支持上限从 27 万 Token 拓展到 105 万 Token。MiniMax H3 视频生成模型则靠稀疏注意力、风险感知缓存复用和 Turbo LoRA 的组合,把 15 秒参考图生视频的端到端生成速度提升 2.48 倍,峰值显存与稠密基线持平。

这些数字的共同点在于:全部收敛在推理引擎内部,不动模型权重、不改模型结构、不改变业务语义。这意味着优化是可复用的基础设施,而不是绑定某个模型的特技。今天为 DeepSeek 调好的并行策略,明天 GLM 换上来照样受益。

还要看到一条更隐蔽的线索:国产 GPU 恰恰是"验证清单外"的重灾区。注意力模块需要显式启用面向该平台优化的 NSA 稀疏注意力,避免回退到低效路径;Shared Expert 融合这类默认面向 NVIDIA/AMD 平台的特性,则需要主动关闭以绕开不适配的实现。换句话说,框架生态的"默认值"是围绕某几家的硬件写的,清单之外的每一块卡,都在替这些默认值买单。

谁该关心这件事

把框架推演到几个场景。

推理服务的定价逻辑会松动。当 B300 的输入吞吐约为一台 8 卡 PCIe 整机的 4.9-5.6 倍(DeepSeek-V4-Flash 口径;GLM-5.3 上为 3.5-4.7 倍)、而优化后的 PCIe 整机成本可能只有零头,"用顶级硬件换服务能力"就不再是不假思索的默认选项。视频生成更明显:按整机吞吐折算,Ours Cache 方案下约 2.6 台 6000D 对应 1 台 B300 的文生视频吞吐,加上 LoRA 优化后缩到约 1.5 台。这不是说 PCIe 能全面替代高端卡——差距仍真实存在——而是替代边界从"完全不可行"移到了"部分指标可行"。

国产算力的瓶颈同样在软件。同一套方法论在国产 GPU 上验证成立:仅把 Shared Expert 与 Routed Expert 改为并行提交,就在 35 组同配置配对测试中带来 11.26% 的吞吐提升。"能跑起来"对国产硬件同样只是第一步,执行路径、通信模式、并行策略的系统适配,才是从"自主可控"走向"规模化生产"的那一段路。

算力供给约束正在改变优化权的归属。在高端芯片供给受限、采购成本高企的背景下,存量硬件的软件优化能力变成了一种实质性的供给增量。谁掌握了把第二层推到第三层的方法论,谁就在同样的卡上拥有别人数倍的产能。

给你的行动清单

  • 如果你在采购算力:评估方案时别只看卡型号,要求供应商给出"目标模型 + 目标并发 + 优化后吞吐"的实测数据。同一块卡,软件栈差异可以到数倍,"裸框架跑通"的报价可能贵得离谱。
  • 如果你运营推理服务:把框架版本、内核路径、通信配置纳入巡检清单。先确认高性能内核是否真的在执行(而不是静默降级),再谈扩容。Prefill 和 Decode 分开调参,往往是最便宜的一笔优化。
  • 如果你做模型部署工具:长尾硬件适配是被低估的生态位。开源社区"能跑"与"能卖"之间的大片空地,正是工程价值最高的地方。
  • 如果你是个人开发者:消费级硬件 + 异构调度 + 量化,已经足以在本地跑起体量可观的模型。数据不出机器、边际成本只有电费,这两点对敏感业务就是决定性的。

硬件决定上限,软件决定兑现。2026 年的推理市场,兑现率还低得惊人——而低兑现率,就是留给工程团队的空间。

滚动至顶部