HBM 装不下了:AI SSD 正在成为 LLM 推理的新存储层级

大模型推理正在同时撞上两堵墙:一堵是容量墙,一堵是 I/O 墙。

模型参数持续扩大,长上下文、多轮对话和智能体任务让 KV Cache 快速膨胀;MoE 模型虽然大幅降低了单次计算的激活参数量,却需要保存远大于显存或内存容量的专家权重。在云侧,昂贵的 HBM 被模型权重和 KV Cache 长期占用,GPU 有效利用率受制于数据搬运;在端侧,有限的 DRAM 或统一内存直接限制了本地可运行模型的规模。

当显存和内存越来越难以独自承接推理负载,一个此前被严重低估的角色开始浮出水面:SSD。它正在从"模型文件的静态存放设备",进入大模型推理的实时数据路径,成为 HBM、VRAM、DRAM 之后的一层正式存储层级。

为什么 SSD 必须进入推理路径

这不是概念炒作,而是推理基础设施已经发生的真实变化。月之暗面的 Mooncake 采用以 KV Cache 为中心的分离式推理架构,把 GPU 集群中未被充分利用的 CPU、DRAM 和 SSD 组织为分布式缓存资源,冷数据可以长期驻留在大容量、低成本的闪存层。2026 年,英伟达推出 CMX 上下文内存存储平台,在 Vera Rubin 基础设施中增加一个面向 KV Cache 优化、通过以太网连接的闪存层级——英伟达将其定义为介于 GPU 内存与共享存储之间的 pod 级上下文层。

产业信号已经很明确:SSD 正在成为推理系统需要直接调度的资源,而不再只是模型加载前后的外围设备。

但问题也随之而来:推理系统开始调用 SSD,并不等于传统 SSD 已经适合承担常驻推理任务。传统 SSD 面向文件和块数据存储设计,性能指标围绕顺序带宽、随机 IOPS、可靠性与单位容量成本展开;LLM 推理需要的却是具有严格时序约束的数据供应。KV Cache 在 prefill 阶段集中生成并持续写入,后续按会话、模型层和 Token 位置反复读取;MoE 推理需要根据路由结果在每一层计算前及时取得特定专家权重。一次读取没赶上计算窗口,GPU 就要空转等待。

更深层的矛盾在 SSD 内部:NAND Flash 以页为单位读取、以块为单位擦除,FTL 要执行地址映射、垃圾回收和磨损均衡,容易产生写放大与尾延迟;持续写入 KV Cache 对闪存寿命的要求也远高于普通消费负载。传统 LBA 排布不了解模型层、MoE 专家、KV 块及其访问顺序之间的语义关系,相互关联的数据可能被分散到不同物理位置,难以形成可预测的并行读取。

两条技术路线:强化 I/O,还是参与推理调度?

于是市场上出现了多种被称为"AI SSD"的产品。目前还没有统一的技术定义,主流方案大致分为两类。

路线一:AI 负载强化型企业级 SSD

这类产品仍以块存储设备为基本形态,但设计指标开始围绕 AI 集群的数据路径重新排序。代表产品是英韧科技的洞庭 N3X 系列——采用 XL-Flash、SLC NAND 等低时延高耐久介质,重点服务 KV Cache 卸载和高并发临时数据读写。据公开材料,相比传统 TLC SSD,访问时延可降低至约三分之一,写入吞吐量提高约三倍,DWPD 提高 17-33 倍——价值不只是峰值性能,更在于减少持续写入和垃圾回收带来的性能波动。

华为 OceanDisk 则用系列化产品组合覆盖不同 AI 负载:EX 560 强调极高随机写入和微秒级写入时延,面向微调与高频缓存写入;SP 560 平衡性能、耐久与成本,面向集群推理中的 KV Cache 和长上下文;LC 560 单盘容量最高 245TB,用于承载训练语料、向量库和模型文件。这说明"AI 负载强化"并非单一规格,而是正在分化为极致性能盘、高性价比推理盘和超大容量盘等产品线。

路线二:推理参与型 AI SSD

第二类更进一步,试图改变 SSD 在计算机中的运行逻辑:通过主控、固件、中间件与 OS 层协同,建立近似"NAND Flash 与 DRAM/VRAM 联合虚拟化"的多级存储体系,让部分模型权重、MoE 专家和 KV Cache 在推理运行期间驻留于 SSD,并按计算进度动态换入内存。

群联的 aiDAPTIV 方案把超过 VRAM 容量的模型权重切分为数据块,根据模型执行过程在 VRAM 与 SSD 之间流式传输:当前需要计算的权重优先留在 VRAM,暂时不活跃的权重下沉至 SSD,在不增加 GPU 数量的情况下扩展可加载模型规模;推理时还会保存原本可能被逐出的 KV Cache,避免重新执行 prefill。其专用缓存 SSD 耐久性最高达 100 DWPD。

江波龙选择"SPU 硬件执行 + iSA 软件决策"路线——WM8500 SPU 采用 5nm 工艺,集成了存内无损压缩、HLC 高级缓存和混合 NAND 调度:存内压缩提高有效容量和带宽利用率,HLC 让 SSD 承接原本驻留在 DRAM 的温冷数据,混合 NAND 机制按冷热程度在不同介质区域调度数据。与群联强调 VRAM 扩展不同,江波龙试图把 SSD 主控从数据通道升级为存储侧智能调度节点。

寅谱与联芸的技术联盟则试图贯通计算侧缓存体系、middleware、firmware、controller 与 NAND 介质管理:围绕 MoE 专家、KV Cache 和数值精度三个维度做数据切分、冷热分层与预测式预取,把模型文件按数值精度拆成较热的低精度位和较冷的高精度位分别处理,目标是在不修改模型文件、不侵入主流推理框架的条件下适配不同处理器平台。

一个理解 AI SSD 的框架

可以把这轮变化理解为存储角色的三重升级。

第一重:从仓库到流水线。传统 SSD 是模型文件的"仓库",推理前把权重搬进内存就完事;AI SSD 变成了"流水线上的缓存工位",数据供应要跟上计算节拍,读慢了 GPU 就空转,等于烧钱。

第二重:从容量军备到延迟军备。传统存储比拼顺序带宽和单盘容量;AI 推理比拼的是低队列深度、细粒度访问下的稳定延迟。峰值 IOPS 再高,只要一次读取赶不上计算窗口就没有意义。

第三重:从外围设备到成本变量。当产业评价指标从"峰值算力"转向"每 Token 成本、单位功耗吞吐、有效算力利用率",SSD 的容量成本优势(单位容量价格远低于 HBM)让它成为 Token 经济学的关键调节阀——把更多冷数据从 HBM 挪到闪存,意味着更低的推理边际成本。

推演:产业竞争才刚开始

几个可以预见的趋势:

第一,AI SSD 不会取代 HBM、VRAM 或 DRAM,而是通过容量、性能和成本的重新分层,成为云侧、边缘侧和端侧设备中的 Token 生成基础设施。存储层级从"两三层"变成"四五层",每层各司其职。

第二,竞争门槛正在从"开发一款高带宽高 IOPS 的 SSD"升级为"建立从 NAND 控制、推理调度到整机适配的完整协作体系"。群联与寅谱-联芸的方案已不止于概念展示,正在消费级 AI PC、工作站、边缘平台和企业级推理节点同步验证——先发者正在积累主控、固件、运行时、模型生态和整机验证数据,形成生态壁垒。

第三,MoE 模型的本地化部署和长上下文应用是最大的受益场景。推理参与型 AI SSD 让端侧设备有机会承载远超 DRAM 容量的 MoE 模型,也让长上下文场景不必为每多一段历史支付 HBM 的昂贵成本。

落到行动

对普通开发者,这轮变化的直接启示有三点:

一是评估推理成本时别只盯着 GPU 单价,把 KV Cache 的驻留层级算进去——同一条长上下文,放 HBM 还是放 SSD,边际成本差一个数量级。

二是做长上下文或多智能体应用时,关注推理框架对多级缓存的调度能力(如 Mooncake 这类 KV Cache 分离式架构),而不是盲目堆显存。

三是选购 AI PC 或工作站跑本地 MoE 模型时,"AI SSD"正在成为与内存容量同等重要的配置参数——群联、江波龙、联芸的方案已开始进入消费级产品。

当整个行业把目光从"算力有多大"转向"每个 Token 多少钱"时,存储就不再是配角。HBM 装不下的部分,正在变成 AI SSD 的机会。

滚动至顶部