AMD跑GLM 5.2跑赢英伟达,但真正在赢的不是AMD

假如你是一个云厂商的采购负责人,你现在要为一个推理集群做选型。你面前有两个方案:一台英伟达 B200,一台 AMD MI355X。英伟达的单卡价格接近 AMD 的 2.75 倍,但它的软件生态更成熟,部署更省心——"买英伟达就是买省心",这是这个行业过去五年最牢固的共识。

但如果我告诉你,这个共识正在加速瓦解呢?

这周,一家只拿过 400 万美元种子轮的公司 Wafer,在 AMD MI355X 上跑通了智谱最新开源模型 GLM 5.2。结果是这样的:单节点聚合吞吐做到了 B200 的 80%,而成本只有英伟达的一半。

消息一出就冲上了 Hacker News 第二。评论区里挤满了追问技术细节的同行——不是因为他们不相信,而是因为他们太想知道"怎么做到的"。

这件事如果只看表面,是一个"AMD 越来越能打"的故事。但如果往深看,它揭示的是一个更本质的结构性变化:英伟达的护城河,正在从三个方向同时被侵蚀。

一、一条正在实时消融的护城河

先看数据。

Wafer 把 GLM 5.2 的权重从 BF16 压缩成 MXFP4 格式(用的就是 AMD 自家的 Quark 工具),精度几乎没有损失——GSM8K 从 96.5% 降到 95.5%,GPQA-Diamond 从 92.2% 降到 90.3%,tau2 反而从 81.9% 涨到了 83.4%。

然后他们用 sglang 作为推理引擎。过程中遇到了两个问题:一个是 MTP 头的权重命名不对,导致加载崩溃;另一个是融合 kernel 里硬编码了 CUDA 头文件,没给 ROCm 留分支。

解决方式也简单:第一,把共享专家层在 sglang 实际使用的命名下重新登记一遍;第二,加一行 #ifdef USE_ROCM 编译保护。

两行代码级别的改动,让单流吞吐翻了将近 3 倍,最终达到 213 tok/s。

在聚合吞吐的场景下(20k 输入、1k 输出、缓存命中率 60%),他们进一步把并行方式从 TP8 换成 TP4×DP2,再按 GLM 5.2 专家层的实际形状手动指定了 AMD kernel,最终拉到 2626 tok/s/node——B200 同等负载下跑出 3192 tok/s。

80% 的性能,不到一半的成本。

但真正值得关注的不是这个数字本身,而是 Wafer 在博客里自己写的一句话:"这一次,我们不需要写任何定制 kernel。"

要知道,就在几个月前,他们为了在 AMD 上跑 Qwen3.5 397B,还得自己手搓融合 kernel,把六次 GPU 调用并成一次,才勉强冲到 AA 榜单第一。而现在,对 GLM 5.2 的适配已经退化成了"排查几个框架兼容性问题,补两行代码"。

驱动这个变化的是什么?不是 AMD 的市场团队,是两个东西的化学反应:AI 辅助工程能力的提升 + AMD 官方工具链的加速补齐。

Wafer 自己的定位就是用 AI 优化 AI 基础设施。他们团队不过几十号人,能追着模型发布的节奏做适配,靠的是 agent 在 kernel 和模型优化上的能力越来越强。而 AMD 那边,ROCm 生态也在快速收敛——从"每次都要重写 kernel"进化到了"工具链基本能用,只是有几个坑还没填"。

这两个趋势的交叉点,就是 Wafer 这类小公司存在的前提:做英伟达和 AMD 官方"本应做完但还没做完"的适配工作。

二、"三层护城河"框架

英伟达的护城河到底有多深?它是怎么构成的?拆开来看,可以分为三个层次:

第一层:硬件护城河(最浅)。 算力、显存、带宽。AMD 的 MI355X 在纸面规格上已经逼近甚至部分超越同代 B200。这层差距本来就在快速缩小,但它从来不是英伟达真正的壁垒。

第二层:软件护城河(正在变浅)。 CUDA 生态、cuDNN、TensorRT——经过十五年积累,英伟达的软件栈被认为是"不可复制的优势"。但 AMD 的 ROCm 在快速追赶,而且追的方式很有意思:它不是靠 AMD 自己把所有坑都填完,而是靠第三方优化公司(如 Wafer)和 AI agent 联合完成"最后一公里"的适配。

第三层:速度护城河(最深)。 Day-0 支持——英伟达能在新模型发布的当天就提供优化好的推理方案,而 AMD 往往要等几周甚至几个月。这是 Wafer 这类公司存在的核心原因:把 AMD 的速度差距从"几个月"压缩到"几天"。

三层的厚度不同,但关键的变化是:第二层和第三层之间出现了一个裂缝。

当 AI agent 能在几天内补齐 AMD 生态的兼容性缺口时,"Day-0 支持"就不再是英伟达的独家能力。只要模型是开源的,只要 AMD 的芯片还在,就会有人——大公司、创业公司、甚至开源社区——来填这个适配的时间差。

三、谁在填这个坑,谁在受益

把这个框架套到几个玩家的身上,脉络就更清楚了。

对于云厂商——推理价格大概率还会下探。AMD 的硬件本身就更便宜,现在适配成本也在快速下降。云厂商只要能跑通更多开源模型,就有理由在推理侧给出比英伟达更有竞争力的定价。这会直接改变模型厂商的部署决策链。

对于开源模型(GLM、Qwen 等)——被更多云厂商低成本采购,本身就决定了它能不能在推理侧跟闭源模型抢用户。GLM 5.2 在 AMD 上跑出性价比优势,意味着智谱的模型可以以一个更低的"隐形门槛"出现在更多云厂商的货架上。

对于英伟达——他们没有变弱,但游戏规则变了。过去,英伟达的竞争力是"你花的每一美金都值——因为省心"。但当省心的溢价越来越贵(B200 价格因供不应求而飙升),而 AMD+AI agent 的组合越来越"够用"时,"省心溢价"的合理性就会受到挑战。

独立测试机构 SemiAnalysis 在 5 月的测试中也记录过类似的节奏:AMD 团队在 Qwen3.5 上花了 14 周补齐软件差距,把成本曲线拉到反超英伟达——每百万 token 0.22 美元,英伟达 B200 是 0.30 美元。

但这组数据有两个重要的限定条件:第一,只覆盖单节点部署,多节点、大规模集群场景下英伟达仍然占优。第二,这里的"成本"是硬件 TCO+适配成本,并不包括迁移团队经验的机会成本。对于已经把系统架在 CUDA 上的大厂,迁移成本远不止芯片差价。

所以英伟达的护城河不是一夜消失的,而是从最薄弱的边缘开始变浅——单节点推理、开源模型适配、对价格敏感的增量客户。然后,从边缘向核心推进。

四、如果你现在要选推理芯片

如果你是中小型 AI 应用开发者——AMD 的性价比已经到了值得认真评估的阶段。找个 Wafer 这样的公司(或者自己跑一遍他们的公开方案),拿你的实际负载测一测。不要只看纸面吞吐,要看你真实场景下的首 token 延迟、缓存命中率和成本曲线。

如果你是大型云厂商——继续用英伟达做核心集群没有错。但你应该在边缘推理集群上积极部署 AMD 节点。这不是"切换供应商",这是"增加一个采购维度"。AMD 的存在本身就是你们跟英伟达谈价的筹码。

如果你是技术决策者——别再问"AMD 能不能取代英伟达"这种二元问题。真正的问题是:在你的具体场景下,AMD 的"成本优势"是否能覆盖"适配成本+性能差距"?这个问题的答案,每 6 个月就会变一次,而且每次都在朝 AMD 有利的方向移动。


参考资料:
Wafer: GLM 5.2 on AMD MI355X(wafer.ai/blog/glm52-amd)
Wafer: Kernels Are Still the Moat(wafer.ai/blog/kernels-are-still-the-moat)
SemiAnalysis AMD vs NVIDIA 推理成本对比(2026 年 5 月)

滚动至顶部