一个周末,Claude 自己把自己跑上了 AMD 新 GPU
故事要从 AMD 给 Anthropic 送去一台搭载 MI355X 的机架说起。
按照惯例,新平台配新软件栈,至少需要几个月的手动适配。Anthropic 团队已经做好了打硬仗的准备。
但他们手里正好有 Claude。
团队让一名工程师试了试:把 Claude 接上机器,丢给它一句话——「去,把这台机器跑起来。」
周末结束,工程师回到工位,屏幕上已经多出一条持续上涨的性能曲线。Claude 不仅跑起来了,性能还在自己一轮轮地往上调。
人类工程师全程没动过一行代码。
这是 AMD Advancing AI 2026 大会上,Anthropic 联合创始人兼首席计算官 Tom Brown 亲口讲的故事。旁边的苏姿丰听完接过话:听说 Anthropic 只有一名工程师在处理 MI355X,她第一反应是让 AMD 团队赶紧去帮忙。结果团队回来告诉她,对方说不用,已经全部搞定了。
英伟达花了 20 年堆起的 CUDA 护城河,就这样被一个 AI 模型在一个周末跨了过去。
不是偶然,是架构变了
Claude 之所以能做到这件事,不是因为 Anthropic 有什么黑魔法,而是因为 AMD 从根本上改变了芯片适配的方式。
在 Advancing AI 2026 大会上,AMD 发布了 ROCm.AI——一套专门为 AI Agent 设计的 GPU 工具箱。核心入口叫 AMD Skills,里面装的全是经过验证的 ROCm 知识。Agent 拿到这些知识后,可以自己装环境、部署模型、读日志、查故障,再通过 ROCm CLI 调用真实机器。开发者说出目标,剩下的路让 Agent 自己找。
划重点:AMD 连芯片说明书的写法都改了。
公司 AI 软件与解决方案副总裁 Anush Elangovan 在现场透露,每一代 AMD GPU 都会公开指令集,并提供 AI 可读的 ISA(指令集架构)。Agent 在读懂手册之后,就能直接上手调性能。
芯片的读者,第一次变成了非人类。
AMD 把自动调优的工作交给了 Hyperloom。它会拉起推理服务,先跑出基线,再去找 CPU 和 GPU 的瓶颈,测试不同配置,生成定制内核,最后把新方案重新跑一遍。现场演示中,Hyperloom 把 MiniMax M3 的输出速度提升了 38%。AMD 还让它一次跑过 1.4 万个模型,把测试结果沉淀成下一次可以直接复用的经验。
AMD 还在和前沿模型公司一起训练这种能力。Elangovan 的原话很有意思:让前沿模型「天生会说 AMD 编程」。
这次实验,变成了一张 50 亿美元的订单
那个周末的实验,迅速接上了真正的部署计划。
7 月 22 日,AMD 与 Anthropic 宣布达成战略合作:AMD 将投资高达 50 亿美元 给 Anthropic,并部署高达 2GW 的 AMD Instinct MI450 系列 GPU 用于运行 Claude。首批 1GW 计划于 2027 年上半年启动。
不仅如此,双方还会直接使用 Claude 来优化 AMD 工作负载,加速 ROCm 软件开发。AMD 的工程和产品开发团队也将「广泛采用」Claude。
这笔交易的意义远超投资金额本身——它意味着 Claude 的算力栈正式实现了 四厂商覆盖:NVIDIA、Google TPU、AWS Trainium,现在加上 AMD Instinct。Anthropic 不再被任何一家芯片厂商锁定。
CUDA 的护城河,到底怎么被 AI 自己拆掉的?
CUDA 从 2006 年走到今天,靠的是无数工程师一行行码出来的生态。编译器、数学库、调试器、性能分析工具、开发文档,该有的全有。更难复制的是那一代代工程师攒下来的手感——算子怎么调,通信怎么提速,显存怎么分配,分布式部署哪里最容易出问题,这些经验全锁在少数专家的脑子里。
后来者就算造出性能接近的芯片,也得把这条软件长路从头走一遍。芯片流片可以按季度推进,生态积累却只能按年去熬。
而 Agent 补的就是这一段。
它会读平台文档,调用性能分析工具,找到速度卡在哪里,再改代码、编译、测试。一个方案没有效果就换下一个;跑分变好就沿着这个方向继续优化。
人类培养一名顶级 GPU 工程师要按年算,多启动一个 Agent 只需要再开一个任务。一名工程师放出一群 Agent,就能并行排查报错、定位性能瓶颈。一次跑通的配置、写好的内核和踩过的坑,也能马上成为下一批 Agent 的起点。
把按年计算的追赶压缩成按任务计算——这就是 AI 对传统芯片生态的降维打击。
芯片公司要争取的开发者,多了一类:Agent
这件事带来的启示,远远超出一家公司的商业合作。
以后看一块芯片,峰值算力和显存带宽当然重要,AI 能不能读懂它、调用它、把性能调出来,也会摆上同一张参数表。
对于 AMD 来说,这是一个弯道超车的绝佳机会。CUDA 生态的护城河是人类工程师一行行码出来的,但 AI 不需要重走那 20 年。如果 Agent 能直接读懂芯片说明书、直接上手调优、直接产出可复用的配置,那么 AMD 缺的不是追赶 CUDA 的时间,而是让 AI 能读懂自己芯片的能力。
对于整个行业来说,这意味着芯片竞争正在进入一个新的维度:生态之争从「谁有更多的开发者」变成了「谁能让 AI 更好地开发」。芯片公司要争取的开发者,现在多了一类——Agent。
中国工程师已经站在这场 AI 改造 GPU 软件栈的最前线。他们沉淀下来的底层经验,也在被整理成更多 Agent 可以调用的能力。追赶 CUDA 的新起点已经出现:把硬件接口和软件工具交给 AI,让 Agent 直接开工。
20 年的生态差距,第一次可以交给一群 Agent 昼夜不停地往回追。
参考来源:
- 新智元/36氪:《CUDA 20年护城河一个周末崩了,Claude独自跑通AMD新GPU》
- AMD 官方新闻稿:《AMD and Anthropic Announce Strategic Partnership》
- The Next Web 报道
- Digital Applied 分析文章
