AI Agent 10小时凿开CUDA护城河:推理侧才是真正的变局

一、10小时,发生了什么

一家成立仅一年的小公司 Infinity,用自研的 AI 编程 Agent Ignition,为芯片创企 d-Matrix 搭建了一套类 CUDA 软件。耗时:10小时

Ignition 的工作流程很简单:生成 GPU Kernel → 编译 → 运行测试 → 测量性能 → 根据反馈改写代码。人类工程师只给高层方向,剩下的琐碎工作由 Agent 反复循环。

Infinity 创始人 Jeremy Nixon(前 Google Brain 研究员)对 Business Insider 表示,这证明了英伟达最深的护城河之一正在被跨越。公司目前估值已达 1 亿美元,并拿到了 1500 万美元融资。

不止 Infinity。DeepSeek 创始人梁文锋最近也表示,AI 编程 Agent 加上自研的 TileLang 语言,让 AI 底层软件的构建变得「大幅容易」。DeepSeek 已开源 TileKernels GPU 算子库,用 TileLang 编写,省去了大量手写 CUDA 代码。

CUDA 被「凿开」了——但凿开的不是全部,而是一个关键的缺口。

二、拆解 CUDA:三层结构,一层在松动

要理解这次冲击的实质,先得看清 CUDA 到底由什么构成:

第一层(内核层): GPU Kernel、编译器、运行时——直接让芯片干活。
第二层(库层): cuBLAS、cuDNN 等高度优化的计算库,以及调试、验证工具。
第三层(生态层): PyTorch/TensorFlow 等框架、企业积累的数百万行代码、开发者社区。

Infinity 攻入的是 第一层:为不同芯片自动生成和优化推理 Kernel。这是最底层、最需要「手搓」的部分,也是新芯片进入市场时最大的软件障碍。

过去,为一块新芯片写底层软件需要数月到数年。AI Agent 把这个周期压缩到了小时级——这对于芯片挑战者来说,是质变级的利好。

三、为什么是推理侧先破防?

训练和推理,是两个完全不同的战场。

训练侧: 需要上万块卡协同跑数月,对性能、稳定性、集群通信极度敏感。CUDA 在这里的累积优势——通信库、故障恢复、大规模调试——几乎不可替代。企业不敢轻易换平台。

推理侧: 小集群甚至单卡就能跑。客户在乎的不再是「极致性能」,而是「每个回答的成本」。只要能跑、便宜,就愿意试。

韩国 AI 芯片公司 Rebellions 首席商务官 Marshall Choy 直言:「在推理侧,CUDA 不再是决定因素。这将是一场开源软件的竞争。」

推理框架可以跨芯片运行。如果用户在芯片间切换时无需重写代码,CUDA 最大的锁定效应就此失效。

d-Matrix 本身就是一家主打推理的芯片公司。联合创始人 Sid Sheth 判断,AI 推理带来的机会最终会超过训练。这正是他们找 Infinity 用 AI Agent 快速搭建底层软件的原因。

四、多方博弈:谁在进攻,谁在防守

进攻方:

  • Infinity(AI Agent 加速芯片适配)—— 10 小时搭建类 CUDA 软件,目标直指推理芯片
  • DeepSeek(TileLang/TileKernels)—— 用高层语言替代手写 CUDA,降低底层开发门槛
  • Rebellions、Cerebras、亚马逊 Inferentia、谷歌 TPU、AMD MI300X—— 各路芯片厂和云巨头已在推理侧排兵布阵

防守方:

  • 英伟达自己的 AI Agent—— 开发者生态副总裁 Ankit Patel 表示:「我们也在用 AI Agent 更快地开发 CUDA,并在更大规模上验证。」
  • CUDA 的验证工具链—— 前英伟达工程师、INT21 创始人 Bing Xu 指出,Agent 能生成大量代码,但验证才是最大瓶颈。CUDA 最深的资产恰恰是它的验证生态。

中间派:

  • Chris Lattner(Modular 创始人、LLVM 作者)—— 给炒作泼了冷水:写代码只是软件工程的一小部分,生产级优化才是决定芯片性能的关键;芯片软件是精英小众领域,AI 训练数据天然少;数百万行存量代码的迁移成本不是技术问题,是组织决策。

五、框架推演:护城河在「位移」,而非「消失」

综合各方观点,一个更清晰的图景浮现出来:

1. 训练侧:CUDA 短期无忧。 大规模训练对集群协同、稳定性、性能的极致要求,使得任何替代方案都面临极高的质量门槛。锁定效应根深蒂固。

2. 推理侧:缺口已开,但≠颠覆。 推理市场确实在松动,但松动的速度取决于:AI Agent 对芯片软件生产效率的提升,能否快过英伟达自我迭代的速度。

3. 护城河正在从「代码存量」迁移到「验证生态」。 这是最关键的洞察。Bing Xu 的判断——验证生态将成为 CUDA 的下一道护城河——值得深思。当代码生成变得廉价,证明代码「在各种边界条件下都算对、跑得稳」的能力,就变成了稀缺资源。

4. 开源 vs 封闭:推理侧将是开源软件的战场。 跨芯片推理框架让用户可以在不同硬件间切换,这种「芯片无关」的能力正是 CUDA 锁定效应的反面。

六、落到行动:AI 从业者可以关注什么

  • 关注 AI Agent 在系统软件领域的进展。 如果 Agent 能持续降低芯片适配成本,新芯片进入市场的门槛会大幅下降,这意味着更多竞争、更快迭代、更低价格。
  • 推理成本下降的幅度可能超预期。 推理芯片 + AI Agent 加速适配的组合,可能让推理成本以比训练更快的速度下降。
  • 验证工具链的价值重估。 当代码生成变成 commodity,验证和测试能力将成为新的竞争壁垒。这对 AI 工程化有广泛启示——不只是芯片,任何 AI 生成代码的领域都一样。
  • 英伟达的「以矛攻盾」策略。 英伟达自己也在用 AI Agent 加速 CUDA 开发。这意味着,进攻方的相对优势会打折,但英伟达自身的迭代速度也会加速。

一句话总结:CUDA 没有被「颠覆」,但它的护城河正在从「我有 20 年的代码」向「我有 20 年的验证工具」迁移。推理侧是这场迁移的第一战场。

这场攻防的最终悬念,不是谁赢了,而是护城河的定义变了之后,谁在新定义下占据有利位置。

参考来源:
- Business Insider: Nvidia's CUDA faces new threats from AI coding agents
- 量子位报道

滚动至顶部