AI 编程 Agent 10 小时复刻 CUDA 核心能力:英伟达 20 年护城河,正在被它自己喂大的 AI 反噬

8 月初,一则消息在 AI 芯片圈炸开了锅。

一家成立仅一年的初创公司 Infinity,用自己开发的 AI 编程 Agent Ignition,为 AI 芯片公司 d-Matrix 的推理芯片搭建了一套完整的底层软件栈——从 GPU Kernel 生成、编译、测试到性能优化,全程 AI 驱动。

只花了 10 小时。

具体数据是:Ignition 在首次访问硬件后的 10 小时内,达到了该芯片理论峰值性能的 92%;10 天内,让 Qwen3、Qwen3.5、Gemma4 三款前沿模型在该芯片上端到端跑通——每一层代码都是 AI 从头生成的。

对比之下,这个流程过去需要工程师团队数月甚至数年。

英伟达花了近 20 年构建的 CUDA 软件帝国,被一个 AI Agent 在 10 小时内"复刻"了核心能力层。

这不是危言耸听。这是正在发生的事实。


拆解:Ignition 到底做了什么,没做什么

要理解这个事件的真实分量,先得拆解 CUDA 的层次结构。

CUDA(Compute Unified Device Architecture)不是一门编程语言,而是围绕英伟达 GPU 建立的 三层软件平台

  • 底层(内核层):Kernel 生成、编译器、运行时——让芯片干活的指令集
  • 中间层(库层):cuBLAS、cuDNN 等高度优化的计算库,以及调试、验证、性能分析工具
  • 上层(生态层):PyTorch/TensorFlow 框架、企业积累的代码工作流、数百万开发者社区

Infinity 的 Ignition 攻入的主要是 第一层:为特定芯片自动生成和优化推理 Kernel,并围绕这些 Kernel 搭建底层软件能力。

Ignition 的工作流是一个典型的"AI 闭环":

写代码 → 编译 → 运行 → 测试正确性和性能 → 根据反馈循环迭代

这种任务对 AI Agent 而言天然适配——因为反馈信号明确(能否编译?结果对不对?性能是否提升?),不需要模糊判断。

但要注意的是,Ignition 没有在 10 小时内复制 CUDA 全栈。它没有触及中间层那些经过 20 年打磨的优化库,更没有触及上层数百万开发者的代码生态。

它做的是更关键的事:证明了一条新路径的可行性。


建框架:为什么这次不一样?

"CUDA 被替代"的叙事每隔几个月就会出现一次。AMD 的 ROCm、Intel 的 oneAPI、Google 的 TPU……每次挑战者出现,分析师的结论都是"撼动不了"。

但这次有两点不同。

1. 攻击方是 AI 本身,不是另一家软件公司

过去,挑战 CUDA 意味着需要组织一支和英伟达相似的工程师团队,花数年时间适配、优化、验证。这是一个 人力密集型 的游戏,英伟达靠规模优势碾压。

但 Ignition 的路径是:用 AI 自动生成代码,用 AI 自动测试和优化。这意味着软件栈的构建成本正在从"人力规模"转向"算力规模"——而算力是商品,可以按需购买。

DeepSeek 也在做类似的事。他们开源了 TileKernels 算子库,用自研的 TileLang 编写,大幅减少手写底层 CUDA 代码。DeepSeek 创始人梁文锋最近公开表示,编程 Agent 加上 TileLang,让 AI 软件构建变得"实质性更容易"。

2. 战场在推理侧,不是训练侧

这是最容易被忽视的关键点。

大模型的计算分两段:训练推理。在训练侧,CUDA 目前依然近乎无解——大规模训练对性能、稳定性、集群协同极为敏感,企业选择极其保守。

但在推理侧,游戏规则变了。

韩国 AI 芯片公司 Rebellions 的首席商务官 Marshall Choy 说得很直白:

"在推理侧,CUDA 不再是决定因素。这将是一场开源软件的竞争。"

推理在乎的不是"极致性能",而是"每个回答的成本"。只要能跑、便宜、够用,客户就愿意试。而推理软件可以跨芯片运行——如果推理框架支持多种芯片,用户就能在不同硬件之间切换,不用重写代码。

CUDA 最大的锁定效应——厂商锁定——在推理侧就此失效。


推演:护城河在迁移,而不是消失

这就引出了最核心的问题:英伟达的护城河到底还在不在?

答案是:还在,但它在迁移。

短期:训练侧安全,推理侧松动

短期内,英伟达在训练侧的主导地位不会动摇。大规模训练集群的稳定性、芯片间通信、故障恢复——这些能力不是靠 10 小时的 Agent 生成就能解决的。

但推理侧正在变成"第二战场"。d-Matrix、Rebellions、Cerebras、AMD、亚马逊 Inferentia、谷歌 TPU……各路芯片厂已经排兵布阵。他们不需要立刻替代英伟达,只需要证明:在某些推理任务中,不依赖 CUDA 也能跑得更快或更便宜。

中期:验证生态成为下一道护城河

这个问题最深刻的洞察来自 Bing Xu(INT21 创始人,此前创办的芯片软件公司 HippoML 被英伟达收购):

Agent 能在短时间内生成大量代码,但 验证才是最大瓶颈。AI 生成一万行代码很快,但"证明这一万行在各种边界情况下都算得对、跑得稳"极慢。CUDA 最深的资产恰恰是它的验证工具链。

换言之,护城河正在从 "代码的存量" 迁移到 "验证和优化的生态"

生成代码是 AI 擅长的,但验证代码——尤其是在小众芯片领域,需要大量领域知识和测试数据——仍然是 AI 的短板。谁先占住验证生态的位置,谁就是下一个赢家。

长期:英伟达也在用 AI

还有一个容易被忽略的变量:英伟达自己也在加速。

英伟达开发者生态副总裁 Ankit Patel 明确表示:"我们也在使用 AI Agent 来更快地开发 CUDA,并在更大规模上进行验证。"

以己之矛,攻彼之盾。进攻方的相对优势也会打折。

Bing Xu 总结得很到位:这场仗的胜负,取决于竞争对手追赶英伟达的速度,能否快过英伟达自我迭代的速度。


落到行动:四条判断

  1. 如果你在选推理芯片:不要只看纸面参数。重点关注该芯片的软件生态是否支持"跨芯片推理框架"(如 vLLM、TensorRT-LLM 的多芯片兼容性),这决定了你未来的议价能力。

  2. 如果你是 AI Infra 工程师:花时间研究 AI 编程 Agent 在 GPU Kernel 生成上的能力边界。Ignition 和 DeepSeek TileKernels 是两条值得跟踪的路径。这可能是未来 12 个月你最需要关注的技能方向。

  3. 如果你是芯片创业公司:你的核心竞争力不再是"硬件比英伟达好多少",而是"你的软件适配速度有多快"。如果你能用 AI Agent 把适配周期从 12 个月压缩到 1 个月,你的硬件即使只有英伟达 70% 的性能,也有生存空间。

  4. 如果你是投资者:关注"AI 原生芯片软件栈"这个赛道。Infinity 的 $15M 种子轮和 $100M 估值只是开始。当 AI 可以自动生成底层计算软件时,芯片创业的入场门槛在降低,但投资逻辑也会从"押注硬件"转向"押注软件生态"。


一句话 thesis: 英伟达 20 年构建的 CUDA 护城河,不是被某家竞争对手攻破的,而是被 AI 编程 Agent 这种新的软件生产方式从根本上重新定义了竞争规则——护城河从"代码存量"变成了"验证生态",而这场变革的起点是推理侧。

参考来源:Business Insider、36氪/量子位、Infinity 官方案例、Semianalysis、The Next Web

滚动至顶部