AI 编程 Agent 10 小时「复刻」CUDA:英伟达 20 年护城河真的被凿开了吗?

AI 编程 Agent 10 小时「复刻」CUDA:英伟达 20 年护城河真的被凿开了吗?

上周,一个消息在 AI 和芯片圈同时炸开:一家成立仅一年的 AI 软件公司 Infinity,用 AI 编程 Agent 只花了 10 小时,就为芯片初创公司 d-Matrix 搭建了一套类 CUDA 软件栈。

消息一出,讨论迅速分裂成两派。一派高呼「英伟达完蛋了」,另一派冷静指出「这只是个 Demo」。

但真相远比口号复杂——也远比口号有意思。

一、10 小时发生了什么?

Infinity 的核心产品叫 Ignition,是一个 AI 研究 Agent。它的工作方式很像人类工程师,只是快得多:

  • 生成 GPU 内核代码——针对目标芯片的架构特点,自动生成计算 Kernel
  • 运行测试——验证代码正确性
  • 测量性能——评估是否达到硬件峰值
  • 根据反馈自动改写——形成一个「写代码→编译→运行→测试→优化」的完整闭环

具体到这次合作,Ignition 在首次接触 d-Matrix 的 Corsair 芯片后,10 小时内达到了该芯片理论峰值的 92%,并在 10 天内让 Qwen3、Qwen3.5 和 Gemma4 三个前沿模型在该芯片上完整跑通。

这个速度有多夸张?过去,为新芯片编写底层推理软件,通常需要数月甚至数年。

Infinity 也因此拿到了 1500 万美元的种子轮融资,估值达到 1 亿美元。

二、CUDA 的护城河到底长什么样?

要理解这次「冲击」的含金量,得先搞清 CUDA 到底是什么。

很多人把 CUDA 当成一个编程语言,但实际上它是一整套围绕英伟达 GPU 的软件平台,可以拆成三层:

  • 底层:Kernel 编译器、运行时——直接让芯片干活
  • 中间层:cuBLAS、cuDNN 等高度优化的计算库,以及调试、验证工具链
  • 最上层:PyTorch、TensorFlow 等开发框架,企业积累的海量代码和工作流,以及数百万开发者生态

把英伟达 GPU 想象成一座工厂:底层告诉机器每一步怎么操作,中间层提供现成的生产工具,最上层则是一整套已经运转多年的生产体系。客户买到的不是一块卡,是一座开箱即用的工厂。

这就是为什么英伟达的硬件可以被追赶,但客户很难换掉它——他们买的是整个系统,不是一块芯片。

那么,Infinity 的 Ignition 在 10 小时内「复刻」了哪一层?

答案是:主要是底层。

Ignition 擅长的是为不同芯片生成和优化推理 Kernel,并围绕这些 Kernel 搭建底层软件能力。它正在开发面向多种芯片的通用推理库,但这不是在 10 小时内复制了 CUDA 近 20 年的完整生态。

你不需要复制一个完整的 CUDA,就可以拿下 1500 万美元融资。

三、真正的战场不在训练,在推理

这也是整件事最微妙的地方。

大模型的计算分两段:训练和推理。在训练侧,CUDA 目前几乎无解。大规模训练对性能、稳定性和集群协同极度敏感,企业选择训练平台时极其保守。

但在推理侧,游戏规则变了。

韩国 AI 芯片公司 Rebellions 的首席商务官 Marshall Choy 说得很直白:「在推理侧,CUDA 不再是决定因素。这将是一场开源软件的竞争。」

为什么?因为推理和训练的核心诉求不同:

  • 训练在乎极致性能——上万块卡协同跑几个月,不能出错
  • 推理在乎每 token 成本——可以拆分到小集群甚至单卡,便宜就行

更重要的是,推理软件可以跨芯片运行。如果推理框架支持多种芯片,用户就能在不同硬件之间切换,不用重写代码——CUDA 最大的锁定效应,就此失效。

2026 年,AI 推理预计将占 AI 总计算开支的三分之二。而英伟达目前仍控制着约 80% 的数据中心 AI 加速器市场。但这种「统治」很大程度上是软件锁定的结果,而非硬件绝对优势。

AMD、Qualcomm、AWS 都有自己的芯片,纸面性能并不输英伟达。d-Matrix 的 Corsair 芯片也能做实际工作。问题从来不是「能不能造出好芯片」,而是「有没有好软件把它用好」。

AI 编程 Agent 的出现,正在改变这个等式。

四、不止 Infinity:三路并进,围剿 CUDA

Infinity 不是唯一一支力量。围绕 CUDA 替代的努力,至少有三条主线:

第一条:AI Agent 自动生成底层软件。

Infinity 走的就是这条路。用 AI 编程 Agent 自动生成、测试和优化 GPU Kernel,把新芯片的软件适配时间从年压缩到天。

这本质上是在用 AI 解决芯片软件的「冷启动」问题——没有成熟的软件生态,就用 AI 快速生成一个。

第二条:用高级 DSL 替代手写 CUDA。

DeepSeek 最近开源了 TileKernels,一个基于 TileLang 构建的高性能 GPU 算子库,包含 44 个生产级 GPU 算子。TileLang 是北大团队开发的 Python GPU 领域特定语言,定位在 Triton 和手写 CUDA 之间找一个平衡点——比 Triton 控制力更强,比手写 CUDA 效率高很多。

关键在这句话:TileLang 没有一行 CUDA C++。

而且 TileLang 的后端支持 NVIDIA、AMD MI300X 和华为 Ascend。如果未来需要迁移到非英伟达硬件,TileLang 的代码不用重写。

DeepSeek 创始人梁文锋最近也公开表示,编程 Agent 和 TileLang 让 AI 软件的构建「大幅简化」。

第三条:AI 巨头自研芯片软件栈。

Google 的 TPU、Amazon 的 Trainium/Inferentia、微软的 Maia,都在花巨大精力自建软件生态。Amazon 内部文档曾将 CUDA 列为自家 AI 芯片采用的主要障碍——这不是秘密。

五、护城河并没有消失,而是在迁移

说英伟达的护城河「被凿开」显然为时过早。

INT21 创始人、前英伟达员工 Bing Xu 的判断值得认真对待:「Agent 能在一小时内生成大量代码,但验证才是最大瓶颈。」

AI 生成一万行代码很快,但「证明这一万行在各种边界情况下都算得对、跑得稳」极慢。CUDA 最深的资产恰恰是它的验证工具链——Bing Xu 认为,Agent 时代,验证生态会成为 CUDA 的下一道护城河。

Modular 联合创始人 Chris Lattner 也泼了冷水:

  • 写代码只是软件工程的一小部分,生产级优化才决定芯片性能
  • 芯片软件是精英小众领域,公开代码远少于应用开发,AI 能学到的训练数据有限
  • 几百万行存量代码的迁移成本不是技术问题,是组织决策问题

还有一个容易被忽略的点:英伟达自己也在用 AI。

英伟达开发者生态副总裁 Ankit Patel 表示,他们也在用 AI Agent 更快地开发 CUDA,并在更大规模上进行验证。内部已有超过 30,000 名工程师在使用专门的 AI 编程工具,代码产出量提升了 3 倍。

Bing Xu 总结得很到位:「这场仗的胜负,取决于竞争对手追赶英伟达的速度,能否快过英伟达自我迭代的速度。」

六、对 AI 从业者的启示

这个故事离我们并不远。有几点值得关注:

  1. 推理成本正在成为新的竞争焦点。当训练趋同、模型能力趋近,谁能把推理成本降到极致,谁就能拿到下一波应用爆发的入场券。AI 编程 Agent 加速芯片软件生态,本质上是在降低推理成本。
  2. 「用 AI 造 AI」不再是口号。Infinity 和 DeepSeek 的案例说明,AI 已经可以参与 AI 基础设施的构建。这个「元能力」的自我强化,可能比任何单项技术突破都更具颠覆性。
  3. 不要把「护城河」当成静态的。CUDA 的护城河正在从「代码的存量」迁移到「验证和优化的生态」。谁先占住新位置,谁才是下一个赢家。对任何做 AI 基础设施或工具链的人来说,这是一个重要的战略信号。
  4. 成本下降 → 应用爆发,这条逻辑链没有变。DeepSeek V4 Flash 正式版已经把推理价格打到极低;Agent 自动构建 Agent 的成本降到 0.2 元(PenguinHarness);现在连芯片适配的软件成本也在被 AI 压缩。每一层成本下降,都在为下一波应用爆发铺路。

英伟达的 CUDA 护城河短期内不会消失,但它的形状正在改变——从「写代码」的壁垒,变成「验证代码」的壁垒。

而对整个行业来说,最重要的信号也许是:AI 正在成为自己基础设施的建造者。

这才是真正的蝴蝶效应。

滚动至顶部