AI 编程 Agent 10 小时「复刻」CUDA:英伟达 20 年护城河真的被凿开了吗?
上周,一个消息在 AI 和芯片圈同时炸开:一家成立仅一年的 AI 软件公司 Infinity,用 AI 编程 Agent 只花了 10 小时,就为芯片初创公司 d-Matrix 搭建了一套类 CUDA 软件栈。
消息一出,讨论迅速分裂成两派。一派高呼「英伟达完蛋了」,另一派冷静指出「这只是个 Demo」。
但真相远比口号复杂——也远比口号有意思。
一、10 小时发生了什么?
Infinity 的核心产品叫 Ignition,是一个 AI 研究 Agent。它的工作方式很像人类工程师,只是快得多:
- 生成 GPU 内核代码——针对目标芯片的架构特点,自动生成计算 Kernel
- 运行测试——验证代码正确性
- 测量性能——评估是否达到硬件峰值
- 根据反馈自动改写——形成一个「写代码→编译→运行→测试→优化」的完整闭环
具体到这次合作,Ignition 在首次接触 d-Matrix 的 Corsair 芯片后,10 小时内达到了该芯片理论峰值的 92%,并在 10 天内让 Qwen3、Qwen3.5 和 Gemma4 三个前沿模型在该芯片上完整跑通。
这个速度有多夸张?过去,为新芯片编写底层推理软件,通常需要数月甚至数年。
Infinity 也因此拿到了 1500 万美元的种子轮融资,估值达到 1 亿美元。
二、CUDA 的护城河到底长什么样?
要理解这次「冲击」的含金量,得先搞清 CUDA 到底是什么。
很多人把 CUDA 当成一个编程语言,但实际上它是一整套围绕英伟达 GPU 的软件平台,可以拆成三层:
- 底层:Kernel 编译器、运行时——直接让芯片干活
- 中间层:cuBLAS、cuDNN 等高度优化的计算库,以及调试、验证工具链
- 最上层:PyTorch、TensorFlow 等开发框架,企业积累的海量代码和工作流,以及数百万开发者生态
把英伟达 GPU 想象成一座工厂:底层告诉机器每一步怎么操作,中间层提供现成的生产工具,最上层则是一整套已经运转多年的生产体系。客户买到的不是一块卡,是一座开箱即用的工厂。
这就是为什么英伟达的硬件可以被追赶,但客户很难换掉它——他们买的是整个系统,不是一块芯片。
那么,Infinity 的 Ignition 在 10 小时内「复刻」了哪一层?
答案是:主要是底层。
Ignition 擅长的是为不同芯片生成和优化推理 Kernel,并围绕这些 Kernel 搭建底层软件能力。它正在开发面向多种芯片的通用推理库,但这不是在 10 小时内复制了 CUDA 近 20 年的完整生态。
你不需要复制一个完整的 CUDA,就可以拿下 1500 万美元融资。
三、真正的战场不在训练,在推理
这也是整件事最微妙的地方。
大模型的计算分两段:训练和推理。在训练侧,CUDA 目前几乎无解。大规模训练对性能、稳定性和集群协同极度敏感,企业选择训练平台时极其保守。
但在推理侧,游戏规则变了。
韩国 AI 芯片公司 Rebellions 的首席商务官 Marshall Choy 说得很直白:「在推理侧,CUDA 不再是决定因素。这将是一场开源软件的竞争。」
为什么?因为推理和训练的核心诉求不同:
- 训练在乎极致性能——上万块卡协同跑几个月,不能出错
- 推理在乎每 token 成本——可以拆分到小集群甚至单卡,便宜就行
更重要的是,推理软件可以跨芯片运行。如果推理框架支持多种芯片,用户就能在不同硬件之间切换,不用重写代码——CUDA 最大的锁定效应,就此失效。
2026 年,AI 推理预计将占 AI 总计算开支的三分之二。而英伟达目前仍控制着约 80% 的数据中心 AI 加速器市场。但这种「统治」很大程度上是软件锁定的结果,而非硬件绝对优势。
AMD、Qualcomm、AWS 都有自己的芯片,纸面性能并不输英伟达。d-Matrix 的 Corsair 芯片也能做实际工作。问题从来不是「能不能造出好芯片」,而是「有没有好软件把它用好」。
AI 编程 Agent 的出现,正在改变这个等式。
四、不止 Infinity:三路并进,围剿 CUDA
Infinity 不是唯一一支力量。围绕 CUDA 替代的努力,至少有三条主线:
第一条:AI Agent 自动生成底层软件。
Infinity 走的就是这条路。用 AI 编程 Agent 自动生成、测试和优化 GPU Kernel,把新芯片的软件适配时间从年压缩到天。
这本质上是在用 AI 解决芯片软件的「冷启动」问题——没有成熟的软件生态,就用 AI 快速生成一个。
第二条:用高级 DSL 替代手写 CUDA。
DeepSeek 最近开源了 TileKernels,一个基于 TileLang 构建的高性能 GPU 算子库,包含 44 个生产级 GPU 算子。TileLang 是北大团队开发的 Python GPU 领域特定语言,定位在 Triton 和手写 CUDA 之间找一个平衡点——比 Triton 控制力更强,比手写 CUDA 效率高很多。
关键在这句话:TileLang 没有一行 CUDA C++。
而且 TileLang 的后端支持 NVIDIA、AMD MI300X 和华为 Ascend。如果未来需要迁移到非英伟达硬件,TileLang 的代码不用重写。
DeepSeek 创始人梁文锋最近也公开表示,编程 Agent 和 TileLang 让 AI 软件的构建「大幅简化」。
第三条:AI 巨头自研芯片软件栈。
Google 的 TPU、Amazon 的 Trainium/Inferentia、微软的 Maia,都在花巨大精力自建软件生态。Amazon 内部文档曾将 CUDA 列为自家 AI 芯片采用的主要障碍——这不是秘密。
五、护城河并没有消失,而是在迁移
说英伟达的护城河「被凿开」显然为时过早。
INT21 创始人、前英伟达员工 Bing Xu 的判断值得认真对待:「Agent 能在一小时内生成大量代码,但验证才是最大瓶颈。」
AI 生成一万行代码很快,但「证明这一万行在各种边界情况下都算得对、跑得稳」极慢。CUDA 最深的资产恰恰是它的验证工具链——Bing Xu 认为,Agent 时代,验证生态会成为 CUDA 的下一道护城河。
Modular 联合创始人 Chris Lattner 也泼了冷水:
- 写代码只是软件工程的一小部分,生产级优化才决定芯片性能
- 芯片软件是精英小众领域,公开代码远少于应用开发,AI 能学到的训练数据有限
- 几百万行存量代码的迁移成本不是技术问题,是组织决策问题
还有一个容易被忽略的点:英伟达自己也在用 AI。
英伟达开发者生态副总裁 Ankit Patel 表示,他们也在用 AI Agent 更快地开发 CUDA,并在更大规模上进行验证。内部已有超过 30,000 名工程师在使用专门的 AI 编程工具,代码产出量提升了 3 倍。
Bing Xu 总结得很到位:「这场仗的胜负,取决于竞争对手追赶英伟达的速度,能否快过英伟达自我迭代的速度。」
六、对 AI 从业者的启示
这个故事离我们并不远。有几点值得关注:
- 推理成本正在成为新的竞争焦点。当训练趋同、模型能力趋近,谁能把推理成本降到极致,谁就能拿到下一波应用爆发的入场券。AI 编程 Agent 加速芯片软件生态,本质上是在降低推理成本。
- 「用 AI 造 AI」不再是口号。Infinity 和 DeepSeek 的案例说明,AI 已经可以参与 AI 基础设施的构建。这个「元能力」的自我强化,可能比任何单项技术突破都更具颠覆性。
- 不要把「护城河」当成静态的。CUDA 的护城河正在从「代码的存量」迁移到「验证和优化的生态」。谁先占住新位置,谁才是下一个赢家。对任何做 AI 基础设施或工具链的人来说,这是一个重要的战略信号。
- 成本下降 → 应用爆发,这条逻辑链没有变。DeepSeek V4 Flash 正式版已经把推理价格打到极低;Agent 自动构建 Agent 的成本降到 0.2 元(PenguinHarness);现在连芯片适配的软件成本也在被 AI 压缩。每一层成本下降,都在为下一波应用爆发铺路。
英伟达的 CUDA 护城河短期内不会消失,但它的形状正在改变——从「写代码」的壁垒,变成「验证代码」的壁垒。
而对整个行业来说,最重要的信号也许是:AI 正在成为自己基础设施的建造者。
这才是真正的蝴蝶效应。
