8 月初,一则消息在 AI 芯片圈炸开了锅。
一家成立仅一年的初创公司 Infinity,用自己开发的 AI 编程 Agent Ignition,为 AI 芯片公司 d-Matrix 的推理芯片搭建了一套完整的底层软件栈——从 GPU Kernel 生成、编译、测试到性能优化,全程 AI 驱动。
只花了 10 小时。
具体数据是:Ignition 在首次访问硬件后的 10 小时内,达到了该芯片理论峰值性能的 92%;10 天内,让 Qwen3、Qwen3.5、Gemma4 三款前沿模型在该芯片上端到端跑通——每一层代码都是 AI 从头生成的。
对比之下,这个流程过去需要工程师团队数月甚至数年。
英伟达花了近 20 年构建的 CUDA 软件帝国,被一个 AI Agent 在 10 小时内"复刻"了核心能力层。
这不是危言耸听。这是正在发生的事实。
拆解:Ignition 到底做了什么,没做什么
要理解这个事件的真实分量,先得拆解 CUDA 的层次结构。
CUDA(Compute Unified Device Architecture)不是一门编程语言,而是围绕英伟达 GPU 建立的 三层软件平台:
- 底层(内核层):Kernel 生成、编译器、运行时——让芯片干活的指令集
- 中间层(库层):cuBLAS、cuDNN 等高度优化的计算库,以及调试、验证、性能分析工具
- 上层(生态层):PyTorch/TensorFlow 框架、企业积累的代码工作流、数百万开发者社区
Infinity 的 Ignition 攻入的主要是 第一层:为特定芯片自动生成和优化推理 Kernel,并围绕这些 Kernel 搭建底层软件能力。
Ignition 的工作流是一个典型的"AI 闭环":
写代码 → 编译 → 运行 → 测试正确性和性能 → 根据反馈循环迭代
这种任务对 AI Agent 而言天然适配——因为反馈信号明确(能否编译?结果对不对?性能是否提升?),不需要模糊判断。
但要注意的是,Ignition 没有在 10 小时内复制 CUDA 全栈。它没有触及中间层那些经过 20 年打磨的优化库,更没有触及上层数百万开发者的代码生态。
它做的是更关键的事:证明了一条新路径的可行性。
建框架:为什么这次不一样?
"CUDA 被替代"的叙事每隔几个月就会出现一次。AMD 的 ROCm、Intel 的 oneAPI、Google 的 TPU……每次挑战者出现,分析师的结论都是"撼动不了"。
但这次有两点不同。
1. 攻击方是 AI 本身,不是另一家软件公司
过去,挑战 CUDA 意味着需要组织一支和英伟达相似的工程师团队,花数年时间适配、优化、验证。这是一个 人力密集型 的游戏,英伟达靠规模优势碾压。
但 Ignition 的路径是:用 AI 自动生成代码,用 AI 自动测试和优化。这意味着软件栈的构建成本正在从"人力规模"转向"算力规模"——而算力是商品,可以按需购买。
DeepSeek 也在做类似的事。他们开源了 TileKernels 算子库,用自研的 TileLang 编写,大幅减少手写底层 CUDA 代码。DeepSeek 创始人梁文锋最近公开表示,编程 Agent 加上 TileLang,让 AI 软件构建变得"实质性更容易"。
2. 战场在推理侧,不是训练侧
这是最容易被忽视的关键点。
大模型的计算分两段:训练 和 推理。在训练侧,CUDA 目前依然近乎无解——大规模训练对性能、稳定性、集群协同极为敏感,企业选择极其保守。
但在推理侧,游戏规则变了。
韩国 AI 芯片公司 Rebellions 的首席商务官 Marshall Choy 说得很直白:
"在推理侧,CUDA 不再是决定因素。这将是一场开源软件的竞争。"
推理在乎的不是"极致性能",而是"每个回答的成本"。只要能跑、便宜、够用,客户就愿意试。而推理软件可以跨芯片运行——如果推理框架支持多种芯片,用户就能在不同硬件之间切换,不用重写代码。
CUDA 最大的锁定效应——厂商锁定——在推理侧就此失效。
推演:护城河在迁移,而不是消失
这就引出了最核心的问题:英伟达的护城河到底还在不在?
答案是:还在,但它在迁移。
短期:训练侧安全,推理侧松动
短期内,英伟达在训练侧的主导地位不会动摇。大规模训练集群的稳定性、芯片间通信、故障恢复——这些能力不是靠 10 小时的 Agent 生成就能解决的。
但推理侧正在变成"第二战场"。d-Matrix、Rebellions、Cerebras、AMD、亚马逊 Inferentia、谷歌 TPU……各路芯片厂已经排兵布阵。他们不需要立刻替代英伟达,只需要证明:在某些推理任务中,不依赖 CUDA 也能跑得更快或更便宜。
中期:验证生态成为下一道护城河
这个问题最深刻的洞察来自 Bing Xu(INT21 创始人,此前创办的芯片软件公司 HippoML 被英伟达收购):
Agent 能在短时间内生成大量代码,但 验证才是最大瓶颈。AI 生成一万行代码很快,但"证明这一万行在各种边界情况下都算得对、跑得稳"极慢。CUDA 最深的资产恰恰是它的验证工具链。
换言之,护城河正在从 "代码的存量" 迁移到 "验证和优化的生态"。
生成代码是 AI 擅长的,但验证代码——尤其是在小众芯片领域,需要大量领域知识和测试数据——仍然是 AI 的短板。谁先占住验证生态的位置,谁就是下一个赢家。
长期:英伟达也在用 AI
还有一个容易被忽略的变量:英伟达自己也在加速。
英伟达开发者生态副总裁 Ankit Patel 明确表示:"我们也在使用 AI Agent 来更快地开发 CUDA,并在更大规模上进行验证。"
以己之矛,攻彼之盾。进攻方的相对优势也会打折。
Bing Xu 总结得很到位:这场仗的胜负,取决于竞争对手追赶英伟达的速度,能否快过英伟达自我迭代的速度。
落到行动:四条判断
如果你在选推理芯片:不要只看纸面参数。重点关注该芯片的软件生态是否支持"跨芯片推理框架"(如 vLLM、TensorRT-LLM 的多芯片兼容性),这决定了你未来的议价能力。
如果你是 AI Infra 工程师:花时间研究 AI 编程 Agent 在 GPU Kernel 生成上的能力边界。Ignition 和 DeepSeek TileKernels 是两条值得跟踪的路径。这可能是未来 12 个月你最需要关注的技能方向。
如果你是芯片创业公司:你的核心竞争力不再是"硬件比英伟达好多少",而是"你的软件适配速度有多快"。如果你能用 AI Agent 把适配周期从 12 个月压缩到 1 个月,你的硬件即使只有英伟达 70% 的性能,也有生存空间。
如果你是投资者:关注"AI 原生芯片软件栈"这个赛道。Infinity 的 $15M 种子轮和 $100M 估值只是开始。当 AI 可以自动生成底层计算软件时,芯片创业的入场门槛在降低,但投资逻辑也会从"押注硬件"转向"押注软件生态"。
一句话 thesis: 英伟达 20 年构建的 CUDA 护城河,不是被某家竞争对手攻破的,而是被 AI 编程 Agent 这种新的软件生产方式从根本上重新定义了竞争规则——护城河从"代码存量"变成了"验证生态",而这场变革的起点是推理侧。
参考来源:Business Insider、36氪/量子位、Infinity 官方案例、Semianalysis、The Next Web
