英伟达用 20 年筑起的 CUDA 软件帝国,被一家成立仅一年的小公司用 AI Agent 在 10 小时内撕开了一道口子。
不是概念验证,不是 PR 通稿——Infinity 的 AI 研究 Agent 「Ignition」为 AI 芯片公司 d-Matrix 的 Corsair 加速器生成了完整的底层软件栈,达到芯片理论峰值性能的 92%,并在 10 天内让 Qwen3、Qwen3.5、Gemma4 三款前沿模型端到端跑通。
过去需要工程师团队数月甚至数年的工作,压缩到了以小时计。
一、破题:一个 Agent 的「CUDA 速成」实验
Infinity 是一家 AI 基础设施初创公司,创始人 Sid Nixon 此前在 Google Brain 做研究员。他的团队开发的 Ignition,本质上是一个专为芯片底层软件设计的 AI 研究 Agent。
它能做的事情非常具体:为不同 AI 芯片生成 GPU Kernel、编译运行、测试正确性、测量性能,然后根据结果自动改写代码——形成一个「写代码→编译→运行→测试→反馈→改写」的闭环。
在 d-Matrix 的合作案例中,Ignition 在首次接触 Corsair 硬件后的 10 小时内,就通过张量并行矩阵乘法将计算任务分配到所有 32 个计算单元,达到了 92% 的理论峰值性能。10 天内,三款前沿模型的所有层代码全部从零生成,完整跑通。
这套流程过去的标准时间是:数月到数年。
Infinity 还把同样的方法用在了 DeepSeek 的 TileKernels 上——这是一个用 TileLang 编写的 GPU 算子库,同样大幅减少了手写底层 CUDA 代码的工作量。
二、拆解:AI 正在「商品化」芯片软件栈
要理解这件事的深层含义,得先理解 CUDA 到底是什么。
很多人以为英伟达的护城河是 GPU 硬件。不对。H100 比 Blackwell 强,Blackwell 比 Rubin 强——硬件迭代是线性竞争。真正让客户用了英伟达就换不走的,是围绕 CUDA 建立的整套软件生态:数十个数学库、调试工具、编译器、部署框架,以及几百万习惯了 CUDA 编程模型的开发者。
新芯片公司要挑战英伟达,硬件可以设计得很有竞争力,但软件适配是绕不开的「天坑」。每一款新芯片都需要从头编写底层 Kernel,适配主流模型,测试性能,迭代优化。这个过程中,人类工程师的稀缺性构成了天然壁垒——懂底层硬件又懂 AI 的工程师,全球就那么些。
Ignition 做的事情,本质上是把「稀缺人力」这个瓶颈给 AI 化了。Kernel 生成是一种天然适合 AI Agent 的任务:目标明确(正确性 + 性能),反馈闭环清晰(编译报错、性能数据),迭代空间大(参数调优、架构选择)。
这带来的直接后果是:芯片软件栈的构建成本正在急速下降。
Infinity 已经实现了数百万美元的年化收入,客户正是那些迫切需要软件生态的新芯片公司。他们不需要自己养一支几十人的底层软件团队,只需把硬件交给 Ignition,几天后就能拿到可用的软件栈。
三、建框架:CUDA 护城河的三层结构
把 CUDA 护城河拆开来看,它其实有三层:
第一层:Kernel 层。 为具体芯片生成和优化计算 Kernel。这是最底层、最繁琐、最吃人的工作。Ignition 攻入的正是这一层。
第二层:库和工具链层。 cuBLAS、cuDNN、TensorRT 等几十个库,以及调试、性能分析工具。这一层更高,但一旦底层 Kernel 能自动生成,上层库的适配也大幅加速。
第三层:开发者生态层。 几百万 CUDA 开发者、海量文档、社区、培训体系。这是最难复制的。
Ignition 在 10 小时内攻破的是第一层。但第一层的意义在于:它为第二层和第三层的瓦解提供了可能。
一旦新芯片的底层 Kernel 可以快速生成,它就能跑主流模型;能跑模型,开发者就有理由尝试;有开发者尝试,社区就慢慢生长。
这不再是「能不能替代 CUDA」的问题,而是「替代的成本降到多低」的问题。
四、推演:谁在受益,谁在焦虑
最直接的受益者:AI 推理芯片公司。
d-Matrix、Rebellions、Cerebras、Groq——这些公司主攻推理市场,硬件各有千秋,但共同的短板是软件生态。Ignition 这类工具直接帮他们跨过了「先建软件再卖芯片」的鸡生蛋难题。
推理市场本身也是英伟达相对薄弱的环节。训练领域英伟达近乎垄断,但推理场景分散、成本敏感、客户有强烈的「去英伟达化」动机。Infinity 的 Ignition 正好给了这些公司一把快速追赶的钥匙。
焦虑方:英伟达。
不是说 CUDA 明天就会被替代。但信号是明确的:过去 20 年积累的软件壁垒,正在被 AI 以「加速折旧」的方式侵蚀。英伟达的应对是推出 Dynamo 推理框架,试图在推理侧复刻 CUDA 的生态绑定。但这次,AI 进步的加速度掌握在对手手里。
更大的变量:AI 正在改写「软件工程」的底层逻辑。
Infinity 的案例只是冰山一角。7-Zip 压缩速度被 AI 优化提升 97%(不碰核心代码),DeepSeek 的 TileKernels 减少手写 CUDA 代码——这些事件指向同一个方向:AI Agent 正在「商品化」过去被认为不可替代的底层软件工程能力。
当 AI 能自动生成、测试、优化底层代码,芯片软件栈不再是稀缺资源。这会让整个 AI 芯片市场的竞争从「软件生态」重新回到「硬件性价比」——而这恰恰是英伟达最不愿意看到的局面。
五、落到行动:值得关注的三件事
关注 Infinity 的 Ignition 后续。 一家刚融 1500 万美元种子轮的公司,已经产生数百万美元收入。如果 Ignition 能持续迭代,它可能成为 AI 芯片领域的「LLaMA Factory」——一个让任何人快速构建芯片软件栈的开源基础设施。
推理芯片的「去英伟达化」加速。 2026 年下半年,推理市场的竞争格局可能发生质变。当软件适配不再是瓶颈,芯片的性价比和功耗将成为决定性因素。这对云厂商(自研芯片)和推理场景客户都是利好。
AI Agent 的「递归自我改进」正在兑现。 从田渊栋的 Recursive 到 XYZ AI Lab,再到 Infinity 的 Ignition,一条清晰的路径浮现:AI 先帮人类写代码,再帮自己改写代码,然后帮芯片写代码。这个循环的加速,可能比大多数人预想的更快。
Infinity 开源地址与 d-Matrix 合作案例已在官方渠道公开。本文基于公开信息与行业分析撰写,不构成投资建议。
