当所有大模型公司都开始造芯片:AI竞争进入"全栈战争"时代

当所有大模型公司都开始造芯片

"AI战争正在从'模型战争'进入'算力主权战争'。"

这句话来自昨天一篇流传甚广的文章。但它说反了。

不是算力主权战争——是全栈战争

算力主权是结果,全栈才是驱动。当你的商业模式依赖别人最稀缺的资源,而那个资源每个季度都在涨价,你不是在做生意,是在替别人的芯片公司打工。

过去一周,这条逻辑的注脚密集出现:

  • Meta宣布9月量产第四代自研AI芯片Iris,计划2026年部署约7吉瓦AI算力,2027年翻倍至14吉瓦
  • DeepSeek被曝秘密研发AI推理芯片已一年,正在招募芯片设计工程师
  • 智谱AI被爆正与国内ASIC厂商合作开发专用处理器
  • OpenAI发布首款自研推理芯片Jalapeño,博通CEO称其性能与Blackwell和Google TPU相当
  • Anthropic开始从OpenAI芯片团队挖人

英伟达的"超级客户清单",正在变成"竞争对手清单"。

问题是——为什么是现在?为什么所有公司都在同一个月做同一件事?

答案藏在AI产业一次不易察觉但根本性的结构位移里。


一、训练是军备竞赛,推理才是生意

过去三年,AI公司比的是"谁的模型更强"。这是一个训练叙事:更大的参数量、更长的训练时间、更多的GPU。

训练模式下,英伟达是不可替代的。CUDA生态、NVLink互联、HBM带宽——竞争对手花五年也追不上。你造不出替代品,就只能买他的货。于是英伟达的毛利率持续在70%以上,GPU价格只涨不跌。

但2025到2026年,产业的重心悄悄转移了。

训练一个GPT-5.6或者Claude Fable,只需要一次。而推理——每一次ChatGPT回答提问、每一次AI Agent调用工具、每一次代码补全——每天发生几万亿次。

AI进入了"推理时代"。

推理的数学,和训练的数学完全不同:

  • 训练看的是峰值性能——谁的HBM带宽更大、谁的互联更快
  • 推理看的是边际成本——每生成一个Token花多少钱

Morgan Stanley甚至造了一个新词:Chip Inflation(芯片通胀)。GPU、HBM、光模块、交换芯片——整个AI供应链价格持续上涨。英伟达的H100/B200/Blackwell一代比一代贵,但AI公司的推理用量一代比一代大。

这是一场自己跟自己赛跑的通胀。你越成功,越依赖GPU,成本就越高。


二、为什么ASIC赢了推理

这里有一个经常被忽略的技术事实:

训练芯片和推理芯片,是两种完全不同的产品。

训练需要极高的FP32/FP64精度、超大HBM容量、高带宽芯片间互联。这些恰好是GPU的强项——CUDA Core从一开始就是为了通用并行计算设计的。

推理的需求截然不同:

  • 成本敏感——每Token成本必须降
  • 功耗敏感——数据中心电费占比越来越高
  • 延迟敏感——用户等不起
  • 部署效率——单位面积吞吐量是关键

ASIC(专用集成电路)天生适合推理。Google TPU证明了这一点——它的推理性能和能效远远超过同代GPU。Amazon Inferentia也证明了这一点。现在轮到OpenAI的Jalapeño、Meta的Iris、DeepSeek的推理芯片。

推理芯片不需要1000平方毫米的芯片面积、不需要800W的功耗。它只需要一件事做好:以最低成本运行Transformer推理。

越专用,越高效。

博通的定制AI芯片业务增速是最好的佐证:第二财季半导体营收108亿美元,同比增长143%。大公司不需要自己从零设计芯片——他们找博通定制,台积电生产,性价比比买英伟达成品高出一大截。


三、全栈战争法则:为什么只做模型不够了

过去十年,科技产业有一条清晰的规律:利润会从价值链的单一环节,向控制全栈的公司集中。

苹果是最好的例子。iPhone之所以利润是整个手机行业的85%,不是因为它的芯片最强,也不是因为它的iOS最好用——而是因为它同时控制了芯片(A系列)、操作系统(iOS)、应用商店(App Store)、硬件设计、品牌和渠道。整条价值链上,苹果在每个关键节点都有一块自己的领地。别的手机厂可以赢一个点,但苹果赢了一个系统。

AI正在复制这条路径。

很多人以为大模型公司的核心竞争力是模型。这种理解已经过时了。

今天领先的AI公司,没有一家只做模型:

  • Google:Gemini + TPU + Google Cloud + 全球最大光纤网络
  • Meta:Llama + MTIA芯片 + 14GW数据中心 + 全球最大社交网络
  • OpenAI:GPT + Jalapeño芯片 + Stargate数据中心 + Oracle/SoftBank算力联盟
  • DeepSeek:开源模型 + 自研推理芯片 + 国产芯片适配
  • 智谱:GLM + ASIC合作 + 国产云生态

这不是巧合。这是"全栈战争法则"在起作用——当一项技术成为基础设施时,单一环节的竞争力无法转化为长期利润。利润只会流向那些能在芯片、模型、平台、应用之间做系统级优化的公司。

为什么?因为成本优化的最大空间不在于任何一个单点,而在于跨层级的协同。

苹果的芯片设计团队懂得iOS的内存管理策略,于是可以去掉不必要的缓存,把芯片面积省下来放进电池。同样道理,OpenAI的Jalapeño芯片知道自己要跑的是Transformer推理,于是可以在指令集层面做针对性优化,把每Token的成本砍到英伟达GPU的几分之一。

这种跨层级的优化,买现成的GPU永远做不到。


四、英伟达的十字路口:训练不失守,但推理正在失速

看空英伟达是危险的。过去五年,每一轮"英伟达要完了"的叙事都被事实打脸。H100的销量超过了所有人预期,Blackwell还没有交付就被订满。训练市场未来很多年仍然属于英伟达。

真正的变化发生在推理。

推理市场是增量市场。随着AI从"炫技"走向"日常使用",推理消耗的算力最终将是训练的上千倍。这不是替换——是新增。

问题是:这部分增量蛋糕,英伟达还能拿到吗?

数据已经开始回答这个问题:

  • Google Cloud越来越多地使用TPU而非GPU做推理,成本节省达40-60%
  • Amazon SageMaker的推理默认推荐Inferentia
  • Meta的推荐系统和广告排名已经全部迁移到自研MTIA芯片
  • OpenAI自己的推理负载未来将逐步迁往Jalapeño

英伟达在推理市场的份额,正在被自己的客户一点点切走。

这不是一夜之间的事。但就像云计算取代本地服务器一样——缓慢而不可逆。

对于中国AI企业来说,这场迁移还有一个额外的变量。

美国出口限制让最先进的GPU无法进入中国。伯恩斯坦预测,英伟达在中国AI芯片市场的份额将从2025年的约40%降至2026年的约8%。集邦咨询预计,以华为昇腾和寒武纪为首的国产芯片供应商,2026年将合计占据中国AI服务器芯片市场近80%的份额。

中国AI企业在"全栈战争"中,芯片的自主权不是可选项,是生存项。


五、落到行动:三层博弈

如果你在评估AI产业链的投资或创业方向,这个"全栈战争"的框架可以帮你更清晰地判断谁在什么位置:

如果你是AI应用层创业者:不要假设推理成本会持续下降。短期看,自研芯片大厂的推理价格会更快下降,这会挤压没有芯片能力的AI公司的利润空间。你的生存策略不是和平台比性价比——是找到他们没覆盖的垂直场景,用产品深度而不是成本优势建立壁垒。

如果你是算力中间层从业者:万卡集群的大规模训练市场仍然是英伟达的天下,但推理基础设施正在经历碎片化。这恰恰是中间层的机会——多芯片调度、混合推理路由、跨平台的成本优化引擎——这些是自研芯片的大厂自己没动力做、但客户极其需要的事情。

如果你是投资决策者:判断一家AI公司的长期竞争力,模型评分正在变成一个越来越弱的指标。更重要的指标是:它在推理成本曲线上处在什么位置?如果它的每Token成本比竞品高50%,再好的模型也守不住市场份额。反过来,博通这家"卖铲子给造铲子的人"的公司,可能是这一轮全栈战争中风险最低的受益者。


来源:AI商业评论、36氪、路透社、The Information、集邦咨询、伯恩斯坦

滚动至顶部