商汤WAIC 2026发布异构混合推理:国产卡做Prefill、英伟达卡专攻Decode,Token工厂首次实现盈利

2026年WAIC(世界人工智能大会)上,商汤科技给出了一个看似反常识的答案:不是造更强的卡,而是把比赛拆开,让不同的卡接力跑。

这不是理论推演——商汤跑通了这套方案,并且在真实客户场景中首次实现了国产芯片参与的混合推理集群盈利。同一时间,商汤宣布年底日均Token产量目标为10万亿,较年初增长25倍。

一、Agent正在把算力需求拉到极限

过去一年,AI行业发生了一个根本性的切换:大模型从「陪聊」变成了「干活」。

密歇根大学与斯坦福的最新测算显示,在一组真实软件工程任务中,编码Agent每生成1个输出Token,背后平均要处理约154个输入Token。更关键的是,这些Agent不是偶尔吃一顿——它们7×24小时不停地跑。

行业共识是,今年AI推理的算力需求是去年的5到10倍。与此同时,英伟达高端卡供给几乎没有增长。需求暴涨、供给不动,整个行业都在问:怎么办?

二、铁人三项的启示:拆分Prefill与Decode

商汤的思路来自一个朴素的类比:铁人三项。与其让一个人游完全程,不如让三个人各跑自己最擅长的赛段。

每一次大模型推理,其实可以拆成两道工序:

  • Prefill(读题):把用户输入的资料、文档、上下文全部读进去,拼的是计算吞吐量
  • Decode(答题):一字一句往外蹦答案,拼的是显存带宽

过去,一张卡从头干到尾。商汤的做法是把工序拆开:

  • 国产通用卡做Prefill——它们的计算吞吐量不差,干这个活效率很高
  • 英伟达高端卡做Decode——这是它们的绝对强项

这就是所谓的「异构混合推理」(Heterogeneous Hybrid Inference)。不是让国产卡硬刚英伟达,而是让每一张卡都去干自己最擅长的事情。

三、落地有多难?30个Prefill节点协调一个Decode节点

听起来简单,做起来极其复杂。

纯英伟达方案4个Prefill节点配1个Decode就够了。换成国产方案,这一比例变成30:1——网络复杂度、调度复杂度、容错复杂度全线飙升。

商汤首席科学家张行程坦承,公司这几年在底层做了大量脏活累活——编译器、算子、网络、缓存、调度、容错,一层一层打通。经过系统级调优,才能让这套复杂程度远高于纯英伟达方案的异构系统实现长时间稳定运行,系统可靠性达到99.9%。

目前已适配的主流模型包括GLM 5.2、DeepSeek V4、Kimi K2.7、MiniMax M3、SenseNova V6.7等。

四、关键突破:国产算力第一次「上桌吃饭」

过去国产算力的叙事套路是:自主可控很重要 → 我们的芯片能跑了 → 然后就没有然后了。能跑,但性价比不行;能用,但客户不买单。

商汤这次令人意外的点是:国产芯片参与的混推集群,已经实现了可盈利

商汤联合创始人杨帆给出了一个非常明确的定义:收入覆盖折旧、摊销、机柜租赁、电费和人员服务费之后,利润率为正。是真金白银地赚钱。

怎样做到的?三步走:

  1. 榨干国产卡性能:在三个不同厂牌的国产芯片上做定向优化,单卡MFU(有效利用率)相比原厂出厂平均提升约一倍,最高的一款提升了152%
  2. 同成本多产出:相比国产同构推理,异构混推的同成本Token产出规模扩大了2.5倍
  3. 规模跑起来:年初日均4000亿Token → 7月底预计日均2.42万亿 → 年底目标日均10万亿。全年预期增长25倍

国产算力第一次不必等到单卡全面追平英伟达,就通过系统分工提前进入了真实的商业市场。

五、Token工厂:把算力中心当工厂来运营

为什么同样买国产卡,别人亏钱,商汤能把利润跑出来?

杨帆说得非常直白:很多自称算力服务商的公司,本质上是在帮大厂代持机器、签长租约——提供的是金融服务。一座工厂的厂房、机器、流水线、仓库、销售分别归五家公司管,别说极致优化,光开会就能把利润开没。

商汤的做法是端到端控制:从机房物理层到服务器、网络架构、编译器、算子、框架、推理引擎、调度系统,再到最终客户的Token流量,整条链路由一个主体贯穿。每一个环节单拎出来可能不是最长的板,但拼在一起就是系统级的优化空间。

整个「Token工厂」的逻辑链:

  • 芯片是机器
  • 网络是流水线
  • KV Cache是仓库
  • 调度系统是厂长
  • 电力是原料
  • Token是最终产品

六、算力协同的另一个维度:电

当芯片、网络和业务被端到端打通之后,优化的触角伸到了一个更底层的地方——电。

在临港数据中心,商汤与宁德时代合作部署了储能系统,配合峰谷电价和算力预测做弹性调度。效果:单位电力成本的Token产出提升约80%,电费比同地区IDC低约10%。

7月10日上海用电紧张时,国网发出需求响应,商汤临港数据中心两小时内释放了75%的容量,少用4.6万度电。大型智算中心正在变成电网中的「虚拟电池」:高峰期主动降负荷给市政电网让路,低谷期开足马力跑推理。

七、从一座工厂到一张网:「银河计划」与太空算力

Token工厂跑通了,但一家公司的端到端再强,也撑不起整个生态。

商汤在WAIC上同步发布了「银河计划」,联合寒武纪、沐曦、华为昇腾、摩尔线程等国产芯片厂商,以及硅基流动、基流科技、中科加禾等基础设施服务商,目标是4个数字:

  • 1个Token工厂
  • 5个万卡国产集群
  • 10个共创技术方向
  • 200+家AI初创组织

更远的地方,商汤已在布局三条前沿路径:

  • 光计算:降低数据搬运的能耗
  • 量子计算:解决传统方法算不动的高维优化
  • 太空算力:已签约国星宇航,计划2026年Q4发射4颗「商汤号」算力卫星,2028年建成星地混合云商用骨干网,2030年目标千颗级天地一体化AI算力星座

杨帆的判断是,中国搞太空算力的核心逻辑不是地面电太贵,而是全球大量地区没有3G、4G覆盖——要把AI服务渗透过去,星上算力是最有效的路径。

八、Agent时代的赢家逻辑变了

过去几年,AI基础设施的竞争像一场军备竞赛:谁GPU多、谁峰值算力大、谁机房壮观。

到了Agent时代,这套玩法正在失效。模型不关心你用哪张卡,用户也不关心你机房里有多少P算力。他们只关心三件事:Token够不够快、够不够便宜、服务稳不稳。

未来的赢家,未必是拥有最多GPU的公司,而是最懂得怎么把不同芯片、不同电价、不同模型和不同任务,组织成一条高效生产线的公司。

商汤在WAIC 2026展示的,不只是一套国产异构混推方案。它是在提前回答一个更大的问题:当AI真正进入大规模生产时代,下一代「工厂」究竟应该长什么样?

参考来源

  • 新智元报道:Agent拉爆算力?中国杀出新物种:日冲10万亿Token,还赚钱了
  • 商汤科技WAIC 2026官方发布信息
滚动至顶部