美团LongCat-2.0:万亿参数军备竞赛的终点,与NVIDIA之外的新战场

当美团发布LongCat-2.0时,技术圈的叙事快速分裂成两派。

一派把它捧成"国产算力弯道超车"的里程碑——1.6万亿参数、零英伟达、5万卡昇腾集群,每一个词都在情绪上精准命中。另一派则冷静指出,它在SWE-bench Pro上59.5的得分落后于智谱GLM-5.2,在OpenRouter上的匿名表现也不过是"DeepSeek-V4-Pro的轻微改动复现"。

两派都没说错,但两派都没说到点上。

LongCat-2.0的真正意义,不在于它是否"超越OpenAI",也不在于它是否"弯道超车"。它的真正价值在于,它同时发出了两个结构性的信号:第一,MoE架构的万亿参数军备竞赛已经撞到了天花板;第二,中国AI产业首次在不依赖任何一张英伟达GPU的前提下,完成了从预训练到推理部署的全链路工业级闭环。

前者关乎技术路线的终局,后者关乎地缘政治下的供应链重构。两个信号叠加在一起,定义了2026年中期AI竞争的新坐标。


一、"零英伟达":被高估的叙事,被低估的工程

先拆解那个最抓眼球的标签:"全球首个英伟达含量为0的万亿模型"。

说它被高估,是因为如果只看模型能力,LongCat-2.0并没有改写任何技术范式。1.6T总参数/48B激活、1M上下文窗口、MoE+稀疏注意力——这套配方和DeepSeek-V4-Pro(1.6T/49B/1M)几乎在同一区间。Reddit上r/LocalLLaMA的高赞评论说得直接:"All those parameters to not be SOTA." 堆了这么多参数,却还不是最强。

但说它被低估,是因为大多数人混淆了两个完全不同的工程难度:"千卡后训练"和"5万卡从零预训练"。

6月初深圳河套学院联合哈工大、华为的新闻——在昇腾910C上完成DeepSeek-V4-Pro的全参数后训练——解决的是"国产卡能不能微调一个万亿模型"。但美团做的是另一件事:在约5万张国产芯片上,从一个随机初始化的1.6万亿参数网络开始,用超过30T tokens的预训练数据把它推到收敛。任何一次loss spike、任何一次NCCL通信超时、任何一张卡的静默数据损坏(SDC),都可能让前面烧掉的几千万电费打水漂。

美团官方披露的工程指标是:训练MFU从17.8%提升到27.68%(提升1.5倍),关键算子效率提升14%,日均故障率从万分之15.7降到万分之4.4。支撑这些数字的,是一整套适配国产芯片的算子重写、并行方案重构、以及自动故障恢复系统——从异常检测到链路切换到自动恢复,几乎全部自动完成。

所以"零英伟达"的准确解读不是"美团比OpenAI强",而是"中国AI的供应链自主,已经从'能不能'推进到了'稳不稳'。"

这是一个基础设施层面的突破,不是模型层面的突破。


二、97%稀疏度:为什么万亿参数军备竞赛已经结束了

LongCat-2.0官方博客里有一句话,比"1.6万亿"这个数字更重要:模型的MoE稀疏度已经达到约97%,再扩135B专家参数带来的性能增益可以忽略不计。

这句话值得被框起来。

回顾MoE架构的演进路径:DeepSeek-V3是671B总参数/37B激活,稀疏度约94%;V4-Pro是1.6T/49B,稀疏度约97%;LongCat-2.0也是1.6T/48B,稀疏度97%。三代模型,从560B到671B到1.6T,稀疏度从94%爬到97%——然后停住了。

这意味着什么?

MoE的本质是用一个路由器给每个token分配专家。总参数越多,每个token只激活其中一小撮,稀疏度就越高。但当稀疏度达到97%,再加专家就相当于往一个已经足够大的图书馆里继续塞书——每本书被翻到的概率越来越低,你花双倍的钱买双倍的硬件,但每个token实际参与计算的参数还是那48B。

做个反事实推演:假设LongCat把专家池再扩一倍到3.2T总参数,稀疏度维持97%,每个token激活的仍然是约48B。用贵一倍的硬件、占一倍的显存,跑出来的前向计算和现在一模一样。这就是"花钱买了个寂寞"。

所以美团的数据直接说:对不起,到97%这条线,再扩专家已经没收益了。

这不是LongCat-2.0一家的困境。DeepSeek-V4-Pro、GLM-5.2(744B/40B)、Kimi K2.7 Code(约1T/32B)——所有头部玩家都在同一个区间贴身肉搏:总参数1T~1.6T,激活参数30B~50B,稀疏度94%~97%。没有人去卷"2T总参数激活200B",因为那个方向上边际收益已经归零。

万亿参数军备竞赛,在2026年中期,正式宣告进入终局。


三、OpenRouter调用量:比benchmark更诚实的成绩单

既然参数竞赛已经见顶,那竞争转向哪里?

LongCat-2.0给了一个极其有说服力的答案——不是benchmark,而是调用量。

在正式发布前,LongCat-2.0以"Owl Alpha"的匿名身份接入OpenRouter。开发者们不知道这是谁家的模型,只知道它免费、速度快、代码补全顺手。就这么用了一个多月。

结果:总调用量跻身全球前三,在Hermes harness上月调用全球第一,在Claude Code harness上月调用全球第二——仅次于Anthropic自家的Claude Opus 4.8。

这才是最诚实的"跑分"。

传统的MMLU、HumanEval、SWE-bench可以刷榜。但OpenRouter的调用量是真金白银的token消耗,是开发者在完全不知道模型来历的情况下,用它写代码、调工具、跑agent,用脚投出来的票。一个中国公司的匿名模型,能在Claude自家的生态里被调用到全球第二,这说明LongCat-2.0在让模型自主理解仓库结构、处理多文件依赖、给出能直接落地的工程方案这件事上,确实打到了开发者的真实痛点。

这也解释了另一个数据:LongCat-2.0在SWE-bench Pro上59.5的得分,其实领先GPT-5.5(58.6)、Claude Opus 4.6(57.3)和Gemini 3.1 Pro(54.2)。但在agentic coding这个赛道上,真正重要的不是考分,而是开发者愿不愿意持续调用。

美团做外卖、到店、骑手调度积累了大量真实业务场景的agent数据,这才是它在代码agent调用量上能跑赢一众跑分更高模型的底气。基础模型能力决定下限,后训练数据决定上限。


四、三战场转移:从"谁的模型更大"到"谁的成本更低"

把以上三个信号放在一起,可以提炼出一个可复用的分析框架——我把它叫做"三战场转移"

过去三年,AI行业的主战场是第一战场:模型参数。谁的总参数更大、谁的benchmark更高,谁就是第一梯队。但从2026年中期开始,这个战场已经因为97%稀疏度渐近线而事实性关闭。

竞争正在向两个新战场转移:

第二战场:基础设施效率。当模型架构趋同,差距就体现在谁能用更低的成本跑出同样的效果。LongCat-2.0的定价是9.9元/5000万token、399元/10亿token,对比Claude Opus 4.8动辄几十美元的月费,这个价差本身就是它能在OpenRouter上吃到那么大调用量的核心原因。DeepSeek-V4-Pro把1M长上下文的单token推理FLOPs压到V3.2的27%,KV Cache只有10%——也是在打同一场战争。

第三战场:Agent harness。模型本身不会替你干活,但agent会。当所有头部模型的基础能力都在同一区间(1.6T/48B/1M),真正的差异化就来自谁能把模型接入到真实的工作流里——代码仓库理解、工具调用、端到端任务执行。这也是为什么LongCat-2.0在Claude Code上的调用量能排到全球第二:它不是模型比Opus 4.8更强,而是它在agent harness这个维度上足够好用、足够便宜。

这个框架不仅能解释LongCat-2.0,也能解释行业里正在发生的其他变化:Anthropic为什么要做自己的芯片(降低成本)、OpenAI为什么要推Jalapeño推理ASIC(只做推理不做训练,进一步压缩成本)、为什么所有公司都在从"更大的模型"转向"更长的上下文"和"更好的agent"。

这不是一个公司的策略,这是一个行业的结构性转向。


五、落到行动

如果你站在不同的位置,这个信号意味着什么?

  • 如果你是AI公司/模型团队:停止卷总参数。当稀疏度摸到97%,再扩专家池就是浪费。把资源转向注意力机制优化(DSA→LSA→CSA/HCA)、长上下文效率、以及agent后训练数据。下一代突破不会来自"更大的模型",而会来自"更聪明的注意力"和"更真实的agent数据"。
  • 如果你是开发者:模型的"跑分"越来越不重要。选一个在你实际工作流里调用成本最低、agent集成最顺手的模型。LongCat-2.0的定价策略(9.9元/5000万token)是一个信号:推理成本正在快速下降,今天你认为"必须用Opus 4.8"的场景,三个月后可能用LongCat-2.0或DeepSeek-V4就能覆盖。
  • 如果你是投资者:参数不是护城河。当所有头部模型都在1.6T/48B这个区间,真正的壁垒在三个地方:国产供应链自主(LongCat-2.0)、真实业务场景的agent数据(美团)、以及推理成本控制能力(DeepSeek)。
  • 如果你是关注AI产业的人:国产算力已经解决了"能不能"的问题,下一步是生态。LongCat-2.0宣布即将开源所有核心技术,vLLM和llama.cpp的适配速度将决定它是否只是"又一个国产模型",还是能成为真正的开源基础设施。当开源社区能用国产芯片跑通万亿模型,这件事的影响才会真正扩散。

LongCat-2.0没有独力改变技术路线的走向。

但它和DeepSeek-V4、GLM-5.2、Kimi K2.7一起,把"万亿参数+国产算力+开源"这个组合从"实验室demo"推到了"工业级可用"。当MoE稀疏度已经摸到97%这条渐近线,当所有头部玩家都在1.6T/48B这个区间贴身肉搏,下一轮突破会从注意力机制来,从训练数据配方来,还是从某种我们现在还没看到的全新架构来?

美团把这个问题用97%这个数字摆到了台面上。但整个行业,包括美团自己,都还没给出答案。

滚动至顶部