美团LongCat-2.0的真正信号:不是国产替代,而是三个被低估的产业拐点

6月30日,美团发布LongCat-2.0。1.6万亿参数,MoE架构,480亿平均激活,1M上下文。全程在约5万张国产昇腾910C上完成从零预训练到推理部署——英伟达含量为零。

社交媒体上的反应 predictable:国产替代又添一员猛将。海外开发者则在问:为什么中国一家"送餐公司"能做出顶尖大模型?

但这两个反应,都错过了真正值得讨论的东西。

LongCat-2.0不是一个"国产替代成功故事"。它是一个三重信号发射器:MoE架构摸到97%稀疏度的渐近线、国产算力从"能不能"跨越到"稳不稳"、以及OpenRouter匿名调用量所揭示的一个被长期忽略的验证范式。这三个信号合在一起,指向的不是"美团有多厉害",而是整个大模型行业正在发生的一次方向性转移


一、97%稀疏度:"扩专家"路径已死

LongCat-2.0官方博客里有一句话,比1.6万亿这个数字更重要——

"MoE稀疏度在不考虑N-gram Embedding的情况下已达到约97%,再扩135B专家参数带来的性能增益可以忽略不计。"

这是什么概念?

DeepSeek-V3是671B总参数激活37B,稀疏度94%。V4-Pro和LongCat-2.0都是1.6T/48B,稀疏度97%。过去两年,行业从560B堆到671B到1T再到1.6T,每代都以为"再大一点就更强"。但97%这个数字直接说:到此为止了。

做个极端推演:如果把LongCat的专家池扩一倍到3.2T总参数,按97%稀疏度,每个token激活的还是那48B。用贵一倍的硬件、占一倍的显存,跑出来的前向计算和现在一模一样。

花钱买了个寂寞。

这不是美团一家的判断。DeepSeek-V4-Pro也是97%。GLM-5.2、Kimi K2.7、Qwen3.7-Max——所有头部玩家都在1.6T/48B这个区间贴身肉搏。当稀疏度低到3%以下,再加专家就像往一个已经足够大的仓库里继续塞书,每本书被翻到的概率越来越低。

这意味着,过去两年驱动大模型进步的核心引擎——"堆专家"——已经熄火。下一轮突破必须从别的地方来:注意力机制效率、上下文压缩、训练数据配方、或者某种我们还没看到的新架构。

LongCat-2.0的应对是LSA(LongCat Sparse Attention),把DSA的改进策略扩展到3-step MTP投机解码。但更重要的是,整个行业都被迫回答一个问题:当MoE的边际收益归零,下一个增长点在哪?


二、5万卡昇腾:国产算力从"能不能"到"稳不稳"

很多人把LongCat-2.0和6月初"昇腾910C完成DeepSeek-V4-Pro训练"的新闻混为一谈。但两者是完全不同量级的工程挑战。

后者是拿现成的V4-Pro权重做全参数后训练/续训练,跑了1500多步稳定训练——解决的是"国产卡能不能微调一个万亿模型"。

美团做的是另一件事:从零开始,在5万卡昇腾集群上把1.6T参数的模型从头训出来。预训练数据超过30T tokens,全程无回滚、无不可恢复的loss突刺。

两者的难度差异是:后训练只需要在已经收敛的loss landscape附近活动;从零预训练要在几十万亿token的尺度上把一个随机初始化的1.6万亿参数网络推到收敛。任何一次loss spike、任何一次NCCL通信超时、任何一片卡的静默数据损坏,都可能让前面烧掉的几千万电费打水漂。

而美团给出的工程指标是:训练MFU提升1.5倍,MFU做到30%以上,日均故障率降低70%以上,关键算子效率提升14%。

这不是"能用"。这是工业级可用

真正卡脖子的从来不是硬件算力本身——昇腾910C的单卡算力据说直追H100。真正卡脖子的是软件栈。CANN、HCCL这套生态和CUDA的成熟度差距,才是国产卡能不能跑大模型的命门。美团在底层算子适配和通信优化上花的功夫,远比"调参"重得多。

这个突破用工业级数据证明了一件事:在不依赖任何一张英伟达卡的前提下,国产算力集群可以独立完成万亿参数模型从预训练到推理部署的完整闭环。这不是弯道超车,这是另一条路已经通车了


三、Owl Alpha:调用量比跑分更诚实

在正式发布前,LongCat-2.0以"Owl Alpha"的匿名身份挂在OpenRouter上,免费、速度快、代码补全出奇顺手。

开发者们就这么用了一个多月,完全不知道这是谁家的模型。直到6月29日谜底揭晓。

结果是:总调用量跻身全球前三,在Hermes harness上月调用全球第一,在Claude Code上月调用全球第二,仅次于Claude Opus 4.8本身。

Claude Code是什么?这是Anthropic自己的生态。一个中国公司匿名挂出来的模型,能在Claude自己的地盘上被调用到全球第二——这不是刷榜,这是真金白银的token消耗,是开发者在完全不知情的情况下用脚投出来的票

更耐人寻味的是定价。longcat.ai挂的是9.9元/5000万token、399元/10亿token。对比Claude Opus 4.8动辄几十美元的月费,这个价格差本身就是它能在OpenRouter上吃到那么大调用量的原因之一。但价格低只是入场券,留不住人的是产品力。

Reddit上一条49分的高赞评论尖锐地指出:"All those parameters to not be SOTA." 确实,LongCat-2.0在公开跑分上不是最顶尖的——纯coding场景下大概和Nemotron Ultra 500B一个水平,不如GLM-5.2。它的架构和DeepSeek-V4-Pro共享同一代MoE范式,被社区调侃为"带轻微改动的复现验证"。

但"复现"在万亿参数加国产算力的组合下,本身就是工程能力的证明。而且LongCat-2.0有一个独特的优势:美团做外卖、到店、骑手调度积累了大量真实业务场景的agent数据。这才是它在agentic coding调用量上能跑赢一众跑分更高模型的底气。

这里揭示了一个被长期忽略的判断范式:基础模型能力≠落地价值。 在Agentic Coding这个赛道,真实业务数据的后训练可能比基础模型的benchmark分数更重要。OpenRouter的调用量,有时候比MMLU和HumanEval诚实得多。


四、万亿参数三定律:拥挤区间的竞争规则

把三个信号放在一起,可以提炼出一个可复用的分析框架——我称之为"万亿参数三定律"

当行业进入1.6T/48B这个拥挤区间,竞争的三个维度已经从"谁更大"转向了完全不同的方向:

第一定律:稳定性即护城河。 当稀疏度摸到97%的渐近线,"扩专家"不再带来收益。谁能在一个固定的专家池上榨取更多效率——通过更优的注意力机制、更聪明的上下文压缩、更精细的数据配方——谁就能在相同的算力预算下跑得更快。LongCat的LSA、DeepSeek的CSA/HCA、智谱的IndexShare,本质上都在同一个战场上竞争。

第二定律:算力自主即战略资产。 在地缘政治不确定性持续的情况下,能完全绕开英伟达完成万亿模型训练的能力,本身就成了护城河。DeepSeek-V4完成了从英伟达CUDA到国产算力的全栈迁移;LongCat-2.0则是原生国产训练。两者共同证明:中国AI产业已经拥有不依赖单一供应商的算力底座。这不是替代,是冗余——而冗余在供应链安全语境下,就是溢价。

第三定律:场景数据>通用能力。 在Agentic Coding这个赛道上,LongCat-2.0的调用量超过了跑分更高的模型。这说明当模型能力进入"足够好"的区间后,谁拥有更贴合真实场景的后训练数据,谁就能在用户体验上建立优势。 美团的真实业务数据、DeepSeek的长上下文效率优化、Kimi的MCP工具调用能力——都是在基础模型能力相近的前提下,用场景差异化建立护城河。

这三条定律不仅适用于LongCat-2.0,也适用于2026年6月这个时间点上所有第一梯队玩家:DeepSeek-V4、GLM-5.2、Kimi K2.7、Qwen3.7-Max。没有人再去卷"2T总参数激活200B",因为那会违反第一定律。所有人都在长上下文效率和Agent能力上较劲,因为那符合第三定律。


五、落到行动

对于不同角色的读者,这篇文章能带走什么?

如果你是AI开发者:

  • 停止追逐最新最大的模型,开始关注"在现有模型上能做什么"。当1.6T/48B成为标配,差异化来自你对场景数据的理解和后训练能力
  • 国产算力生态正在成熟,如果你在做面向中国市场的产品,现在应该把国产推理纳入技术选型清单
  • LongCat-2.0的权重即将开源——如果vLLM和llama.cpp在两周内完成适配,它的调用量大概率会在Q3继续攀升。免费、能用国产卡跑、有真实业务数据支撑,这三个属性的组合,有时候比SOTA更有商业价值

如果你是技术决策者:

  • 重新评估你的算力供应链策略。"英伟达+CUDA"不是唯一选项了,而且可能不是最经济的选项
  • 在Agentic Coding这个赛道上,模型选择的维度正在从"跑分排名"转向"调用量排名"。OpenRouter上的真实使用数据,比任何benchmark都更接近你的实际场景
  • 关注MoE架构的渐近线信号。如果你正在规划下一代模型架构,不要把所有筹码押在"扩专家"上

如果你是投资者:

  • 区分"国产替代叙事"和"真实工程突破"。前者是情绪,后者是数据。LongCat-2.0的MFU 30%+和日均故障率降70%+,是后者
  • 关注"模型反哺芯片"的飞轮效应。美团在训练LongCat过程中修复的每一个bug、调优的每一段通信协议,都会反馈给昇腾厂商,推动下一代硬件和软件栈的成熟。这种闭环的价值,比单个模型更大

写在最后

王兴过去两年说:"在AI领域唯一的策略是进攻。"2025年美团研发投入260亿元,同比增长23.5%。LongCat-2.0算是这份进攻姿态在基础模型层面交出的一份答卷。

但它的真正价值,不在于美团证明自己能做大模型。而在于它用三个被低估的信号,揭示了一个行业正在发生的方向性转移:当"更大"不再等于"更强",竞争就会从参数竞赛转向效率竞赛、从算力军备转向场景深耕、从单一供应链转向多元冗余。

下一轮突破会从注意力机制来,从训练数据配方来,还是从某种我们还没看到的全新架构来?

美团把这个问题用97%这个数字摆到了台面上。但整个行业,包括美团自己,都还没给出答案。


参考资料:美团LongCat官方技术博客、36氪《美团发布「零英伟达」万亿大模型》、IT之家、知乎"大狗狗是狼"技术拆解、Reddit r/LocalLLaMA社区讨论、VentureBeat、Geopolitechs

滚动至顶部