一家送餐公司做出了全球开发者最爱的编程模型——美团 LongCat-2.0 真正值得关注的三件事

一家送餐公司做出了全球开发者最爱的编程模型——美团 LongCat-2.0 真正值得关注的三件事

美团发布了一个万亿参数大模型,这件事本身并不让人意外。让人意外的是它发布的方式——模型已经在 OpenRouter 上匿名跑了两个月,全球调用量前三,Claude Code 生态里调用量第二,然后美团才说:"那只猫头鹰是我们。"

更让人意外的是另一句话:这个模型从训练到推理,没有用一张英伟达的卡。

国内媒体几乎一边倒地把它解读为"国产芯片弯道超车"。这个叙事很爽,但也很危险——它把一件结构性的、需要冷静拆解的事情,压缩成了一个情绪化的标签。

LongCat-2.0 真正值得关注的,不是"国产芯片能不能行"这个二元问题。而是它同时揭示了三件被情绪淹没的事实:国产算力从"能不能"走到了"稳不稳";MoE 架构的扩展红利正在见顶;以及——真实场景数据正在成为比模型架构更稀缺的竞争壁垒。

一、5 万张国产卡,从零预训练,和"后训练"是两码事

要理解 LongCat-2.0 在算力层面的突破,得先分清楚两个概念。

今年 6 月初,深圳河套学院联合哈工大、华为,在昇腾 910C 集群上完成了 DeepSeek-V4-Pro 的全参数后训练。1500 多步迭代,全程无中断,MFU 突破 30%。这是一个值得肯定的工程成果。但它解决的是"国产卡能不能微调一个万亿模型"。

美团干的是另一件事:从零开始,在约 5 万张昇腾 910C 集群上,把 1.6 万亿参数的 MoE 模型从头预训练出来,训练数据超过 30 万亿 token,月均日故障率降低 70% 以上,训练 MFU 提升 1.5 倍,全程无回滚、无不可恢复的 loss 突刺。

这两者的难度差异,用一位开发者的比喻来说:后训练相当于房子建好了,用国产算力装修;LongCat-2.0 是从打地基一直到入住,住着居然很好。

昇腾 910C 的单卡算力据社区反推直追 H100,但真正卡脖子的是软件栈。CANN、HCCL 这套生态和 CUDA 的成熟度差距,才是国产卡能不能跑大模型的真正命门。美团在底层算子适配和通信优化上花了远比"调参"更重的功夫——关键算子效率提升 14%,MFU 做到 30% 以上,靠的是 HCCL 异常处理加自动故障恢复这套系统工程。

这件事的意义不在于"国产芯片比英伟达强"。它在于用工业级数据证明了:在不依赖任何一张英伟达卡的前提下,国产算力集群可以独立完成万亿参数模型从预训练到推理部署的完整闭环。对于受美国出口管制的中国 AI 产业,这是一个从"能不能"到"稳不稳"的质变。

二、97% 稀疏度——MoE 的扩展红利正在见顶

如果说算力是这次发布的外部叙事,那架构选择才是真正体现美团技术判断力的地方。

LongCat-2.0 官方博客里有一句话,比 1.6 万亿这个数字更重要:模型的 MoE 稀疏度在不考虑 N-gram Embedding 的情况下已经达到约 97%,再扩 135B 专家参数带来的性能增益可以忽略不计。

这个数字值得停下来想一想。

DeepSeek-V3 是 671B 总参数激活 37B,稀疏度约 94%。V4-Pro 是 1.6T 激活 49B,稀疏度约 97%。LongCat-2.0 也是 97%。三家独立团队,三种不同的架构设计,在稀疏度这个指标上撞到了同一条渐近线。

这意味着什么?过去两年大家拼命往专家池里堆参数,从 560B 到 671B 到 1T 再到 1.6T,每代都以为"再大一点就更强"。美团的数据直接说:到 97% 这个稀疏度,你再加专家,收益小到测不出来。

做个极端化的反事实推演就明白这句话在说什么了。假设 LongCat 把专家池再扩一倍到 3.2T 总参数,按 97% 的稀疏度,每个 token 激活的还是那 48B,用贵一倍的硬件、占一倍的显存,跑出来的前向计算和现在一模一样。这是"花钱买了个寂寞"。

MoE 的本质是用一个路由器给每个 token 挑专家,专家越多、每个 token 只激活其中一小撮,真正参与计算的参数占总参数的比例就越低。当这个比例低到 3% 以下,再加专家,相当于往一个已经足够大的仓库里继续塞书,但每本书被翻到的概率越来越低。

这恰恰是 LongCat-2.0 真正聪明的地方——它没有继续卷专家数量,而是把重心转向了注意力机制、上下文效率、后训练数据这些维度。LongCat Sparse Attention、N-gram Embedding、Muon 优化器、6D 并行训练、MOPD 多目标后训练——整套组合拳都在说一件事:在固定专家池上榨取更多效率,而不是继续扩池子。

这个判断对行业的影响是深远的。如果 MoE 的扩展红利确实见顶,那么下一阶段的竞争将从"谁的模型更大"转向"谁的架构更高效、谁的数据更优质、谁的后训练更精准"。

三、匿名测试两个月,全球开发者用 token 投了票

LongCat-2.0 最被低估的一点,是它的发布策略本身就是一个信号。

美团没有走传统路线——开发布会、发新闻稿、请媒体评测。它把模型以"Owl Alpha"的化名挂到 OpenRouter 上,免费、速度快、代码补全出奇地顺手,让全球开发者用了一个多月,直到链上消息揭晓身份。

结果是什么?截至 6 月底,Owl Alpha 在 OpenRouter 上总调用量跻身全球前三,在 Hermes 这个 harness 上月调用全球第一,在 Claude Code 上月调用全球第二,仅次于 Claude Opus 本身。

Claude Code 月调用全球第二这个位置尤其值得琢磨。Claude Opus 4.8 是 Anthropic 今年 6 月初刚发的旗舰,在 agentic coding 这个赛道上是事实上的标杆。一个中国公司匿名挂出来的模型,能在 Claude 自己的生态里被调用到全球第二,说明 LongCat-2.0 在让模型自主理解仓库结构、处理多文件依赖、给出能直接落地的工程方案这件事上,确实打到了开发者的真实痛点。

这背后有一个经常被忽略的因素:美团做外卖、到店、骑手调度积累了大量真实业务场景的 agent 数据。这才是它在 agentic coding 调用量上能跑赢一众跑分更高模型的底气。基础模型能力 vs 后训练数据的功劳怎么拆,目前公开信息还拆不开,但有一点是确定的——真实场景数据正在成为比模型架构更稀缺的竞争壁垒。

这也是为什么海外开发者会困惑:"一家送餐公司,为什么能做出顶尖的大模型?"答案恰恰就在"送餐"这两个字里——美团每天处理数千万订单、数百万骑手的实时调度,这种复杂度本身就是最好的 agent 训练场。

四、一个框架:三层验证

LongCat-2.0 的意义,需要用一个框架来理解。我把它叫作"三层验证":

第一层:供应链验证。国产算力能不能支撑万亿模型的完整生命周期?答案是能,而且能稳定跑。这对所有受出口管制影响的中国 AI 企业来说,是一个从"能不能"到"稳不稳"的转折点。

第二层:架构验证。MoE 的扩展红利还有多大?答案是 97% 稀疏度附近已经见顶。这意味着下一阶段的竞争将从"参数规模"转向"效率优化"和"数据质量"。

第三层:场景验证。真实业务数据能不能转化为模型竞争力?答案是能,而且可能是最持久的竞争力。美团用外卖调度数据训练出来的 agent 能力,在 OpenRouter 上打败了绝大多数通用模型。

这三层验证叠加在一起,才构成 LongCat-2.0 的完整叙事。缺任何一层,它都只是一个"还不错"的模型发布。三层同时成立,它就是一个产业信号。

五、这个框架还能解释什么

三层验证框架不只是为 LongCat-2.0 服务的。把它放到其他场景里,同样有解释力。

DeepSeek 为什么能持续保持竞争力?供应链验证上,DeepSeek 最早在昇腾上跑通大规模训练(虽然过程极其痛苦);架构验证上,DeepSeek-V4-Pro 同样撞到了 97% 稀疏度的天花板,但它通过 CSA/HCA 注意力机制在长上下文效率上找到了新空间;场景验证上,DeepSeek 没有美团那样的业务场景数据,但它用极致的定价策略(deepseek-v4-flash 只要 $0.42/百万 token)在开发者生态中建立了场景。

智谱 GLM-5.2 为什么能在编程评测上领先?它的总参数只有 744B,激活 40B,比 LongCat-2.0 小一半。但在第三方评测里编程能力稳居国产第一梯队。这恰恰印证了"架构验证"的逻辑——在 MoE 扩展红利见顶的背景下,更小的模型通过更好的后训练数据也能达到接近的水平。

Anthropic 为什么对 Fable 5 又爱又怕?Fable 5 的能力确实强,但 Anthropic 没有美团那样的真实场景数据来训练 agent 能力。它的优势在基础模型能力,劣势在场景适配。这也是为什么 Fable 5 解禁后"写一行代码就降智"——不是模型不行,是场景数据不够。

六、所以,你该怎么做

如果你是 AI 创业者:停止追逐"更大参数"的叙事。LongCat-2.0 和 DeepSeek-V4-Pro 同时证明了 97% 稀疏度是 MoE 的天花板。下一波机会不在模型规模,而在数据质量和场景深度。如果你手上有真实业务场景的数据,你的模型竞争力可能比那些只会刷榜的通用模型更强。

如果你是技术决策者:国产算力的"能不能"问题已经解决,现在需要关注的是"稳不稳"和"贵不贵"。美团证明了 5 万卡昇腾集群可以稳定跑万亿模型,但这不是所有公司都能复制的——美团在底层算子适配和通信优化上投入了三年。如果你的团队没有这个工程能力,短期内还是优先考虑成熟的国产算力平台。

如果你是开发者:去试试 LongCat-2.0。它的定价极具侵略性——缓存命中完全免费,非缓存命中限时促销只要 $0.30/百万 token(输入)和 $1.20/百万 token(输出),比 DeepSeek-V4-Flash 还便宜。在 agentic coding 场景下,它的表现已经经过了全球开发者的"用脚投票"验证。

如果你是投资者:关注那些有真实场景数据的公司,而不是那些只会堆参数的公司。当 MoE 的扩展红利见顶,数据质量将成为新的稀缺资源。美团证明了"送餐公司"也能做出顶尖模型——不是因为它的技术团队比 OpenAI 强,而是因为它有别人没有的场景数据。


来源:美团官方博客、36氪、量子位、VentureBeat、Geopolitechs、知乎

滚动至顶部