一、看不见的天花板
两周前,在极客公园读到一篇文章,讨论"中国AI还有没有希望"。核心焦虑其实就一句话:拿不到英伟达最好的卡,还能做出世界级的模型吗?
这个焦虑在过去一年半里几乎成了共识。从A100禁售到H20受限,从CUDA生态的不可替代到训练集群的工程壁垒,所有人都在追问同一个问题:国产算力到底行不行?
6月30日,美团用LongCat-2.0给出了一个难堪却诚实的回答——不是"行不行"的问题,而是"是否有人愿意花三年时间从打地基开始干"的问题。
LongCat-2.0,1.6万亿参数(平均激活480亿),MoE架构,支持1M上下文。如果不看训练硬件,这些数字在今天的大模型牌桌上并不刺眼——DeepSeek-V4-Pro同样是1.6T/49B/1M,甚至在跑分上还领先半档。但LongCat-2.0有一个所有竞品都没有的标签:它从预训练到推理,没有使用任何一张英伟达或AMD的GPU。
5万张国产加速卡(社区普遍推断为华为昇腾910C),从零开始预训练,30T tokens数据,连续稳定运行,无回滚,无不可恢复的loss突刺。这不是实验室的Demo,这是中国最大的外卖公司在真实业务集群上做出来的事。
但坦率说,如果LongCat-2.0只证明了"国产算力可以训万亿模型",它就是一个政治叙事,不是一个技术故事。真正值得关注的,是它同时暴露的另一层天花板——而这一层,对全行业都适用。
二、美团挖的第一堵墙:国产算力的工程奇迹
注意这个表述:"从头预训练"和"用国产卡做推理/后训练"是两件事。
今年6月初,深圳河套学院联合哈工大、华为做了一个项目:拿现成的DeepSeek-V4-Pro权重,在昇腾910C集群上做全参数后训练,跑了1500多步稳定训练。这件事在行业内被视作一个工程突破——它证明了国产卡可以微调一个万亿模型。
但微调是"在已有地基上装修"。
从零预训练是"从挖地基开始建一栋楼"。
一个1.6万亿参数的MoE模型,在5万张国产卡上做预训练,需要面对的问题包括但不限于:单卡显存远小于H系列(910C约64GB HBM vs H100的80GB),通信带宽不足(昇腾HCCL vs NVLink/NCCL),算子的覆盖度和成熟度差距巨大,集群规模扩大后故障率指数级上升……
美团的工程团队是怎么解决的?
从公开的技术细节看,这是一场硬仗:通过HCCL异常处理和自动故障恢复把月均日故障率降低70%以上;自研全确定性算子保证结果bitwise一致;在流水线调度、显存优化、算子级控核上抠每一分效率,最终把训练MFU提升了1.5倍,实现稳态日吞吐超过1T tokens/day。
一位参与过类似工程的人给我形容:在国产卡上做预训练,相当于用更小的铲子、更慢的传送带,盖一座和英伟达集群一样高的大楼。而且没有现成的施工图纸——CUDA那一套搬不过来,全得自己写。
LongCat团队把这座楼盖完了,而且从用户体验来看——OpenRouter匿名测试期间,LongCat-2.0(代号Owl Alpha)全球调用量第三,在Claude Code场景下全球第二,仅次于Claude Opus本身——这座楼住着还相当舒服。
这堵墙,美团翻过去了。
但它的真正意义不是"国产替代成功",而是为中国AI产业回答了那个焦虑的核心问题。国产算力从"能不能"已经进入到"该不该"的阶段——不是技术上能不能做,而是从商业角度,值不值得投入资源去适配和优化。
答案显然是肯定的。而且美团的路径不可复制地验证了一个关键事实:自建算力的非云厂商,反而是国产算力适配的最佳土壤——它们不受公有云CUDA技术栈的绑定,没有几百万人月的迁移成本,可以像创业公司一样从零选择最合适的硬件方案。
三、美团挖的第二堵墙:MoE稀疏度97%——堆专家的终结
如果LongCat-2.0只做了上面这件事,它就应该被归类为"国产替代的重要一步",然后被大多数技术人划走。
但美团的技术博客里藏了一句远比国产算力更重要的话——我把它原样抄下来:
"模型的MoE稀疏度在不考虑N-gram Embedding的情况下已经达到约97%,再扩135B专家参数带来的性能增益可以忽略不计。"
这句话的信息密度极高。我来拆一下。
MoE(混合专家模型)的核心逻辑是:把模型拆成很多"专家",每个token只激活其中一小部分。参数总量可以做到很大,但每个token的实际计算量保持在一个可控范围内。DeepSeek-V3是671B总参/37B激活,稀疏度约94%;V4-Pro是1.6T/49B,稀疏度约97%。LongCat-2.0也是97%。
而美团的数据说:到97%这个数字,再加专家,收益已经测不出来了。
做个极端一点的反事实推演:
假设LongCat把专家池再扩一倍到3.2T总参数,按97%的稀疏度,每个token激活的还是那48B。用贵一倍的硬件、占一倍的显存,跑出来的前向计算和现在一模一样。这是"花钱买了个寂寞"。
MoE的本质是用一个路由器给每个token挑专家。专家越多,每个token只激活其中一小撮,真正参与计算的参数占总参数的比重就越低。当这个比例低到3%以下,再加专家,相当于往一个已经足够大的仓库里继续塞书——但每本书被翻到的概率越来越低。
这不是一个渐进式的优化问题,这是一个架构层面的渐近线问题。"更大"在MoE范式中已经走到了边际收益趋零的拐点。
过去两年,行业的主旋律是"扩专家池":560B → 671B → 1T → 1.6T。每家都在用参数总量做营销叙事。美团的数据直接给出结论:这条路的尽头已经到了。
那接下来的增量在哪?
美团LongCat-2.0的架构给出了方向——注意力机制效率(LSA稀疏注意力)、上下文效率(1M token的推理成本压到可商用)、后训练数据质量(MOPD多目标后训练)、推理成本优化——这些才是"后MoE时代"的战场。
更有意思的是,DeepSeek-V4-Pro也达到了97%的稀疏度。两家团队独立走到同一个数字,说明这不是某一家的巧合,是整个技术路线的结构性信号。
四、"两堵墙"框架:一部正在重写的中国AI叙事
把两件事放在一起看,LongCat-2.0实际上同时击穿了两层天花板:
- 算力自主墙——国产算力从"能不能用"到"能不能训万亿模型",再到"能不能稳定盈利"。美团翻过去了。
- 架构效率墙——MoE从"比谁更大"到"比谁更聪明",堆专家不是答案了。
这个"两堵墙"框架可以帮助我们理解当前中国AI产业的位置:
第一堵墙的前后。在LongCat-2.0之前,你可以在任何一个技术会议上听到这样的观点:"国产芯片做推理可以,做训练不行。"现在这个共识被粉碎了。不是被某个芯片公司的PPT粉碎的,是被一个每天服务上亿用户的外卖公司用真金白银的工程投入粉碎的。这比任何政策文件都更有说服力。
代价是什么?美团在AI上的持续投入"除云计算业务的企业外,大概率是国内企业里最大的",投资覆盖了从芯片设计(摩尔线程、沐曦、紫光展锐)到具身智能(宇树科技、银河通用)的全链条。这是一场以三年为单位的战略重注。
第二堵墙的前后。在LongCat-2.0之前,每一家大模型公司的融资PPT上,参数总量都是最重要的卖点。但现在这个叙事失效了——如果97%的稀疏度是物理极限,再增加参数总量只是在增加营销预算,而不是技术能力。
这意味着模型竞争的焦点将从"你的模型多大"转向"你的模型多聪明"——后训练数据的质量、稀疏注意力机制的效果、推理成本的控制能力、Agent场景的实战表现。对这些维度的比拼,拼的是工程深度而非参数数量。
这对DeepSeek、智谱、阿里、字节这些玩家意味着什么?意味着过去两年的参数竞赛已经结束了——不是因为没有更大的模型,而是因为更大的模型没有意义了。下一轮竞争围绕的是效率优化、场景适配和成本控制。
五、三组人的不同行动
LongCat-2.0给了三组人不同的信号:
如果你是模型厂商——停止以参数总量为竞争指标。在固定的激活预算下(30-50B),真正的战场在后训练质量、稀疏注意力效率、推理成本控制和Agent场景的真实表现。把扩专家的资源挪到这些方向上来。
如果你是国产芯片厂商——LongCat的工程反馈是难得的真实量产数据。单卡显存、通信带宽、算子覆盖度、集群稳定性,这些是模型厂商真正疼的地方。把资源聚焦在这些"工程级痛点"上,而不是追求单卡跑分。
如果你是AI应用开发者——LongCat-2.0已经开源(MIT协议),在Agentic Coding场景的调用量全球第二。你可以免费获得一个在真实代码任务上验证过的万亿参数模型,运行成本低于同级别竞品(美团定价9.9元/5000万token)。对于做AI Coding工具的团队来说,这套"开源模型+低成本推理"组合是实实在在的基础设施红利。
来源:IT之家、36氪(知乎用户"大狗狗是狼"授权转载)、量子位、Geopolitechs。美团LongCat-2.0已开源,模型权重见 Hugging Face:meituan-longcat/LongCat-2.0。
