围城突围:Kimi K3开源背后,被围墙"逼出来"的Transformer革命

引言:一封公开信背后的产业链裂变

7月27日晚,月之暗面将Kimi K3的完整权重挂上Hugging Face——2.8万亿参数、全球最大开源权重模型,附带技术报告和三套关键基础设施(MoonEP、FlashKDA、AgentEnv),一并开放。

这并非一次普通的开源发布。三天前,黄仁勋发出入驻X后的首条推文——一封题为《开放权重与美国AI领导力》的联署公开信,最初25家企业联署,48小时内翻倍至50家,连OpenAI和谷歌也补充签署。白宫AI事务负责人萨克斯公开表达异议,标志着政策层与产业层在"开放模型"问题上的分歧从技术讨论升级为正面交锋。

《连线》杂志的定调一针见血:硅谷已经彻底因中国AI而分裂。

这篇分析不讨论K3的跑分——那已被充分报道。我们聚焦的问题是:在高端芯片断供的围墙内,中国AI公司究竟做了什么,以至于让黄仁勋罕见与白宫唱反调,让硅谷数十家公司集体站队?

一、拆墙:Transformer"三大件"的逐一重构

K3最震撼技术界的,不是2.8万亿参数这个数字本身,而是它如何只用500亿活跃参数(不到总参的2%)就跑出了逼近GPT-5.6 Sol和Claude Fable 5的水平。

深度学习沿用九年的"三大件",在K3里被逐一重做了一遍:

1. 注意力机制:从"黑历史笔记本"到"白板"

传统Transformer的KV Cache是会话的"历史笔记":每生成一个token就把所有上下文Key/Value向量留底。在Llama 3.1-70B上,单token约320KB缓存。100万token上下文下,一个会话需要320GB显存——英伟达旗舰Rubin单卡总共才288GB。

Kimi的解法是KDA(Kimi Delta Attention):线性注意力机制,用固定维度的矩阵状态替代不断膨胀的KV Cache。K3采用3:1混合架构——3层KDA穿插1层全注意力。对比传统MLA基线,KV缓存最高省75%,百万token上下文下吞吐提升6倍。

结果是:K3参数是Llama 3.1-70B的40倍,但单token缓存反而小13倍。这就是K3能跑100万token长上下文、同时并发处理数十个客户端的底层原因。

2. 残差连接:从"无差别叠加"到"选择性聚合"

传统残差连接把每层输出无差别地叠回主干。K3的注意力残差(AttnRes)让每层对前面各层的输出做选择性聚合——深层学会自主判断"哪些层的信息现在有用"。训练算力可省两成,并且把全部层折成8块独立记账以压住开销。

3. 优化器:从AdamW到Muon的"八美元革命"

2024年底,研究者Keller Jordan在nanoGPT提速竞赛中用Muon优化器跑出了单次训练试验仅8美元的成本。2025年1月Jordan加入OpenAI。一个月后,月之暗面引用了这篇博客,在百亿参数级别验证出约为AdamW两倍的算力效率。K3将Muon进一步细化为按注意力头独立调节的MuonClip。

这三个改造的每个细节都不需要经过海关。注意力机制是算法,残差连接是数学公式,优化器是组合规则。算力围墙拦得住芯片和光刻机,拦不住架构设计。

二、建框架:两条"墙"的博弈

理解K3和整个中国AI突围,需要从两条不同性质的"墙"入手。

算力墙:把问题从"算力"推向"容量"

2022年10月起的美国对华出口管制,让中国AI公司无法获取最先进的GPU。但MoE、低精度量化、混合注意力等架构创新,把问题从"我需要一张造不出的超大卡"变成"我用一群连得起来的普通卡"。参数轮班(MoE)省算力但不省权重——K3在MXFP4精度下仍有1.4TB权重,官方建议64卡起步。

买卡的标准也因此改变:算力的重要性在下降,容量与互联在上升。

数据墙:所有人面前的天花板

今年3月,杨植麟在GTC上做《How We Scaled Kimi K2.5》演讲时没有提任何芯片管制。他说的是另一件事:高质量数据是有限的。"Token效率不只是效率问题,它实际上也在抬高智能的上限。"当数据堆到尽头,模型能从每个token里多学到多少,才决定了智能还能再涨多少。

算力墙把中国公司围在里面,数据墙挡在所有人面前。这两种叙事并不冲突——数据墙决定这条路迟早有人要走,算力墙决定谁先走、要走多快。

回头看这四年:MLA、DSA、KDA,再加上把MoE推到极限稀疏的路线——这条时间线上密度最高的架构创新,几乎全部出自算力围墙之内。

三、推演:改写全球产业账单的三条路径

路径一:混合架构成为2026-2028年的常态

全注意力不会消失,但正从"固定主干"变成"按需精确能力":大多数token走更便宜的线性路径,遇到复杂多跳推理时才调用全局检索。按需分配还会扩展到专家、推理深度和精度。

一个有趣的信号:MiniMax在M1用线性+Softmax混合,M2退回全注意力,M2.5延续全注意力,M3又转向稀疏注意力——三代走了一个折线。预训练负责人孙浩海解释过原因:小模型上混合结构效果很好,但规模做大后多跳推理会吃亏。K3用2.8万亿参数的实际运行结果证明:混合结构在大规模下是可行的。

一套架构通吃所有芯片的时代或许正在结束。同一模型家族未来可能从训练阶段起,就针对不同的显存容量、互联方式和精度单元分化出不同的布局——模型会像程序一样,按机器分别编译。

路径二:算力在分家,内存在收租

杰文斯悖论在AI领域上演:效率提高了,需求总量不降反升。十九世纪英国蒸汽机效率大幅提高,煤炭消耗却一路上行——因为门槛降低后,更多行业开始烧煤。

大模型也一样。token越便宜,百万上下文、深度推理、常驻agent等新需求就越快涌入。K3是目前最好的例证:架构压缩最狠的一代,反而定价最贵——输出每百万token 15美元,接近K2.6的四倍。月之暗面商业化负责人黄震昕回应:"我们的定价不是朝一个非常便宜的价格去定的,也想借这个机会告诉全世界,开源模型,包括中国模型,不是低价标签。"

今年一季度DRAM合约价环比涨约九成。省下的显存很快被更长上下文、更高并发、更大参数吃掉,需求从HBM外溢到主存和固态盘。算力在分家,内存在收租。

路径三:开源成为新权力中枢的入场券

黄仁勋的逻辑链条清晰:权重越开放,模型越像公共零件,买卡的人就从少数巨头变成更广泛的开发者和企业。真正让英伟达紧张的,反而是闭源大客户(OpenAI、Anthropic)自研芯片。

K3权重上传Hugging Face后,微软正在评估是否用在Copilot中并接入Azure。DoorDash、Coinbase等美国企业已被证实在部分业务场景中启用K3处理成本敏感型任务。

开源已经不只是"道德正确"——它正在变成一项产业基础设施。谷歌DeepMind CEO哈萨比斯公开背书开放生态,同时主张建立一个由美国牵头的独立标准机构。而Anthropic因为坚持闭源立场,在硅谷"日益孤立"。

四、落到行动:三层启示

对AI从业者:混合架构下的新技能树

线性注意力、稀疏路由、量化感知训练将从"论文里看到但用不上"变成日常工具。关注KDA、Muon、FlashKDA等已开源的组件,它们在vLLM、SGLang、TensorRT-LLM中已经成为现成选项。

对技术决策者:成本结构正在被改写

Token定价的竞争正在从"多便宜"转向"多贵"——因为真正的成本不来自推理本身,而来自状态(KV缓存)的生成、保存与复用。Kimi差异化定价(命中复用$0.3 vs 未命中$3/百万token)给出了一个清晰的信号。

对企业:选择权从未如此重要

微软CEO纳德拉的判断值得每个CTO放在桌上:"全公司只押一个AI,最后可能把整家公司都押没了。"开源模型的可用性正在接近闭源,而价格仅为三分之一到一半。多模型策略不再是备选方案,而是成本控制的必要条件。


围城仍在,突围仍在提速。当初那堵墙要拦的,是墙内的人还能造出什么;四年过去,从芯片的形状、内存的价格到智能的标价,改写全球账单的笔,反而握在了被围的人手里。

K3不是终点。V4、K3的论文与权重公开,KDA内核开源——创新发生在中国,标准留在开源社区,利润被内存厂、云平台和应用拿走。中国模型公司要避免这一结果,就不能只出售权重与token,还需要进入托管运行时与长运行agent。

这将是中国AI的下一场战役。

滚动至顶部