48小时,一场蓄谋已久的冲击波
2026年7月18日,月之暗面发布了Kimi K3。48小时后,全球AI格局出现了肉眼可见的裂痕。
Kimi官方不得不在7月19日深夜发布公告——算力告急,暂停新用户会员订阅,现有算力全部留给老用户。一个模型火热到把自己的服务器挤爆,这在AI行业并不多见。
而在资本市场,K3发布后的首个交易日,英伟达单日市值蒸发约1111亿美元。费城半导体指数本周下跌12.5%,创下15个月来最差单周表现。摩根大通策略师在报告中直接称之为"DeepSeek 2.0"。
Anthropic的反应可能更有趣。原本计划将Fable 5从订阅制下架转为纯按量计费,K3发布的第二天就改了口——Fable 5永久保留在订阅方案中,还给用户发放了补偿额度。
美国前AI事务负责人David Sacks发文称,这是中国模型第一次在前端编程赛道拿下第一名。他补了一句:照此以往,美国将输掉AI竞赛。
K3到底做了什么,能引发如此连锁反应?
拆解K3:RL Scaling的第一次大规模落地
要理解K3,得先回到2024年。当时杨植麟在内部小范围分享了K0-Math模型,并提出了一个判断:下一个Scaling Law,叫做Reinforcement Learning Scaling,简称RL Scaling。
过去的Scaling Law,本质是让模型"死记硬背"——喂进海量数据,模型把所有答案背下来,遇到题目时拼出一个"最像正确答案"的东西。学术上叫Next-Token Prediction。
而RL Scaling改变了思路:不让模型背答案,而是让它学会自己刷题、自己改错。模型先试着做一遍,做完给自己打分,做错了回头看哪步出问题,改一遍再交,改到对为止。然后把这个过程记下来,变成经验。
K0-Math用这个逻辑把数学成绩推到了超过OpenAI o1的水平。而今天的K3,是RL Scaling从数学推理扩展到全场景的首次大规模落地。
K3技术报告中提到的"视觉闭环"(Vision in the Loop),本质就是把RL Scaling能力扩展到带视觉反馈的全场景——模型写完一段代码,自己看看效果,哪里不对自己改,改完再看,形成 "生成→看效果→迭代" 的完整工作流。
K3展示了几个令人印象深刻的Demo:从零编写了一个3D开放世界游戏(Three.js + WebGPU),从56段素材中自行剪辑了一支帧级精准的发布预告片——画面切换精确到具体的帧,刚好处在鼓点最"咚"的那一帧上。
几个硬指标
K3是全球首个开源的3万亿级别模型,总参数达2.8万亿。在KDA(Kimi Delta Attention)混合线性注意力机制作用下,百万token级别的长文本解码速度提升了6.3倍。配合Attention Residuals技术,训练效率提升约25%,额外成本不到2%。
评测机构Artificial Analysis给出的数据显示:K3在AI智能指数上拿到57分,排名全球第三,仅次于Claude Fable 5(60分)和GPT-5.6 Sol(59分),超过了Claude Opus 4.8(56分)、GPT-5.5和GLM-5.2。
更关键的是性价比。K3完成单个任务的成本为0.94美元,与GPT-5.6 Sol的1.04美元相近,只有Claude Opus 4.8(1.80美元)的一半。
K3的四个冲击波
第一波:用户端——算力峰值暴露了真实需求
K3上线48小时内,请求量大幅超出预估,逼近现有算力集群的承载极限。这揭示了一个被低估的事实:市场对高质量、低成本模型的渴求远超预期。Kimi不得不将会员体系拆分为Kimi主权益和Kimi Code权益,以更精准地分配算力。
与此同时,外媒爆料称Kimi已向投资者发出股东决议,寻求对香港上市的批准,最快六个月IPO。估值可能超过300亿美元。ARR从3月的1亿美元飙升至6月的近3亿美元,三个月内翻了三倍——K3发布后更实现了数倍增长。API业务占比突破70%,收入结构已经完全转向B端驱动。
第二波:资本市场——"DeepSeek 2.0"的寒蝉效应
英伟达单日蒸发1111亿美元,与2025年1月DeepSeek发布时的场景如出一辙。这不是巧合。市场正在重新定价"中国开源AI+高效算力"这一组合的破坏力。当开源模型以十分之一的成本实现接近闭源巨头的性能,底层算力需求的结构性预期就被动摇了。
第三波:竞品——Anthropic的连夜转向
原本计划将Fable 5从订阅制下架转纯按量计费的Anthropic,在K3发布后第二天就改口官宣:Fable 5永久保留在订阅方案中。这是一种防御性回应——当用户发现可以用K3完成Fable 5绝大多数任务,且费用远低于后者时,Anthropic的唯一选择是降低准入门槛,留住生态。
第四波:产业认知——开源差距从6个月缩至2-3个月
加州大学伯克利分校教授、Databricks联合创始人Ion Stoica一针见血:"我们过去常说,开源模型,尤其是中国的开源模型,比目前最先进的模型落后六到九个月。可现在,这个差距大概只有两到三个月了。"
这个判断比任何跑分都更有分量。它意味着闭源模型的生产者不再拥有"时间溢价"。当一个用户可以在今天、免费、用开源模型完成几乎全部AI任务时,闭源的价值主张必须重新定义。
K3的边界在哪里
当然,K3不是完美的。Artificial Analysis的智能指数只是一个综合分,拆开来看单项,差距仍然明显。
在真实代码库长程工程能力基准DeepSWE中,GPT-5.6 Sol拿到73.0分,Fable 5拿到70.0分,K3是67.5分。在长时间、多步骤、高复杂度的硬骨头工程任务上,K3要逊色于Fable 5和GPT-5.6 Sol。
在高难度视觉推理测试Zerobench中,Fable 5拿到46.0分,K3是41.0分。Fable 5能仅凭截图就重建Web应用的完整源代码,能从密集科学图表中提取精确数据——在视觉理解的深度和精度上依然领先。
K3还面临两个部署层面的缺陷:
- Harness依赖性高:K3保留了完整思考历史,如果调用方没有正确传递之前的推理过程,或在会话中从其他模型切换到K3,输出质量会明显下降。
- 过度主动:在任务模糊时模型更倾向于替用户做决定而非先确认意图。在快节奏创意场景中这可能是优点,但在需要精确执行的工程流程里可能引发连锁错误。
还有一个不可忽视的问题:幻觉率不降反升。对于一个定位为"长程编程和知识工作"的模型来说,这是致命的。12小时的自主编程任务,中间如果在一个关键决策点上产生幻觉,整条链路就全崩了。
Fable 5在这方面有天然优势——Constitutional AI让它更"谨慎",拿不准的事情直接说不确定,由此大幅减少幻觉。
回到起点:杨植麟为何选择这条路
36氪报道中披露了一个细节:杨植麟的CMU导师Ruslan Salakhutdinov在K3发布后发文庆祝,意外引爆了一场讨论——美国为何留不住杨植麟?
Ruslan专门发了一条长文澄清:"他如果想留在美国,有很多机会。但杨植麟非常坚定地要回去创业。他跟我说过,如果他不至少尝试一次创办自己的公司,他会后悔一辈子。"
杨植麟认为,大厂科学家即使能力很强,也往往没有足够的资源和权力推动产品落地。"我们看到老师们在工业界有一些title,但其实本质上他们还是在做研究工作。基础研究固然重要,但无法打破学术界与工业界之间的壁垒。"
从2016年博士二年级创业做循环智能,到2023年创办月之暗面,他的路径一直没有变。K3是RL Scaling路线从实验室走向产品化的验证,而这家公司则是他"把技术做到产品"执念的兑现。
格局推演:K3之后意味着什么
K3的48小时,不只是月之暗面的胜利,它揭示了几个正在发生的结构性变化:
第一,RL Scaling正在成为新的竞争高地。当预训练数据的边际收益递减,通过强化学习让模型"自己学会思考"成为拉开差距的新维度。K3的视觉闭环是一个方向,但不是终点。谁能在RL Scaling的工程化上走得更远,谁就能在下一次模型迭代中占据主动权。
第二,开源模型的"追赶速度"被严重低估。从6个月到2-3个月的差距,意味着闭源模型的"护城河"正在加速变浅。闭源模型的价值越来越依赖于极端复杂的长程任务、极致的可靠性和安全护栏——这些都是开源模型短期内难以追赶的,但绝大多数AI应用的场景并不需要这些极端能力。
第三,算力基础设施正在成为新的瓶颈。K3的"暂停订阅"事件表明,好模型不缺用户,但缺GPU。这对模型设计、算力调度和定价策略都提出了新的要求——当能力溢出,瓶颈从算法转向了物理层。
第四,全球竞争的逻辑正在转移。从"谁做出了最大的模型"转向"谁能做出最高效、最具性价比、最易获取的模型"。K3以一个开源的中国模型撼动了英伟达的市值和Anthropic的定价策略——这不是偶然,这是新竞争逻辑的第一次公开演练。
对AI从业者的启示
- 如果你的工作涉及长程编程任务,K3是一个值得认真评估的选项——尤其是性价比优势明显。
- 部署K3需要关注harness架构的一致性——从其他模型切换过来需要谨慎评估输出质量的影响。
- K3在创意生成场景(游戏开发、内容创作)中表现出色,但在高可靠性需求的工程场景中建议搭配验证机制。
- RL Scaling方向值得关注。这不是终点,K3只是这条路线第一次规模化落地——第二代、第三代RL Scaling模型的差异会更显著。
参考来源:36氪《K3发布48小时,服务器满载、英伟达暴跌、Anthropic连夜改订阅》,Kimi K3 Technical Report,Artificial Analysis Benchmark
