Kimi K3 发布:开源模型第一次让"执行能力"成为竞争主场

开源模型第一次让"执行能力"成为竞争主场

7月17日晚,Kimi 发布 K3——2.8万亿参数、百万级 token 上下文、全球首个开源的 3T 级别模型。

不出所料,中英文媒体都在用同一个叙事框架报道这件事:"国产模型追赶闭源巨头"、"又一个 DeepSeek 时刻"、"K3 在 Arena 登顶超越 Fable 5"。

这些报道没错,但它们漏掉了真正重要的东西。

如果 Kimi K3 只是一次常规的参数升级,它不值得写这篇分析。但 K3 不是。它展示了一个被 benchmark 排名掩盖的结构性变化:AI 能力的竞争正在从"模型能回答什么"切换到"模型能执行什么"。

这不是一次模型发布,是一个分野信号。

一、参数只是入场券,benchmark 排名正在失效

先处理最容易被忽略的事实:K3 的 2.8T 参数不是关键。

开源模型的参数竞赛已经持续了一年多,从 K2 的 1T 到 K3 的 2.8T,行业对"参数膨胀"已经麻木。真正值得看的是 K3 做了哪些架构创新,让如此大规模的参数变得可用。

两项核心架构升级值得注意:Kimi Delta Attention (KDA)Attention Residuals (AttnRes)。简单来说,KDA 让信息在长序列和深层模型中更顺畅地流动,AttnRes 解决了深层网络中注意力机制的信息退化问题。配合 Stable LatentMoE 框架,K3 在 896 个专家中激活 16 个,相比 K2 扩展效率提升了约 2.5 倍。

翻译成人话:他们找到了在不爆炸推理成本的前提下扩大模型的工程方法。

这比 benchmark 排名重要得多,因为它回答了开源社区一个悬而未决的问题——"我们是否必须接受开源模型永远落后闭源一代?"K3 给出的答案是:"不,但前提是你愿意在架构上做硬创新,而不是堆算力。"

再看 benchmark 数据:K3 在前端代码测试 Arena 登顶,超越 Fable 5;在 Vals AI 综合测试得分 74.7,仅次于 Fable 5,超越 GPT-5.6;在超长代码开发 SWE Marathon、网页深度调研 BrowseComp 等任务中排名第一。

但官网自己也承认:在综合白领任务、贴近真实办公流程的评测中,K3 仍弱于 Fable 5 和 GPT-5.6 Sol。

换句话说,K3 不是"全科状元",但它证明了开源模型可以在特定高价值领域做到世界级。这个"局部超越"的格局,比完全持平更有信息量——它暗示了未来模型竞争不是一维的,而是场景化的。

二、K3 真正改变的东西:从"能聊"到"能干"

如果只看参数和排名,你会错过 K3 最有意思的部分。

Kimi 官方展示了一个案例:用 K3 生成了一个 ASIC 行业 42 年研究网站。不是写一篇文章,不是生成一个答案,而是自主完成了 120 多轮迭代、2800 多次网页搜索与抓取、1100 多次终端数据提取,处理 87 份季度报告和 99 份原始 PDF,最终生成包含定制图表、动画和交互式可视化叙事的研究报告。

再强调一次:这不是人类操作的,是模型自主执行的。

另一个案例:K3 在连续 48 小时的自主 Agent 运行中,基于开源 EDA 工具和 45nm 工艺库,独立完成了芯片的构建、优化与验证。

还有那个让海外开发者震惊的达芬奇工坊模拟器——K3 不仅生成了视觉风格,还理解了扑翼机的历史背景、材料结构和空气动力学知识,将它们融入了交互式体验。

这些案例的共同点是什么?

不是 K3 知道更多,而是 K3 能做更多。

传统的 LLM 评估(MMLU、HumanEval、GSM8K)测的是"模型知道什么"。K3 的这些案例测的是"模型能完成什么"——这是一个完全不同的维度。前者是知识储备,后者是执行能力。

K3 能完成这些任务,源于它的长程 Agent 式执行能力设计。模型可以把编程、视觉理解、工具调用和知识工作串成完整流程,而不是一次性的问答回合。一个任务可能跨越上百次迭代,涉及跨工具调度和自我纠错。

这也是为什么 K3 在部分传统 benchmark 上不如 Fable 5,但在复杂任务执行上却能相提并论——现有 benchmark 并不测试"端到端任务完成"这个维度。

三、"两层演进模型":重新理解 AI 能力地图

K3 给我的启发是:我们需要一个新的框架来评估和理解 AI 模型的能力演进。

我称之为"AI 能力的两层演进模型"

第一层:对话智能(Conversational Intelligence)

这是过去三年 AI 竞争的焦点。核心指标是知识储备、推理准确度、语言流畅度。典型评估方式是问答测试、多选题、代码生成。这一层的上限是"模型能正确回答一个复杂问题"——它是单向的、被动的、一次性交互。

第二层:执行智能(Execution Intelligence)

这是 K3 试图定义的新维度。核心指标是自主规划能力、多步执行鲁棒性、工具调用正确率、错误恢复能力、成果交付完整性。这一层的上限是"模型能从模糊目标出发,自主完成端到端任务"——它是多轮的、主动的、可交付完整成果的。

两者不是替代关系,是叠加关系。第一层是基础——你不可能在不知道的情况下做好。但第一层优秀并不能保证第二层出色。事实上,许多在 MMLU 上得分很高的模型,在涉及 10 步以上 Agent 任务时表现急剧下降。

这个框架可以解释 K3 的独特位置:在对话智能层面,K3 仍然弱于 Fable 5 和 GPT-5.6 Sol;但在执行智能层面,K3 已经进入世界一流——在某些场景(如网页深度调研、长程代码开发)甚至领先。

这也解释了 K3 的定价策略:输入 20 元/百万 token、输出 100 元/百万 token,高于前代 K2.6 的 6.5/27 元,但仍远低于 Fable 5 的 $10/$50(约 68/339 元)。Kimi 显然在按"从谈话价格到干活价格"重新定价——能执行复杂任务的模型,价值维度不同。

四、推演:这个框架能解释什么

两层演进模型不止适用于 K3。它可以解释并预测整个行业的变化:

为什么 Anthropic 推出了 Cowork? 因为 Claude 在对话智能上已经接近天花板,必须进入执行智能市场。Cowork 是 Anthropic 在第二层的第一批产品化尝试。

为什么 OpenAI 推出了 Operator 和 Codex Agent? 同样的逻辑。GPT-5.6 的对话能力已经足够好,增长空间在下游的执行层。

为什么开源模型在特定执行场景反而能超越闭源? 因为执行智能的优化目标和对话智能不同。一个专注于"让模型能在终端上跑 48 小时不崩"的团队,可能在执行智能上走得更快,即使它们的对话智能略逊一筹。K3 的 KDA 架构正是为此设计的——长序列、多步骤、可持续执行。

为什么 AI 开发工具(Cursor、Windsurf 等)的竞争越来越激烈? 因为它们本质上是在搭建从"对话智能"到"执行智能"的桥梁。K3 这样的模型自带更强的执行能力,意味着工具层的竞争范式也会变化——模型越能自主执行,工具需要做的"兜底"就越少。

这个框架还能帮你理解价格趋势。如果对话智能是"信息商品",执行智能是"服务商品"——前者随着开源竞争会持续趋近于零,后者则会因为交付价值的差异而形成显著的价格分层。K3 的定价已经暗示了这个方向。

五、落到行动:不同角色应该怎么做

这不只是行业观察。K3 的发布和"两层演进"框架,对不同角色有直接的行动意义:

如果你是开发者/技术负责人:

立刻开始测试 K3 的 Agent 模式,特别是长程代码开发和终端运维场景。K3 在 SWE Marathon 和 Terminal Bench 上的表现说明,它在"挂着跑一天"的场景下可能比你的当前方案更好。7月27日开源后,更值得拉下来做私有部署和微调。

如果你是产品经理/科技创业者:

重新评估你的产品架构。如果你当前的产品围墙是"模型只能回答问题",K3 级别的执行智能可能让你实现"产品能自主完成任务"。这不是增量改进,是品类可能性。想想那些需要跨越 10 步以上的工作流——市场调研、竞品分析、代码审计——哪些现在可以全自动化了?

如果你是 AI 研究者/模型工程师:

K3 的架构创新(KDA、AttnRes、Stable LatentMoE)值得深入研究。开源社区最大的瓶颈不是参数规模,而是"大规模模型的推理效率"。K3 展示了通过架构设计而非单纯堆算力来突破这个瓶颈的路径。

如果你是普通高级用户:

尝试给 K3 一个"模糊的任务目标"而不是"具体的问题"。你会发现差别。不要问"帮我解释什么是 Transformer",而是说"帮我做一个介绍 Transformer 原理的交互式网页"——前者是对话智能,后者是执行智能,而 K3 的强项是后者。


核心 thesis:Kimi K3 的价值不在于参数规模和 benchmark 排名,而在于它第一次让开源模型展示了从"对话智能"到"执行智能"的跃迁路径。参数竞赛的上半场结束了,任务执行的下半场开始了。

滚动至顶部