Kimi K3 发布:开源模型正式迈入第三阶段——"自主工程时代"

如果你留意了过去两年AI圈的争论,会发现有一条几乎被所有人接受的默认假设:开源模型负责追赶,闭源模型负责领先。

2025年的一句流行说法是:"开源和闭源的差距,大概在半年到一年。"这个说法在Llama 405B发布时被提起,在DeepSeek-V3发布时被重提,在Kimi K2 1T发布时又被提了一次。

但直到2026年7月17日,这个叙事才真正遇到了一个挑战者。

Kimi K3——2.8万亿参数,全球首个开源的3T级模型——上线了。它在Arena.AI前端代码竞技场上超过了Claude Fable 5,在SWE Marathon和Program Bench两个编程评测上位列第一,在第三方Vals AI评估中以74.7分排在第二,超过了GPT-5.6 Sol。

但如果你只看到了跑分,就错过了更重要的东西。

关键在于:K3在所有这些评测中取得的成绩,背后不是"更努力地回答问题",而是独立完成了完整的工程任务

一个2.8T参数的开源模型,在48小时内自主设计了一颗芯片。从零开始写了一个类Triton的GPU编译器。在120多轮迭代中自主完成了一个完整的行业研究报告。

这些不是跑分题。这是实打实的端到端工程交付。

开源模型的竞争,已经换了赛道。

一、"更大"不意味着"能做事"——这次不一样

参数规模不是故事的全部

2.8万亿参数——这个数字给人的第一反应是"又大了"。K3是目前参数量最大的开源模型,896个专家中激活16个,稀疏度极高。

但K3真正不一样的地方,在于两项架构创新。

Kimi Delta Attention(KDA) 解决的是"信息在超长序列中如何流动"的问题——百万token上下文窗口,如果注意力机制设计不好,后半内容实际上被浪费了。Attention Residuals(AttnRes) 解决的是"信息在深层网络中如何保持"的问题——它可以跨层检索关键表示,而不是均匀累积。

这两个设计让K3在架构上就为"长程Agent式执行"做好了准备。相比K2,整体扩展效率提升了约2.5倍。

真正不同的是——它开始"自己做事"了

看几个官方披露的案例:

GPU编译器: K3从零开始构建了MiniTriton——一个类Triton的编译器,包含自己的IR层、优化开关和PTX代码生成管线。在标准评测中,MiniTriton性能达到了与Triton和torch.compile相当甚至超越的水平。

芯片设计: 在一个连续的48小时自主运行中,K3基于开源EDA工具和Nangate 45nm工艺库,独立完成了芯片的构建、优化与验证。最终在4mm²面积内实现了100MHz时序闭合和8700+ token/s的解码吞吐量。

科研复现: 在计算天体物理学中,K3完成了对I-Love-Q普适关系的重现。它审阅了20多篇论文、评估了300多个状态方程、发现了已发表公式中的不一致性、生成了3000多行Python代码,并构建了一个交互式HTML仪表盘。有经验的研究人员通常需要1-2周;K3用了2小时。

视频编辑: K3从56段原始素材中自主生成了一个品牌视频,完成了素材筛选、镜头匹配、节拍同步和音频处理——通常需要一个视频编辑1-2天的工作量。

这些案例的共同特征:它们不是"单次问答"的叠加。而是一个模型独立完成了一个完整的、多步骤的、需要持续自我验证和纠错的工作流程。

二、"开源能力三段论"——一个新的分析框架

回顾开源大语言模型的发展历程,可以清晰地划分出三个阶段:

第一阶段:问答时代(2023-2024)

开源模型的能力边界是"回答问题"。以Llama系列为代表,模型可以回答问题、总结文档、翻译文本。但你不会让它去做一件需要多步推理的事情——每一步都可能有偏差,累积起来就不可控。

这个阶段,开源模型是"科普级别的回答工具"。

第二阶段:单步任务时代(2025)

以DeepSeek-V3、Qwen2.5、Kimi K2为代表,开源模型在单步任务上达到了很高的水准。写一段函数、翻译一篇文章、生成一份报告大纲——这些"单点能力"非常强。

但这个阶段的特点是:每一步的质量是可接受的,但任务需要人的全程监督和拆解。模型是你"高技能实习生",你还是要复核每一项产出。

第三阶段:自主工程时代(2026起)

Kimi K3打开了一个新的窗口。模型可以自主规划、执行、验证和迭代一个完整的工程流程

"自主"不意味着"不用管"——K3仍然会出错,有些场景推理速度比Fable 5慢10倍。但人的角色从"复核每一个步骤"变成了"设定目标、检查输出、做方向性调整"。

这是质的提升。

三、框架的推演:谁在哪个阶段?

Llama 4: 还在第一和第二阶段之间。在"自主工程"维度上几乎没有公开进展。Llama在可部署性和生态兼容性上仍然是第一,但K3开辟了一个Llama目前没有覆盖的能力维度。

DeepSeek-R1/V3: 第二阶段的高地。DeepSeek在推理上做得非常出色,但案例集中在数学和逻辑推理这类"输入-输出明确"的任务上。还没有展示出"自己去完成一个工程"的能力。

Qoder/GLM-5.2: 第三阶段的竞争者。IDC报告显示阿里Qoder在AI Coding市场份额中断层第一。GLM-5.2在长程能力评测中也展示出强劲表现。

为什么"自主Agent能力"比跑分更重要?

端到端工程任务是非标准化的,很难"刷"。当模型需要自主完成芯片设计流程时,它要处理的问题包括环境配置、错误处理、工具调用、中间结果验证、策略调整——这些在静态评测数据集中几乎不可能被覆盖。如果一个开源模型能在这些维度展示出与闭源前沿匹敌的能力,这比任何benchmark上的数字都更有说服力。

四、落到行动

如果你在选择模型做产品:

K3的定价是百万token输出100元,比Fable 5的338元低了三分之二。但更重要的不是价格。如果你需要一个能承担长程自主任务(数据调研、代码重构、报告生成)的模型,K3提供了闭源模型之外的一个选项。

如果你在做AI应用产品:

"开源+自主Agent"的组合改变了一个底层假设。如果K3真的能在长程任务上自主运作,"AI原生应用"的形态可以不再是"对话界面加工具调用",而是"设定目标,让Agent自主完成"。这是开源模型第一次以可复用的方式提供这个能力。

如果你是技术人员:

去Kimi Code或Kimi Work上试试长程任务——不是"帮我写个函数",而是"帮我从这份200页文档中提取关键数据,写一个报告,加一个交互式可视化"。这是K3真正擅长的东西。

K3的完整权重将在7月27日前开源。 届时我们才能真正看到社区能把它推到多远。


来源:Kimi官方技术博客(kimi.com/blog/kimi-k3)、智东西/36氪采访报道、Vals AI及Arena.AI独立评测

滚动至顶部