9 月 22 日,全球最强的开源模型不再出自 DeepSeek、阿里或月之暗面,而是来自小米——一家在多数人心里仍归入「手机和汽车」的公司。MiMo-V2.6-Pro 在 Artificial Analysis 综合智能指数(v4.3.2)拿下 46 分,超越 GLM-5.3、Kimi K3、Qwen3.8 Max,登上开源模型榜首。而小米上一代 MiMo-V2.5-Pro 在同一指数上只有 26 分——几个月,二十分。
大多数人的反应是惊叹跑分。更有用的反应,是看跑分旁边那张价签。按 Artificial Analysis 的成本统计,MiMo-V2.6-Pro 的加权平均每任务成本是 0.13 美元;GPT-5.6 Sol(max)是 1.99 美元;Claude Opus 5.5 中档推理档位每任务 1.34 美元、指数得分 51。同一套任务跑一万次:小米约 1300 美元,Claude 约 13400 美元,OpenAI 约 19900 美元。已经有媒体给这个现象起了名字:新一代大模型「斩杀线」——性能与价格的组合,低于这条线,用户没有理由选你。
本文要论证的是:AI 竞争的前沿,正在从「卖智能」转向「卖无成本问题」;而最有资格打这场仗的,不是 AI 实验室,是从一开始就不靠 AI 订阅赚钱的硬件公司。
能力差一点,价格差十五倍
先看差距到底有多小。DeepSWE v1.1(多步骤软件工程)上,MiMo-V2.6-Pro 拿 71.9 分,GPT-5.6 Sol 是 73 分,Claude Opus 5 是 74 分。Toolathlon-Verified(跨工具协作)上小米反超:76.9 分对 GPT-5.6 Sol 的 74.9。OSWorld-Verified(图形界面操作电脑)上,小米 82 分,对 83 与 83.4。这些成绩出自小米自己公布的评测,但综合排名有第三方机构独立确认,权重也开放在 Hugging Face 上,任何人可复现。
一两分的差距是噪音,十五倍的成本差是决策。对一切不执着于榜单分数的工作负载——批量代码审查、文档处理、跨千次会话的工具编排——选择标准早已不是「谁最聪明」,而是「谁能以最低边际成本过我的质量线」。一旦更便宜的模型过了线,溢价模型就在为一个不断缩小的剩余市场而战。这就是斩杀线的含义:它不打败你,它把你从大部分市场里价格挤出。
上一任斩杀线持有者是 DeepSeek,再往前是 Qwen、Kimi——清一色 AI 原生公司。小米是另一种动物,而理解它凭什么能做这件事,得看模型是怎么炼出来的。
六天、347 万美元、一场公开的炼丹
小米 2023 年 4 月组建大模型核心团队,2025 年 4 月发布首个开源模型,十八个月后登顶开源榜首。跃迁的引擎是强化学习,执行方式罕见地自律,也罕见地透明:小米把整轮训练公开直播,看板实时展示步数、token 与花费,Hugging Face CEO Clément Delangue 公开点赞。
披露的训练配置读起来像一份宣言:一次更新处理 1568 个任务提示,每个提示生成 16 条执行轨迹,覆盖写代码、调用工具、视觉、网络安全。Agent 强化学习最难的从来不是算力,是奖励设计——两条轨迹都「成功」,一条三步搞定、一条绕十五步,二元的成功/失败奖励教不会模型效率。小米的评判系统按任务要求生成评价标准,把候选轨迹放在一起比较、按质量分级给奖励,再用对抗评估与跨验证器交叉检查防 reward hacking——防止模型学会糊弄评分系统而不是干活。
效果可以量化:不到六天的强化学习里,Flash 和 Pro 各完成 30 步更新、处理约 75 万条任务轨迹,训练任务通过率分别提升 25% 和 12%;在未用于训练的 DeepSWE v1.1 上,Flash 从 48.8 提到 65.68,Pro 从 58.4 提到 72.57。这六天的账单:Flash 约 85 万美元、Pro 约 262 万美元,合计 347 万美元——平均每小时约 5.8 万美元,即约 20 万元人民币。这个数字,比很多 AI 创业公司一个月的工资单还少。技术报告、训练环境、强化学习代码一并开放,方法本身成了公开可查证的东西。
还有一个细节值得单独划出来:API 定价没有涨。能力涨二十分,价格原地不动。真正构成战略动作的,是这个组合,而不是其中任何一半。
为什么硬件公司打法不同
把两边的激励摆在一起看。前沿实验室的商业模式就是 API 收入,每一分智能都是涨价的理由,定价必须高于边际成本。小米的商业模式是卖手机、汽车、家电——MiMo 不需要按 token 赚钱,它让一台 HyperOS 手机更值得买、让玄戒芯片的端侧推理有了用武之地,就已经完成了任务。实验室问的是「这个怎么收费」,小米问的是「这个怎么多卖一台冰箱」。
这种不对称解释了价格为什么按住不动:小米可以把智能当作硬件业务的成本中心,而实验室若跟进补贴,等于亲手拆自己的收入线。DeepSeek 已经暗示过这套逻辑,小米把它走完了——因为它有万亿级硬件生态可以摊销成本。别忘了 Muse 近期在 iOS 的爆红刚刚验证:用户会真金白银奖励「能替我办事」的 Agent,而 MiMo 的最强项恰好是工具调用与电脑操作,不是闲聊。
当然有反方论点:跑分可以做高、成绩出自小米自己、硬件公司的企业实验室历来有「惊艳 Demo 然后悄然放弃」的前科。都成立。但这次有三点不同:综合排名出自独立第三方;训练全程直播、成本实时可审计;权重、代码、环境全部可下载——这是一个可以被证伪的主张,不是发布会 Demo。
往后怎么推演
如果论点成立,有三件事会跟着发生。第一,竞争的轴心从智能指数转向每任务成本与降价节奏——头部实验室会以激进分层定价和「mini」版本应战,在斩杀线的规则里打,而不是在其之上。第二,开源榜首会变成资金充裕的非实验室玩家之间的 rotating 旗帜——因为大规模强化学习、严格的奖励设计、耐心的资本,更匹配它们的资产负债表,而不是 API 收入型创业公司。第三,设备原生的 Agent 成为真正的分发之战:模型成为手机、汽车、家庭的内置功能——这是实验室完全进不去的市场。
还有一条对行业中层的坏消息:既非最聪明、又非最便宜的模型,将无处可站。被上下挤压的那一档——能力尚可但价格偏高——收入会最先死掉。
落到行动
- 如果你是选型的工程/产品负责人:把评测框架建在「自己质量线下的每任务成本」上,而不是榜单分数。每季度重测——斩杀线移动得很快,小米这一代就挪了二十分。
- 如果你经营实验室或 API 业务:定价页现在是竞争武器或负债,不再是脚注。想清楚是哪一个。若成本结构到不了 0.13 美元每任务的量级,就在可靠性、合规、集成上差异化,或守住最后两分智能真正值钱的场景。
- 如果你是投资人:给「模型创业公司」这个品类重新定价。只有 API 收入引擎、没有结构性成本优势的公司,正被头顶的前沿实验室和脚下的硬件补贴型开源夹在中间。耐久的位置在应用层、数据资产和分发。
- 如果你在开源模型上做 Agent:Toolathlon 76.9、OSWorld 82 这些分数说明开源栈已经能扛真实的 Agent 工作负载,不只是聊天。做迁移原型,在自己的任务上量差距,保留回退方案。
小米不只是登上了榜首。它公布了一个价格——在这个价格上,榜单本身不再是重点。下一阶段的 AI 竞争,争的不再是谁最聪明,而是谁养得起把智能送出去——而这场仗,硬件公司已经准备了十几年。
