不是最强,但可能是最有用的开源模型
7月16日,Thinking Machines Lab(TML)发布了首款基础模型 Inkling。9750 亿参数、混合专家 MoE 架构、Apache 2.0 开源——这些数字放在今天的市场里,横竖不算新闻。
真正的新闻,是他们在官方博客里说的第一句话:"Inkling 不是当今最强的模型,开源闭源都不是。"
一家由 OpenAI 前 CTO Mira Murati 和前应用研究 VP 翁荔创立的公司,花了 20 亿美元种子轮、训练了 45 万亿 token,出来第一句话是主动认输?
当然不是。
他们在说:开源模型的竞争维度,正在经历一次不可逆的切换。
过去两年,开源模型的叙事一直被同一个问题驱动——"能不能追上 GPT/Claude?"从 Llama 到 DeepSeek 到 GLM,每一代发布都在试图拉近与闭源旗舰的差距。这是典型的「高性能竞赛」叙事:谁在榜单上离闭源天花板最近,谁就是赢家。
Inkling 的出现,把这个问题从根本上换掉了。
一、Inkling 做了三件 "怪事"
TML 团队来自 OpenAI 核心层,不缺技术实力,也不缺资本。他们完全有条件按「最强开源模型」的剧本打。但他们没有。翻一遍 Inkling 的发布材料,会发现三个反常的设计决策:
1. 公开宣称不是最强
我翻了一下近年所有主流开源模型的发布通告——没有一家会主动说"我们不是最强的"。这是第一个。
这背后不是谦逊,而是对目标市场的清醒定义。TML 过去一年已经通过 Tinker 微调平台在 ToB 一线摸爬滚打,他们比任何人都清楚一件事:企业客户选模型,看的根本就不是排行榜前十名的差距。
2. 刻意训练模型"有时少想"
Inkling 在后训练阶段大规模异步强化学习,rollout 超过 3000 万次。但目标不是让模型变得更聪明,而是让它学会"看碟下菜"。
TML 在强化学习过程中引入了一个精巧机制:通过修改系统消息和设置不同的每 Token 成本,让模型学会判断——什么问题值得深究,什么任务可以收手,增加一段推理能不能带来足够的性能收益。
结果是什么?在 Terminal Bench 2.1 上,Inkling 达到英伟达 Nemotron 3 Ultra 同等性能时,平均生成 Token 只有对方的三分之一。
用技术翻译一下:这不是在教模型怎么想得更深,而是在教它怎么"想得更值"。
3. 让模型自己微调自己
TML 做了一个极度大胆的演示:让 Inkling 通过 Tinker 平台自己写微调任务、自己跑训练流程、自己评估结果。模型成为塑造自身的"基础设施"。
这个演示看似炫技,实则点出了 TML 整个商业模式的底层逻辑——可塑性本身就是产品。模型的最终能力边界不取决于预训练时的上限,而取决于企业能否用自己的数据持续改造它。
二、"可用性三轴"——一个新的评估框架
把 Inkling 的三个反常决策放在一起看,一条清晰的逻辑线浮出水面:在模型的绝对能力到达某个阈值之后,企业判断一个模型好不好的标准会彻底改变。
我把这个新标准叫做"可用性三轴":
第一轴:Token 经济性。
模型每花一个 Token 能换回多少任务成功率。这不是一个静态指标——它是推理强度的函数。一个只会全力思考的模型,和一个能在简单任务上主动压缩推理、在复杂任务上加码的模型,对企业来说是两个完全不同的产品。
第二轴:可定制闭环的完整性。
模型权重开放 + 微调平台支持 + 数据渲染工具链 + 部署框架适配——这四个环节缺一不可。只开放权重但不提供工具链的模型,就像给了你一台引擎但不给说明书。TML 这次同步推出的 tml-renderer 渲染器,正是为了堵住这条链上最容易被忽视的漏洞:多模态数据的采样和微调格式转换。
第三轴:原生多模态的深度。
文本、图像、音频从预训练阶段就进入同一模型联合学习,而不是后期"外挂"视觉或音频编码器。后者的思路是"先有语言模型,再补感官";前者的思路是"交互本身就是多模态的,模型默认就该如此"。Inkling 将原生多模态定位为协作模型架构中的"后台推理引擎",与前端实时交互模型异步协作——这是一个比"支持图片输入"更深的设计选择。
三、把三轴框架搬到其他模型上
"可用性三轴"不只是解释 Inkling 的工具。把它套到其他开源模型上,过去一年很多"奇怪"的市场现象突然有了解释。
DeepSeek V3 为什么在全球开发者中间获得口碑?
不是因为它比 GPT-4o 强,而是因为它把推理成本拉低了一个数量级。它赢在第一轴。
GLM 5.2 为什么在国内企业市场快速渗透?
不只是模型本身能力,而是智谱提供了从微调平台到部署方案的一整条工具链。它赢在第二轴。
为什么金融、医疗等行业对开源模型的态度从"能不能用"变成了"该选哪个"?
因为这些行业的真实需求从来不是榜单上的一个百分点差距,而是:模型能不能在我的数据上微调?推理成本我扛不扛得住?我需要的声音、图像、文本混合输入模型能不能处理?
这三句话问出来,排名前五的开源模型里,真正能全票通过的,没几个。Inkling 刚好是其中之一。这不是巧合——TML 在 Tinker 平台服务企业的过程中,把这些需求建模成了模型的设计目标。
四、这意味着什么
Inkling 的发布宣告了一个旧时代的结束和一个新时代的开始。
旧时代:开源模型的竞争 = 性能竞赛。谁能接近闭源天花板,谁就代表"开源"在进步。这个叙事在过去两年驱动了无数篇"XX 模型追上 GPT"的报道,但它也在让开源模型的市场定位变得越来越窄——开源的唯一价值就是"性能接近闭源的免费替代品"。
新时代:开源模型的竞争 = 可用性竞赛。当模型能力到达阈值后,真正的壁垒不在能力上限,而在:你花多少成本才能把能力用好。Token经济性、可定制深度、多模态完整性——这三个维度加起来,定义了一个模型"在企业手里能变成什么",而不是"在榜单上能排第几"。
这是一个根本性的框架切换。它解释了为什么 TML 敢在发布当天就说"我们不是最强"——因为"最强"从来不是他们参与的那场比赛。
五、落到行动
如果你是技术选型决策者:
下次评估一个开源模型时,别只看它的 HLE 或 SWE-bench 分数。问三个问题:它完成任务需要的 Token 量是多少?它的微调工具链有多完整?它的多模态是"原生的"还是"贴上去的"?这三问答不上来,分数再高也帮不了你的生产环境。
如果你是模型开发者:
Inkling 的强化学习"看碟下菜"是一个值得深入研究的机制。在成本敏感的商业场景里,一个能主动节流的模型比一个只会全力输出的模型实用得多。这个方向目前很少有人工程化落地——有机会。
如果你是投资者:
"可用性三轴"可以成为评估下一代模型公司的新框架。一家新模型公司如果只在"最强"维度上竞争,它会活得很累。但如果它在三轴上都有差异化布局,它比任何榜单上的第一名都更有商业价值。
来源:
Thinking Machines Lab 官方博客 — Introducing Inkling
36氪 — 不打榜的美国开源新王 Inkling
