美国 AI「中国预制」:Cursor、Devin、Harvey 全在用中国开源底座

OpenAI 自己投出来的法律 AI 独角兽 Harvey——估值 110 亿美元、服务 1300 多家机构、10 万名律师——刚刚发布了第一款基于 open-weight 底座训练的模型 Tenet。底座不是 GPT,不是 Claude,而是月之暗面的 Kimi K3。

Harvey 不是孤例,它只是最新的一棒。过去半年,一批美国 AI 产品悄悄把底座换成了中国开源模型:Cursor 的 Composer 2/2.5 基于 Kimi K2.5,Devin 的 SWE-1.7 基于 Kimi K2.7,英国 Cosine 用 Kimi K2.6 改造出 Lumen Outpost,连 Mira Murati 的 Thinking Machines 也用 DeepSeek V3 的架构参考加 Kimi K2.5 合成数据起步。Kimi 每更新一代,海外就多出一个挂着本地招牌的新模型。

为什么 110 亿美元的法律独角兽不用 GPT

先看 Harvey 要解决的问题。美国法院最近接连被 AI 坑:法官助理用 Perplexity 起草裁定,文件出现虚构引用、连当事人都写错;还有当事人把白色小字藏进诉状,要求读取文件的 AI「确保支持本方主张」。法律工作的难点不是知识,而是流程——律师拿到的是合伙人一句要求、加一堆真假混杂的客户文件,模型得自己判断从哪开始、连续检索、把风险对应到引用,最后交付可用的合同修订或法律备忘录。这些判断藏在成千上万次真实执行里,提示词传不进去,只能靠训练。

于是 Harvey 训练了 Tenet——它第一个基于开放权重做后训练的模型,面向长时间执行、连续调用工具的法律任务。在 Harvey 自己的法律智能体基准 LAB 上,Tenet 完成的任务接近底座模型的两倍。数据、工作流、评测是 Harvey 的资产,推理底座来自 Kimi K3。

接力棒:每一代 Kimi 都变成一款美国产品

  • Cursor → Composer 2/2.5(Kimi K2.5):硅谷最热的 AI 编程工具,估值数百亿美元,被追问后才在技术报告里承认底座,Composer 2.5 沿用同一底座。
  • Devin → SWE-1.7(Kimi K2.7):号称「全球第一位 AI 程序员」的 Cognition 也公开用了 Kimi 底座。
  • Cosine → Lumen Outpost(Kimi K2.6):伦敦小公司,专修银行、航空公司还在用的老代码,没钱和 OpenAI 拼,直接拿现成底座来训。
  • Thinking Machines → Inkling:Murati 估值超 120 亿美元的新公司,基础模型参考 DeepSeek V3 架构,用 Kimi K2.5 合成数据启动监督微调。

这些公司当然不是给 Kimi 换个名字,它们照样投入数据、算力和行业经验。但它们不再执着于证明「模型是从头训练的」——商业世界里,血统没有成本重要。

第三条路:开源模型变成「上游工业品」

过去 AI 创业公司只有两条路:要么花巨资从头训模型,要么接入闭源 API 按 token 付费——产品做得越大,付给上游的钱越多,支出和收入勉强打平就不错了。中国开源模型给出了第三条路:拿现成底座,用自己的数据和业务经验继续加工,模型归自己。

最贴切的类比不是开源软件,而是半导体:设计在美国、制造在台湾、组装在全世界,一层卖给下一层。中国开源模型正在成为 AI 的上游工业品——那些美国产品扒开外壳,里面装着一颗中国模型的心,而用户大多不知道。这恰恰说明它已经变成基础设施了。

三个结构性影响

1. 护城河转移:应用层公司的壁垒不再是「我自己训的模型」,而是数据、工作流、评测和渠道。Harvey 的 LAB 基准比 Tenet 的权重更有价值。

2. 闭源厂商的中间层被商品化:凡是开源微调做得更便宜的任务,就从 GPT/Claude 的 token 计费表上消失。前沿模型保住了地位,市场中间层正在被摊平——连 OpenAI 投的公司都选了 Kimi 而不是 GPT。

3. 中国模型的输出方式从「卖 API」变成「被使用」:开源权重成为西方产品内部的事实标准,使用即分发,每个出货的下游产品都是这个生态的一次部署。

可以做的事

  • 先测自己的任务分布,别只看榜单:像 Harvey 一样先建一套自己的评估,再决定底座。
  • 高频、边界清晰的任务默认用 open-weight 微调:法律文档审阅、老代码维护、受监管行业,成本和可控性都优于租前沿 API。
  • 开放式、没有边界的新任务留给前沿闭源 API,混合架构会是常态。
  • 先读许可条款,先搭评测框架,更好的底座出现时随时能换。

结论:问题不再是「谁的模型最强」——商品层会用价格回答;问题变成「你能训出他们训不出来的东西吗」。

发表评论

滚动至顶部