法律 AI 独角兽 Harvey 今年的毛利率曲线,画出了一个大多数 AI 创业公司不愿面对的形状:年初约 50%,6 月跌到负 50%,8 月又拉回正值。让毛利率坐过山车的不是需求——恰恰相反,是需求爆炸。Harvey 的 Token 用量今年涨了二十倍,而每一个 Token,都在给 OpenAI 和 Anthropic 交税。
流行的解释是「开源模型追上来了」。这个解释不对。真正的变化是:按用量计费的时代,应用层公司的每一次成功,都在自动放大付给模型供应商的成本。开源权重模型不再是技术选型问题,而是议价筹码问题。
一、毛利悬崖不是意外,是结构
先看 Harvey 这条曲线怎么来的。这家估值 156 亿美元的公司,长期把 OpenAI 等闭源模型当作产品核心。今年 3 月其 AI 智能体重大更新后,用户使用量急剧攀升——产品大获成功。然后,毛利率从 1 月的约 50% 一路跌到 6 月的负 50%。成本随用量线性上涨,而 Harvey 自己的定价做不到同步调整,于是越成功越亏损。
更关键的是,脚下的定价地基同时在塌。2026 年 4 月,Anthropic 重构企业套餐:席位费不再捆绑任何用量,每个 Token 按标准 API 费率另行计费,叠加在每席位约 20 美元的月费之上。GitHub 旗下 Copilot 从 6 月 1 日起从包月订阅改为按用量计费,有开发者测算自己的月成本从约 67 欧元涨到 966 欧元。Uber 鼓励工程师放开用 Claude Code,结果 4 月就烧完了全年 AI 预算。
再叠上第二重压力:供应商开始亲自下场,跟客户抢饭碗。OpenAI 和 Anthropic 今年都在法律、金融、医疗这些应用层创业公司的核心赛道大量招人、推插件、试点行业应用。还有第三重压力最黑暗:供应商集中度太高,你的访问权可以被直接切断。SpaceX 完成收购 Cursor 不到一周,OpenAI 就宣布暂停向这家编程工具提供模型访问,理由是马斯克旗下公司过去违反服务条款。从两家实验室租智能,不叫冗余备份,叫风险敞口。
三重压力叠加,应用层公司从「合作伙伴」变成了「被计价的租户」。Harvey 只是第一个把账算穿帮的。
二、转向开源,四个赛道同时发生
这次转向不是成本敏感型公司的个别行为,而是横跨法律、医疗、客服、金融四个赛道同时爆发。Harvey 在 8 月 20 日发布首个自研法律模型 Harvey Tenet,底层是在中国月之暗面的开源权重模型 Kimi K3 上做后训练。官方称其在复杂法律工作中达到最先进水平;知情人士透露,其性能接近 Anthropic 最好的模型,成本只有一小部分。发布之后,加上其他用 AI 策略的调整,毛利率重新转正。
医疗领域的 Abridge 宣布基于英伟达开源模型自建临床基础模型。客服赛道,Decagon 目前约 80% 的客户查询流经自有模型——更值得注意的是其联合创始人兼 CEO Jesse Zhang 在 7 月写的:约 90% 的工作负载跑在开源模型上,而主要驱动力不是成本,是延迟。金融科技领域,Ramp 和 Rogo 首次探索自训模型。Ramp 联席 CEO Karim Atiyeh 说得很直白:一年前训自有模型在经济上完全不合理,但今年 6 月完成 7.5 亿美元融资、开源权重性能大幅跃升之后,这笔账反过来算得通了。
资本也加入了推手行列。红杉资本和 General Catalyst 都在助推这波转向。旧金山风投 Basis Set 的创始人 Lan Xuezhao 把新门槛说成了一句话:「如果不去优化成本、精调自有模型,你在定义上就是低效的。如果一家公司不考虑自建模型,可能根本拿不到融资。」
三、毛利挤压三角
为什么是现在断?为什么是这些公司断?给这个机制起个名字:毛利挤压三角。三个因子相乘,缺一个都压不垮你。
第一个因子:用量强度——每单位客户价值消耗多少 Token。Agent 产品是极端案例,Harvey 的 Token 用量几个月涨二十倍,因为智能体会循环、验证、重试。聊天机器人烧一次 Token,Agent 要烧到任务做完为止。
第二个因子:计价结构错配——供应商向你要钱的单位,和客户向你付钱的单位,是不是同一种。按用量计费的企业定价,把每一次效率失败直接传导进你的损益表。如果你按席位向客户收费、按 Token 向供应商付费,增长本身就是毛利漏水口。
第三个因子:供应商集中度——你能从几个地方买到这个能力,以及对方把你当伙伴还是当未来对手。两家实验室垄断前沿,意味着零议价筹码;Cursor 事件证明核选项真实存在。
开源权重打击的是第三个因子,并透过它瓦解第二个。当 Kimi K3、英伟达开源模型把接近前沿的能力摆上货架,双寡头就变成了竞争市场。注意,Harvey 并没有抛弃闭源模型——它处理最复杂任务据说仍然依赖 Anthropic 的 Claude Opus,Anthropic 自己的演示材料也印证了这一点。重点在于:手里有真实存在的替代选项,谈判地位就完全不同了。毛利恢复不是因为开源模型有魔法,而是因为外部选项变真了。
四、代价与反例:这不是免费的午餐
诚实地看账本的另一面。人才是第一道墙:Menlo Ventures 合伙人 Matt Kraning 指出,能做模型精调的工程师薪酬可达数百万美元,还随时会被实验室自己挖走。数据是第二道门槛:Harvey 无法接触客户的敏感法律文件,只能向 AI 数据服务商 Mercor 购买训练数据。基础设施是第三道:视觉 AI 创业公司 Elorian 的 CEO Andrew Dai 指出,下载开源权重并自行管理计算基础设施的开支相当可观,流量低的早期公司按用量付闭源模型反而更省。
还有人走了一半回头了。创业公司 Salespeak 曾宣布自建大语言模型,几个月后放弃,联席 CEO Omer Gotlieb 表示相比现成模型看不到显著优势。另外「开源」标签里藏着细则陷阱:Kimi K3 的许可证对总收入超过 2000 万美元的商业模型服务商有限制条款,已有服务商反映月之暗面要求在保密协议下单独签商业许可。开放权重不等于开源,这个区别上标着价格。
所以现实的终局是一个杠铃结构:开源精调模型扛起 80%-90% 高频、延迟敏感的工作负载,前沿闭源模型处理最难的尾部任务。Decagon 的 90/10 分配和 Harvey 继续用 Opus,就是杠铃在实践中的样子。
五、现在该做什么
如果你在做 AI 应用,现在就用三角模型给自己的产品做体检,别等到合同续约时:
- 按每个 Agent 任务算毛利,而不是按席位。如果单任务 Token 成本增速超过单任务定价增速,你正走在 Harvey 一月份的轨迹上。
- 对齐计价单位。客户按席位或按结果付费的,去谈承诺用量价格,或者把计量型负载迁到开源权重上——别等供应商重构你的合同。
- 在需要之前建好外部选项。一个能承接 50% 流量的精调开源模型,就能把你从被锁死的买家变成谈判者。Decagon 和 Harvey 都是在经济账变明显之前一年就开始动手的。
- 读许可证。权重可获取不等于商业可使用,先查收入门槛和 MaaS 限制条款。
- 前沿留给尾部。最难的 10% 任务仍是闭源模型的主场,混合路由策略优于纯粹主义。
如果你是投资人,Basis Set 那句话就是新的尽调问题:不是「你用的哪个模型」,而是「用量涨十倍时你的毛利率会怎样」。如果你在实验室工作,信号更直接——每一次企业定价重构,都是开源权重最好的招聘广告。
更深一层看,这是一次再平衡,不是决裂。电费被收得狠的时候,工厂自建发电机;模型层会继续占据前沿,但它再也无法独占整个技术栈。在实验室和客户之间,一个有利润的中间层正在重新长出来——它建在开源权重之上。
