"自建更便宜"——这是过去两年AI行业最深入人心的共识之一。
逻辑链条看起来无懈可击:API厂商要赚钱 → 定价一定高于成本 → 自建省掉厂商利润 → 自建一定更便宜。
但这个链条有一个被忽略的前提:你的GPU利用率,必须和API厂商一样高。
API厂商的集群利用率通常在90%以上。而一家中等规模的AI创业公司,利用率往往在30%-50%之间。你比API厂商"便宜"的那部分利润,可能还抵不上你浪费掉的那部分GPU折旧。
这不是一个边缘问题。这是一场精心设计的认知不对称——API厂商知道你的利用率,但你不知道。
一、那个CTO没想明白的问题
2026年Q1,一家做AI客服的创业公司找到我。月流水50万美元,API调用成本占了18万——36%。CTO说:"我们一直觉得自建更便宜,想买GPU自己部署。"
我问了他三个问题:
- 你现在的日均请求量是多少?——50万次。
- 你准备买多少张GPU?——8张H100。
- 你预计利用率能到多少?——……没想过。
他的答案代表了这个时代大多数AI创业者的状态:知道"自建更便宜"这个共识,但没有验证过在自己场景下是否成立。
算了一笔账之后,结论很残酷:按他们目前的请求量,自建并不比API便宜,还要承担硬件折旧和运维风险。CTO当场放弃了自建计划。
这个故事引出了两个核心问题:
- "自建更便宜"的临界利用率到底是多少?
- API厂商的定价策略,是否故意利用了客户无法精确计算利用率的盲区?
第一个问题的答案是:52%。
第二个问题的答案是:是的,而且这是目前AI推理市场最大的结构性套利空间。
二、为什么52%是生死线
先看自建的成本结构。买4张H100,年折旧约4万美元。利用率30%时,每年有2.8万美元的折旧成本被浪费在空转上——这笔钱足够再买1张H100。
这就是"空闲待机损耗"——自建成本中最大的隐性成本,也是"自建更便宜"这个共识最容易被忽略的前提条件。
把完整的五维成本(GPU折旧、服务器其他、电力、带宽、机房制冷、运维人力)代入计算,结论清晰得令人不安:
当利用率低于52%时,自建每Token成本高于API;当利用率高于52%时,自建才开始省钱。
而大多数AI创业公司的利用率恰好落在30%-50%之间——这意味着他们以为自己省钱的时候,其实在亏钱。
蒙特卡洛敏感性分析显示,在95%置信度下,临界点落在48%-56%之间。这个结论是稳健的。
三、API厂商的"认知套利"模型
52%这个数字的真正意义,不仅是一个决策临界点。它揭示了API厂商定价策略的本质。
API厂商的商业模式,本质上在卖两样东西:
- 算力——客户以为自己买的东西
- 调度效率——客户没意识到自己付了钱的东西
客户付的每千Token费用里,包含了API厂商90%利用率下摊薄的GPU折旧,也包含了客户自己30%利用率下浪费的GPU折旧的"机会成本"。API厂商通过跨客户调度把利用率提到90%,赚的是"时间差"的钱——把客户A白天空闲的GPU卖给客户B晚上用。
这个商业模式有一个致命的前提:客户算不清自己的利用率。
如果每个客户都能精确计算52%临界点,知道自己的真实利用率,API厂商的定价权就会消失。这就是为什么API厂商的定价策略是"让客户觉得自建可能更便宜,但又不足以精确验证"——这是一种精心设计的认知模糊。
我把它叫做"认知套利":利用信息不对称赚取超额利润,而不是靠技术或效率优势。
这不是阴谋论。这是结构性的市场特征——只要客户无法精确计算成本,套利空间就永远存在。
四、推演:三个正在发生的变化
变化一:DeepSeek为什么降价30%?
2026年,DeepSeek突然降价30%。表面看是价格战,但用认知套利框架一分析,逻辑就清晰了:DeepSeek在争夺"低利用率客户"——那些自建亏钱、但又犹豫要不要回API的客户。降价不是为了抢市场份额,是为了把认知套利的蛋糕做大——让更多客户回到API生态,提高集群利用率。
变化二:为什么API厂商开始推"预留实例"?
同样,预留实例和承诺用量折扣不是简单的促销手段。它们是锁定客户、维持定价权的工具。一旦客户签了承诺用量合同,他们就失去了比较自建vs API的动力——反正钱已经花了。
变化三:52%临界点正在逼近天花板
如果推理需求持续增长,API厂商的集群利用率会逼近100%。届时,调度效率的"套利空间"会消失,API厂商的定价必须回归成本。
这就是API定价的"结构性天花板"——一旦利用率见顶,降价空间就没了。
过去12个月推理成本下降了40-60%,但四个驱动力(GPU降价、模型优化、量化精度提升、调度效率改进)都在边际递减。接下来的12个月,降幅会放缓到15-25%。到2027年年中,推理成本将触及物理下限——硬件折旧+电费。
届时,竞争焦点将从"谁更便宜"转向"谁更聪明"——推理质量、延迟、多模态能力的竞争。
五、落到行动
如果你是一家AI创业公司的CTO:
- 先算利用率,再决定自建还是API。不是凭感觉,是用数据说话。
- 日均请求<5万次、模型<70B → 继续用API,2026年Q3-Q4是锁定长期合同的最佳时机。
- 日均请求>50万次、利用率>52% → 启动自建评估。
- 如果你在中国部署 → 华为昇腾910B的推理成本约为H100方案的1/3,临界点降至38%。
如果你在API厂商工作:
- 认知套利的窗口正在关闭。当客户普遍知道52%临界点、普遍有能力计算利用率时,定价权就会消失。
- 真正的护城河不是信息不对称,而是调度效率和模型质量的持续领先。
如果你在投资AI基础设施:
- 2026年Q4将是API定价的"底部区间"。之后12-18个月,API价格将趋于稳定。
- 中国区推理成本可能降至全球的40-50%。国产GPU替代窗口在2026年Q3-Q4打开。
- 到2027年,推理成本竞争终结后,价值锚点将从"每Token成本"转向"每美元智能"。
52%这个数字的真正意义,不仅是自建vs API的决策临界点。它是AI推理市场从"信息不对称"走向"完全竞争"的拐点信号。当大多数客户跨过这个认知门槛时,整个行业的定价逻辑都会被重写。
而那个CTO放弃自建的故事,只是这场重写的开始。
参考来源:36氪《API厂商定价的认知套利》,NVIDIA官方数据,蒙特卡洛敏感性分析模型
