你在对话框里敲下一句话,几十毫秒后答案弹出。过程轻得没有重量,账单却很重:输入多少百万 Token、输出多少百万 Token、上下文多长、缓存是否命中。一个看不见摸不着的回答,为什么要按量收费?
三张账单,一个答案
答案是:这里至少混着三张不同的账单——混在一起看,就会出现「电费不贵,AI 为什么这么贵」「模型降价了,企业账单反而变大」这类经典困惑。
- 生产成本:造出一个 Token 到底烧了多少电、芯片和机房。
- 市场价格:厂商对外报出的调用单价,含竞争与分层。
- 任务成本:完成一件工作总共烧掉多少 Token。
AI 有软件的一面:算法可迭代、服务可分发。但它还有越来越显眼的重工业一面:每次生成都要经过真实计算,依赖真实电力、显存和机房。「Token 看上去像软件,骨子里越来越像重工业。」
黄仁勋的「五层蛋糕」
2026 年 1 月达沃斯,英伟达 CEO 黄仁勋第一次把 AI 基础设施描述成一块「五层蛋糕」,自下而上:能源、芯片、基础设施、模型、应用——此后他在 CES 2026、GTC 2026 反复用这个框架。大规模商用推理口径下,钱分别花在哪:
- 能源层(约占 10%~20%)。重要但不是最大头。按美国工业电价 $0.06~0.08/kWh 算,一座 500 兆瓦数据中心年电费超 3 亿美元;但把 GPU、HBM、网络和机房的折旧都计入后,能源只占完全成本的 10%~20%。「电费神话」是把运营成本误当成了总拥有成本。
- 芯片层(约占 40%~55%,成本主体与供给咽喉)。一块 B200 单价 3 万~4 万美元,HBM 与先进封装合计约占高端芯片物料成本的三分之二。关键技术事实:模型参数必须驻留 HBM 才能高效推理,HBM 容量和带宽直接决定推理速度与并发上限。而 HBM 是寡头市场——SK 海力士约 57%、三星 22%、美光 21%——超大规模云厂商资本开支里内存占比从 2023–2024 年约 8% 飙到 2026 年约 30%,几乎全由 HBM 驱动。
- 基础设施层(约占 15%~20%)。把成千上万张芯片组织成一座协同运转的「AI 工厂」:供配电、液冷、机柜、光模块、InfiniBand 网络、调度运维。弹性很大——同一批芯片,利用率 60% 和 80% 的企业,摊到每个 Token 的成本完全不同。
- 模型层(约占 10%~15%,降得最快的一层)。训练本身烧钱惊人——GPT-4 纯计算口径约 4000 万美元,奥尔特曼公开口径「超 1 亿美元」,GPT-5 级已进入数亿到十亿美元级,还没算试错系数。但架构魔法可以不换硬件就让成本下一个台阶:DeepSeek V4 总参数 1.6 万亿,每次推理只激活约 490 亿(约 3%)——相当于一家 16000 人的咨询公司,每个项目只派出 500 人精锐小组。蒸馏则让小模型以约大模型 1% 的推理成本复现其能力。
- 应用层(约占 5%~10%)。界面、集成、合规、内容安全——把能力变成用户愿意购买的服务。
比例会随自建还是租用、前沿还是经济档、训练还是推理而变,但排序稳定:硬件相关的三层通常构成成本主体,大致占七成上下甚至更高。
两个误会与「双时钟」
误会一:Token 就是转售电力。一次对话的边际电耗可能只有几厘钱,但那只是完全成本里极小的一块——同一度电喂给不同芯片、放在不同利用率的机房,造出的 Token 数量天差地别。
误会二:看单 Token 成本就够了。同样的 Token 背后成本并不相同:前沿旗舰与经济档可相差数十倍;长上下文更吃显存;批处理能把集群利用率从 60% 提到 70%~80%。2026 年谷歌把同一模型分成优先、标准、灵活、批处理四档定价,批处理档直接半价,DeepSeek 的周末低谷定价也是同一逻辑——分时计价正在成为标配,这正是对「同 Token 不同成本」这个事实的定价回应。
两个误会底下,是这本书的核心判断——「双时钟」:
- 快时钟(算法)。过去 3 年同等能力推理成本下降约 99.5%(斯坦福《2026 年 AI 指数报告》估算是降至原来的 1/250)。MoE、注意力优化、蒸馏、推测性解码以天和周迭代,不需要换任何硬件。
- 慢时钟(物理)。数据中心扩建要 18~36 个月且大量延期:2026 年美国计划上线约 16 吉瓦、140 个项目,截至 4 月只有约 5 吉瓦在施工;变压器平均交付周期 128 周(疫情前 6~8 个月),却只占建设成本不到 10%——一个 20 亿美元的园区,可能因一份 4000 万美元的变压器订单空置一年以上。HBM 三家寡头产能年增速只有 30%~50%,追不上需求的翻倍。电力:IEA 预计全球数据中心耗电 2024–2029 年翻倍,从约 415 太瓦时到超 900 太瓦时;高盛预测 2028 年美国有 45 吉瓦缺口;美国电网互联排队规模达 2060 吉瓦,中位等待接近 5 年,谷歌部分选址要等 12 年。
OpenAI 的 Stargate 是最典型的注脚:高调宣布 5000 亿美元,却因电网接入排队、变压器延迟而施工暂停。《金融时报》一针见血:「5000 亿美元买不来物理世界的加速,也买不来社区的同意」——这正是数据中心「失去的夏天」的由来:550 道限制令面前,「同意」成了算力最稀缺的资源。就像钢价能解释钢材、解释不了车价:快时钟解释价格为什么崩,慢时钟解释稀缺为什么一直存在。
为什么值得看懂
双时钟解开了两个看似矛盾的事实:AI 价格战打到骨折,算力紧张却始终没有缓解;全球科技巨头突然都在以基础设施公司的方式重塑资产负债表。看懂它,就看懂了 AI 真正进入的不只是聊天框,而是一套新的工业秩序——当智力服务成为可计量、可调用、可定价的商品,竞争就不再只是「谁代码写得更好」,而是谁能更高效地把能源、芯片、模型和人类需求组织起来。
可操作建议
- 分开三张账单。谈判和预算时先确认你看的是生产成本、报价还是全任务成本——混着看一定做错决策。
- 买慢车道。能等的任务走批处理/灵活档(谷歌 2026 年批处理档半价),急活才用优先档。
- 盯利用率,别只盯单价。同样的芯片,80% 利用率比 60% 的单位成本可能接近腰斩,把突发任务调度进空档。
- 给 12~18 个月滞后留预算。英伟达每代硬件让单 Token 成本降 40%~60%,但架构发布到大规模交付要一年以上——特定时间、特定地点可用的便宜算力,依然稀缺。
- 盯 HBM,别只盯 GPU。内存是新的瓶颈变量,云资本开支中占比两年翻了三倍——内存疯涨已把 AI 服务器价格推高 15% 以上,定价权正从 GPU 厂商转到内存厂。真正的「排队」是显存配额,不是算力。
最终结论不是一个死价格——Token 没有标准答案:市场价格会变、模型会换代、成本结构因任务而变。但有一件事是确定的:每一枚 Token 都需要真实的能源、芯片和基础设施去生产。这才是认识 AI 经济的起点。
常见问题
为什么 AI 一直在降价,我的账单却越来越贵?
因为你在看不同的账单:厂商降的是「市场价格」,你的账单由「任务成本」决定——用量增长、上下文变长、升级到旗舰档,都会抬高总 Token 消耗;而芯片、机房这类物理层成本按 2~5 年周期才降一次,稀缺一直存在。
「五层蛋糕」里最该盯哪一层?
芯片层(约 40%-55%)是成本主体,其中 HBM 是供给咽喉:SK 海力士约 57%、三星 22%、美光 21% 三家寡头,产能年增 30%~50% 追不上需求翻倍;云资本开支中内存占比已从 2023-2024 年约 8% 升到 2026 年约 30%。
想把 AI 成本压下来,现在能做什么?
能等的任务走批处理/灵活档(谷歌 2026 年批处理档半价);盯集群利用率——80% 比 60% 的单位成本可能接近腰斩;并给 12~18 个月硬件滞后留预算,便宜算力在特定时间地点依然稀缺。