Token 不是计费单位,是智力经济的新蒲式耳

打开任何一家模型厂商的定价页,你都会看到同一个词:每百万 Token 多少美元。大多数人把它当成一条计费规则,一个成本项,财务报表里待压缩的一行。这个理解太窄了。

本文的论点只有一个:Token 是人类历史上第一个可以按量购买、精确计量的「智力产出」单位。这不是定价技术问题,而是一个经济结构问题——因为所有围绕它的直觉,都建立在为石油、电力、带宽设计的旧框架上,而这些框架在 Token 面前会系统性地失灵。

一、每个经济时代都有自己的计量单位

经济学里有一个朴素的观察方法:判断一场产业革命是否真正发生,看它有没有催生新的计量单位。

农业时代有蒲式耳。在标准化之前,小麦只能按麻袋估价,一袋麦子的「量」取决于袋子多大、卖家多诚实。蒲式耳出现后,芝加哥的买家可以买下他从未见过的堪萨斯小麦——远程期货交易从此成为可能。铁路降低了运输成本,但真正让粮食变成可全球交易的标准商品的,是蒲式耳。

能源时代有桶。42 加仑的标准油桶在 1866 年被确定下来,石油从此可以从宾夕法尼亚的地方矿产,变成纽约和伦敦市场上可以对冲、做空、期货化的全球资产。

电气化时代有千瓦时。1889 年英国工程师提出这个概念,1948 年国际电工委员会(IEC)正式认可。电力在发电厂与千家万户之间流动,但只有当它有了标准计量,电网调度、电力交易市场、工业能耗管理才成为可能。

信息时代有比特。香农 1948 年的《通信的数学理论》让信息从哲学概念变成可测量对象——线路容量、硬盘空间、网络带宽,从此都有价签。

这四个单位有一个共同点:它们计量的对象最终都可以还原为物理过程。蒲式耳计量物质,桶计量容积,千瓦时计量能量,比特计量信号的编码长度。至于一比特里存的内容有没有用,不在比特的范畴之内。

Token 打破了这个规律。它计量的不是物质、能量或信息量,而是机器完成一次智力任务的产出量——理解一句话、生成一段代码、做出一个判断。这些过去只能由人脑完成、被绑定在工时和岗位上的活动,第一次有了可计量的单位和可执行的价格。

这就是「智力即服务」的物质基础。过去买智力,买的是人、是工时、是岗位;现在买智力,买的是 Token、是任务、是结果。智力第一次脱离具体的人脑,被连续调用、计量和计费。

二、Token 的两个反常结构

如果只是多了个计量单位,事情还简单。真正麻烦的是,Token 在两个关键维度上偏离了传统商品的所有前提。

第一个反常:同质计量,异质价值。

一蒲式耳小麦的品质在收割时就已确定,一桶原油的品级出井即可测量。Token 恰恰相反:它的价值完全由使用场景决定,而且事前无法标注。同一个模型审一份价值百万美元的并购合同,和用它闲聊天气,消耗的 Token 数量可能相当,创造的经济价值却差出几个数量级——而这个差异只有在任务完成后才知道。

更麻烦的是切换的边际成本接近零。同一家 API,换一条指令就能从闲聊切到合同审查。于是形成一个前所未有的市场结构:生产端被统一计量,消费端交付的却是高度非标准的智力成果,两者彻底脱钩。传统供需分析默认「生产端特征与消费端价值耦合」,这个前提在 Token 时代不再成立。

第二个反常:两套时钟。

以 GPT-4 级别能力为基准,2023 年初的推理定价约每百万输出 Token 60 美元,到 2025 年同等能力的市场价格已不足 1 美元——两年跌去近两个数量级。但同期全球 AI 基础设施总支出不减反增:IDC 数据显示 2025 年达 3180 亿美元,是 2024 年 1530 亿美元的两倍有余。

单价暴跌、总支出暴涨,这是教科书级的杰文斯悖论:19 世纪蒸汽机效率提升,煤炭总消耗不降反升。效率提升扩大了使用场景,使用场景扩大吞噬了全部效率红利。而且这一次节奏更快——算法效率可以在既有硬件上独立提升,晶圆厂从动工到投产却需要三到四年。软件的时钟以月计,硬件的时钟以年计,两套速率完全不同的时钟在同一市场同时运转。

三、一个已经在运转的经济体

Token 经济不是概念,是进行时。三组数字可以看出它的规模和斜率:

OpenAI 在 2026 年 3 月披露,其 API 处理速率已达每分钟 150 亿 Token——这还只是 API 端口,不含 ChatGPT 消费端的消耗。而 2025 年 10 月开发者日公布的数字还是每分钟 60 亿。五个月增长 1.5 倍。

中国市场更陡。国家数据局 2026 年 3 月披露,中国日均 Token 调用量从 2024 年初的约 1000 亿,涨到 2025 年底的 100 万亿,2026 年 3 月已突破 140 万亿——两年增长超过一千倍。

算力结构同步迁移:全球推理已占 AI 算力的约三分之二,而 2023 年这个比例只有三分之一。训练一次、推理亿万次的商业模式,正在成为算力开支的主体。

英伟达 GTC 大会后的一次访谈里,黄仁勋说:「一个年薪 50 万美元的工程师,如果一年消耗不到 25 万美元的 Token,我会非常担心。」他还补了一句:顶尖工程师坚持只用纸笔工作,跟芯片设计师拒绝使用 EDA 工具一样荒谬。具体金额会随价格下行很快过时,但这句话折射出的新标准不会:Token 消耗量正在成为衡量知识工作者生产力真舍得投入多少的新维度,就像上一代人用带宽和云规格衡量一家公司的数字化程度。

四、为什么旧的采购和分析框架会失灵

把这些结构性变化放到一个具体场景里,失灵立刻可见。假设你是一家科技公司的战略负责人,CEO 要求你从零搭建企业 AI 采购体系,你会发现 MBA 教的那一套几乎条条碰壁。

供给侧,全球数十家模型提供商的成本结构完全不同:头部公司背后是上千亿美元累计投入,开源社区用几百万美元微调就能在某些任务上逼近前沿。需求侧,法务部门这个月消耗 5000 万 Token 审合同,下个月可能涨三倍;工程团队部署几个智能体后,消耗一周暴涨十倍——你无法预测哪个部门、什么时候、产生多大用量。传统采购赖以生存的「稳定年度需求计划」在这里不存在。

定价分析同样失效:充分竞争、产品同质、自由进出这些前提一个都不满足,你甚至无法确定下个季度同样的预算能买到什么水平的能力。最痛苦的是价值评估——同样 1000 万 Token,律师用来审合同可能规避了上百万美元的法律风险,市场部用来写周报只省了半小时。CFO 却要你给出一个统一的「企业 Token ROI」。

还有一个正在到来的变量:调用决策正在从人的手动提问,转向 Agent 在既定目标下持续触发。当 Agent 自己决定调用什么模型、消耗多少 Token,需求对价格、延迟和失败率的反应方式,将和任何我们熟悉的消费品市场都不同。单位价格下降让 Agent 加速进入工作流,Agent 持续执行放大需求,需求爆发暴露物理供给瓶颈,瓶颈又反过来改写价格和应用门槛——这个循环已经启动。

五、如果你在其中,该怎么做

框架的用处在于指导决策。按角色拆开:

  • 如果你是 CFO 或采购负责人:放弃寻找单一的「Token ROI」。正确的做法是按任务价值分桶——高杠杆任务(合同审查、代码生成、客户分析)与低杠杆任务(草稿、摘要)分开核算,前者的消耗是投入,后者的消耗才是成本。同时把需求波动本身写进预算模型,别指望年度计划。
  • 如果你是技术管理者:把 Token 消耗当成生产力的仪表盘而不是成本红线。一个团队消耗骤降,往往不是省钱,而是 AI 使用在退潮;骤涨也不一定是失控,可能是工作流真正跑通了。先看消耗发生在什么任务上,再判断健康与否。
  • 如果你是开发者或创业者:Token 价格的两个数量级下跌意味着,今天算不过账的应用,一年后可能算得过。设计产品时把「单价还会降」当作默认假设,把护城河建在数据、工作流和场景理解上,而不是建在当下的推理成本差上。
  • 如果你是知识工作者:黄仁勋那句话可以倒过来读。Token 消耗量会逐渐成为衡量你杠杆率的指标——不是你敲了多少字,而是你调动了多少机器智力。学会把任务翻译成高质量的上下文和指令,是这个时代新的基本功。

蒲式耳让小麦可以被远程交易,桶让石油成为金融资产,千瓦时让电网得以运转,比特让信息有了价格。Token 正在做同一件事,只是对象换成了智力本身。理解这个单位,不是理解一条计费规则,而是理解一场正在发生的经济秩序重写。

滚动至顶部