大多数人第一次认真思考 AI 的成本,是从一个账单开始的:这个月 API 花了多少 Token。但几乎没有人停下来问一句——Token 到底计量了什么?
答案藏在经济史里。经济学家识别一场产业革命,有一个朴素的方法:看计量单位。农业社会的蒲式耳,让买家可以在芝加哥买到从未见过的堪萨斯小麦,期货市场由此而生;1866 年标准化的石油桶,让原油从地方性矿物变成可对冲、可做空的全球资产;1889 年提出的千瓦时,让电力的生产和消费第一次有了计价尺度;1948 年香农定义的比特,让带宽和存储成为可以明码标价的商品。
这四个单位有一个共同点:它们计量的都是可以还原为物理过程的对象——物质、容积、能量、信息的编码长度。一个比特存了什么内容、有没有用,不在比特概念的范畴里。
Token 打破了这个规律。它计量的不是物质或能量,而是机器完成一次智力任务的产出量。理解一句话、生成一段代码、做出一个判断,这些过去只存在于人脑中的活动,第一次拥有了可计量的单位和可执行的价格。
这才是 Token 的真正含义。它不只是计费单位,它是智力即服务(intelligence as a service)时代的蒲式耳——而这个新计量单位,正在拆掉传统经济学最稳固的一块地基。
一、第一个无法事前估值的计量单位
Token 有一切前辈单位都没有的特性:它的价值完全由使用场景事后决定。
一蒲式耳小麦的品质在收割时就已确定,一桶原油的品级出井即可测量。Token 恰恰相反。用同一个模型审阅一份价值百万美元的并购合同,与用它闲聊天气,消耗的 Token 数量可能相当,创造的经济价值却差出几个数量级——而且这个差异只能在调用完成之后才知道,事前无法标注、无法分级。
更麻烦的是,Token 在不同用途之间切换的边际成本接近零。同一个模型、同一个 API,换一条指令就从闲聊切换到合同审查。生产端可以被统一计量,消费端交付的却是高度非标准的智力成果,两者彻底脱钩。
传统经济学的供需分析有一个默认前提:生产端特征与消费端价值是耦合的。这个假设在 Token 时代不再成立。你为「一千万个 Token」付了钱,但你买到的可能是律师级别的工作成果,也可能只值半小时的周报工时。
于是那些被 MBA 课程反复验证的工具开始失灵。法务部门这个月消耗五千万 Token 审合同,下个月可能涨三倍;工程团队部署几个 Agent 之后,消耗量一周暴涨十倍,而没有任何采购模型能事先预测哪个部门、什么时候、产生多大需求。CFO 要一个「企业 Token ROI」,却发现根本不存在统一的口径。
二、单价暴跌、总量暴涨:杰文斯时钟
直觉会说,价格暴跌的东西成不了大事。Token 的数据给出相反答案。
以 GPT-4 级别能力为基准,2023 年 3 月的推理定价约为每百万输出 Token 60 美元;到 2025 年,同等能力的市场价格已降到 1 美元上下——第三方追踪(如 Epoch AI 的推理价格数据集)显示,达到同等基准的价格中位数每年下降约两个数量级。但同期,全球 AI 基础设施总支出不降反升:IDC 统计 2025 年全年 AI 基础设施支出约 3,180 亿美元,比 2024 年的约 1,530 亿美元翻了一倍多。
需求端更夸张。OpenAI 在 2025 年 10 月的 DevDay 上公布 API 每分钟处理约 60 亿 Token;到 2026 年 3 月,这个数字达到每分钟 150 亿——五个月增长 1.5 倍,而这还不包括 ChatGPT 消费端的消耗。中国市场更猛:国家数据局披露,中国日均 Token 调用量从 2024 年初的约 1,000 亿,涨到 2025 年底的 100 万亿,2026 年 3 月突破 140 万亿,两年增长超过 1,000 倍。推理已占据全部 AI 算力的大约三分之二,而 2023 年这个比例还是三分之一。
这就是杰文斯悖论的 2.0 版:19 世纪蒸汽机效率提高,煤炭总消耗反而暴涨;今天模型单价每年跌去九成以上,Token 总消耗以更快速度膨胀。原因在结构上很清楚——算法效率可以在硬件不变的情况下独立提升,而晶圆厂从动工到投产需要三到四年。两套速率完全不同的时钟在同时运转,价格坍缩的速度永远快于供给扩张的速度。
还有一个更隐蔽的变量:Token 的调用决策正在从人类手动提问,转向由 Agent 在既定目标下持续触发。当 Agent 开始决定调用什么模型、消耗多少 Token,需求对价格和延迟的反应方式,就和我们熟悉的任何消费品市场都不一样了。豆包手机、支付宝和微信都在试图打通的智能体互操作,本质上是给这个自动消耗机器接入更多管道。
三、Token 市场三层结构:一个分析框架
把上述碎片拼起来,可以得到一个可复用的三层框架。
第一层:计量层(统一)。所有智力服务的产出都被压缩成同一个单位——Token。这一层高度标准化,竞争发生在价格和延迟上。这是模型厂商的战场:每百万 Token 的定价、每秒的吞吐量、上下文窗口的大小。
第二层:价值层(异质)。同样的 Token 进入不同任务,产出的经济价值差出几个数量级,且事前不可见。这一层没有市场出清价,只有事后的 ROI 复盘。这是应用层公司的战场:谁能把 Token 引导到高价值任务上,谁就能在同样的成本下创造十倍价值。
第三层:触发层(自动化)。谁来决定消耗?正在从人切换到 Agent。这一层决定了需求的形态——碎片化、波动剧烈、指数膨胀。这是平台层的战场:操作系统和超级应用争夺的,就是 Agent 的调用入口。
这个框架的解释力在于:它说明了为什么模型价格战打不死任何人(计量层的利润薄,但价值层和触发层的利润在别处结算),为什么企业 AI 采购如此别扭(采购制度是为计量层设计的,价值却产生在第二层),以及为什么所有平台都抢着做 Agent(触发层是需求的放大器,谁握住触发权,谁就握住 Token 总量)。
四、推演:从黄仁勋的账本到你的部门预算
2026 年 3 月 GTC 大会后,英伟达 CEO 黄仁勋在访谈中给出一个刻意的数字:一个年薪 50 万美元的工程师,如果一年消耗不到 25 万美元的 Token,他会非常担心。他还补了一句:顶尖工程师说「我打算只用纸和笔工作」,就跟芯片设计师拒绝用 EDA 工具一样荒谬。这不是玩笑——英伟达甚至开始把价值近一半工资的 Token 额度作为吸引顶尖人才的激励。
这话的正确打开方式,不是记住 25 万美元这个会很快过时的数字,而是看懂它背后的衡量标准:Token 消耗量正在成为衡量知识工作者生产力的新维度,就像上一代人用带宽和云服务规格衡量一家公司的数字化程度。
用三层框架推演一下:
对模型厂商,计量层是红海。价格向边际成本坍缩不可逆,差异化只能往价值层和触发层走——所以 OpenAI、Anthropic 都在做企业版和 Agent 产品,本质是向上两层要利润。
对应用公司,价值层是全部身家。TypeSafe 在 2026 年 9 月发布的分类模型 Jev 是个极端样本:它不写一个字、不解释、不聊天,只做勾选判断,单次成本不到 0.001 美元。把模型收窄到单一高价值任务,就是在计量层成本固定的前提下,把价值层的信噪比推到极限。
对平台,触发层是终局之战。硬件侧的反应同样说明问题:AI Box 类产品(苹果、英伟达、AMD 全部入场)把上百 GB 统一内存塞进桌面小盒,本质是让企业把 Token 消耗从云端的计量层搬回本地——数据不出门,但每一度电、每一个 Token 依然要被计量。
五、落到行动
如果你是企业管理者:
- 停止问「我们该买哪家的模型」,先问「我们的高价值任务清单在哪」。计量层的供应商会一直换,价值层的任务定义才是资产。
- 把 Token 预算当研发预算管理,不当 IT 采购管理。它的需求天然碎片化、波动剧烈,年度计划注定失准,季度滚动加部门配额更现实。
- 跟踪两个数字:每部门 Token 消耗增速、单任务价值复盘。前者告诉你 Agent 渗透到哪里,后者告诉你钱花在了计量层的哪一段价值区。
如果你是开发者或个人从业者:
- 用 Token 消耗量校准自己的学习路径——如果你处理的任务完全无法消耗大量高价值 Token(即高度重复、低判断密度),这个岗位最先被计量化。
- 学会把任务拆解成「计量层可外包、价值层自己掌控」的结构:把生成、翻译、初稿交给 Token,把判断、品味、责任留给自己。
每一次经济秩序的改写,都伴随一个新的计量单位。这一次,被计量的第一次是智力本身。
看清 Token 不是在为算力付费,而是在为「机器的一次智力加工」定价——谁能在这个单位之上建立自己的价值层,谁就能在智力即服务的经济里拿到入场券。
免责声明:本文仅供信息参考,不构成任何投资建议。
