所有人都盯着模型API降价,以为AI降本全靠模型厂商打价格战。
DeepSeek V4比Claude Opus 4.7便宜二十倍,GPT-5.5也在不断调价,Token单价的确在断崖式下跌——三年降了99.7%。但企业AI总账单呢?
Uber仅2026年前四个月就烧光了全年Token预算;Salesforce一年付给Anthropic约3亿美元;贝恩调查全球951家大型企业发现,AI累计支出突破1万亿美元后,成本节约普遍远低于预期。44%的企业在做一件被贝恩定性为"存在结构性漏洞的循环赌注"的事——用上一轮AI尚未兑现的费用节省来论证下一轮投资的合理性。
单价降了99.7%,账单涨了3倍。这不是矛盾,是信号。
信号很清晰:Token降本的真实战场,从来不在模型API的标价页。
一、降本的前线不在API页面
中国云厂商优刻得的CEO季昕华最近在接受InfoQ采访时,给出了一个直白的判断:Token的终局是电力。电便宜,Token就便宜。
听起来简单,但这句话的背后是一条完整链路——每一块钱Token的背后,都有从电力、土地、机柜、制冷、网络、存储、GPU调度到企业内部使用方式的长链条。
优刻得在内蒙古乌兰察布建数据中心,不是因为那里是AI创业高地。因为电便宜,气候冷(PUE好做),靠近北京(时延可控),而且能实现100%绿电。一台装载8张GPU卡的顶级服务器功耗约6.5千瓦,一个千卡集群一年仅服务器本身的耗电量就相当惊人。如果再乘上PUE系数,才是数据中心真正要承担的总用电。
数据中心选址从来不是技术决策,是能源决策。
而AI的到来,把这个逻辑推到了极致。传统IDC行业讨论"有多少个柜子",AI时代讨论的是一台高功率机柜能不能做到35千瓦、能不能上液冷、电路和散热系统能否支撑持续满负荷运转。低功率数据中心开始空置,高功率数据中心"还没有开始建就已经有订单进来"。
但这些还只是第一层。
二、Token的五层成本模型
把整个AI成本链条打开,能看到五个清晰的战场。这五个战场不是理论推演,而是每一家正在把AI放进生产流程的企业,都在面对的真实账单。
第一层:电力成本
这是最底层,也是最容易被忽略的一层。企业习惯讨论"每百万Token多少钱",但真正决定长期成本的,是"每度电最终能转化成多少有效Token"。GPU利用率、推理框架优化、模型部署方式、网络通信效率、存储读写速度——所有技术指标最终都指向一个数字:一度电的Token产出率。
第二层:算力效率
GPU不是插上电就能产出Token的。推理框架的选型、模型部署的参数量、是否做量化、是否做蒸馏——这些都直接决定一张GPU能跑出多少有效Token。这里说的"有效",指的是真正产生业务价值的Token,不是浪费在重复计算、无效推理和调试中的Token。
第三层:模型选择
不是所有任务都需要调用最贵、最强的模型。一个85分的模型在某些任务上确实更好,但一个80分模型如果也能完成任务、且成本低得多,就更现实。国内模型相对海外旗舰有巨大的价格优势——DeepSeek V4-Pro仅相当于Claude Opus 4.7的十分之一——这已经推动美国企业"用脚投票"。
第四层:模型组合
企业不能总想着用一个模型解决所有问题。一个复杂任务里,真正需要顶级模型处理的部分可能只有20%,其他部分可以交给更便宜、更快的模型完成。前端代码用一种模型,后端用另一种,测试、需求分析、写作各自匹配。未来更合理的方式,是把任务拆开、由平台自动帮用户做智能路由——在"效果"和"成本"之间动态优化。
第五层:Token治理
这是最容易被忽视、但恰恰是当前企业最大的成本漏洞所在。很多企业一边喊AI成本高,一边没有建立内部使用规则——谁在调用、调用了哪个模型、调用了多少次、同一个请求是否被反复重复、简单问题是否用上了高价模型。SaaS时代按账号付费,员工越活跃越值。AI时代以调用次数计费,用得越多账单越厚。没有治理体系,AI越推越亏。
这五层从上到下,每一层都是"如何在效果和成本之间做最优选择"。企业往往只盯着第三层(模型降价),却忽略了其他四层加起来的总优化空间远大于模型降价本身。
三、为什么这个框架现在特别重要
2026年中期,一个关键变化正在发生:AI从"尝鲜期"进入"算账期"。
Ramp的2026年6月软件趋势榜上,DeepSeek首次登顶美国企业增速榜首。首席经济学家Ara Kharazian说这或许是最明确的信号——美国企业正在寻找OpenAI和Anthropic的低成本替代品。更值得注意的是,这些企业不是下载开源权重自己部署,而是直接向DeepSeek付费、数据直连托管服务器。
"从拿开源权重自己跑,到付钱直连托管",这才是这张榜单真正的新意。
但便宜也可能是一段麻烦的开始。当Agent渗透率爬到8%,它消耗的Token就追平了聊天机器人,往后还有5倍以上的空间。单价降到四分之一,调用量翻十倍,账单只会更厚。DeepSeek的低价把更多公司请进了门,也把它们更深地推进了这场停不下来的消耗。
这就是五层成本模型需要被认真对待的原因。
四、框架的跨场景验证
这个模型不只是中国企业的问题。全球范围内,AI基础设施的瓶颈始终在移动。
季昕华描述了这一过程:最开始觉得GPU不够,于是先提升GPU;GPU提升后,发现内存成为瓶颈;内存做大后,卡与卡之间的网络连接又出问题;网络解决后,CPU调度跟不上;再往后,不同机器之间、不同机房之间的连接成为新挑战。
整个系统的工作,就是不断找到瓶颈点、突破瓶颈点、然后迎接下一个瓶颈点。
这种"瓶颈迁移"的模式,同样适用于Token的五层成本。当所有企业都在抢模型降价(第三层),最先行动的玩家已经在做模型组合优化(第四层);当大家都在做组合,真正拉开差距的其实是Token治理(第五层);而当治理做好,底层电力成本(第一层)和算力效率(第二层)又变成了新的天花板。
这不是一个静态的优化清单,而是一个动态的竞争阶梯。
优刻得提到一个细节:国内现在有些低功率数据中心空闲率高,但高功率数据中心还没有开始建就有订单进来。这背后是新旧基础设施的切换——数据中心的能力,正在从"有没有楼"转向"能不能承载AI"。
国产算力面临的也是类似的瓶颈。不是单卡参数不够强,而是没有形成模型、框架、工具链和应用端的生态闭环。降本从来不是单一环节的事。
五、落到行动
所以,如果你正在管理一支AI投入账单,五层模型给了你一个按优先级行动的清单:
- 如果你还在用最贵的模型处理所有任务→ 先卡第三层(模型选择)。把常规任务切到便宜的模型,只有需要深度推理时才用旗舰。这是门槛最低、见效最快的降本动作。
- 如果你的模型组合已经做了,但账单仍在涨→ 检查第四层和第五层。你的不同模型之间有没有做智能路由?员工调用有没有规范?同一个请求被重复计算了多少次?
- 如果你正在规划AI基础设施建设→ 第一层和第二层才是你真正应该关注的地平线。数据中心选址、电力配套、GPU利用率优化——这些决策一旦落定,会在未来三到五年内持续影响Token成本。
- 如果你已经感受到"AI越用越贵"的困局→ 这不是模型厂商的问题。这恰恰说明你需要从"模型降价思维"切换到"Token治理思维"。每一笔AI支出都要能追溯回具体的业务产出。
终局思考:Token降本不会止于模型降价。它最终是一场从"一度电到一组Token"的转化效率竞赛。谁能在每一层都做出最优选择——合适的模型配合适任务、智能的路由、可衡量的产出——谁就能在这场持续五到十年的结构成本优化中拿到真正的竞争力。
降本不是压价。降本是一个系统工程。
来源备注:
- InfoQ采访优刻得CEO季昕华,《Agent狂吞Token,表面是模型之争,底层全是煤电博弈》
- Ramp 2026年6月软件趋势报告
- 贝恩咨询全球企业AI支出调查
- NavyaAI Cost Report 2026: Token Prices & Rising AI Bills
