Token降本的尽头是电力:AI成本竞争的结构真相

所有人都盯着模型API降价,以为AI降本全靠模型厂商打价格战。

DeepSeek V4比Claude Opus 4.7便宜二十倍,GPT-5.5也在不断调价,Token单价的确在断崖式下跌——三年降了99.7%。但企业AI总账单呢?

Uber仅2026年前四个月就烧光了全年Token预算;Salesforce一年付给Anthropic约3亿美元;贝恩调查全球951家大型企业发现,AI累计支出突破1万亿美元后,成本节约普遍远低于预期。44%的企业在做一件被贝恩定性为"存在结构性漏洞的循环赌注"的事——用上一轮AI尚未兑现的费用节省来论证下一轮投资的合理性。

单价降了99.7%,账单涨了3倍。这不是矛盾,是信号。

信号很清晰:Token降本的真实战场,从来不在模型API的标价页。

一、降本的前线不在API页面

中国云厂商优刻得的CEO季昕华最近在接受InfoQ采访时,给出了一个直白的判断:Token的终局是电力。电便宜,Token就便宜。

听起来简单,但这句话的背后是一条完整链路——每一块钱Token的背后,都有从电力、土地、机柜、制冷、网络、存储、GPU调度到企业内部使用方式的长链条。

优刻得在内蒙古乌兰察布建数据中心,不是因为那里是AI创业高地。因为电便宜,气候冷(PUE好做),靠近北京(时延可控),而且能实现100%绿电。一台装载8张GPU卡的顶级服务器功耗约6.5千瓦,一个千卡集群一年仅服务器本身的耗电量就相当惊人。如果再乘上PUE系数,才是数据中心真正要承担的总用电。

数据中心选址从来不是技术决策,是能源决策。

而AI的到来,把这个逻辑推到了极致。传统IDC行业讨论"有多少个柜子",AI时代讨论的是一台高功率机柜能不能做到35千瓦、能不能上液冷、电路和散热系统能否支撑持续满负荷运转。低功率数据中心开始空置,高功率数据中心"还没有开始建就已经有订单进来"。

但这些还只是第一层。

二、Token的五层成本模型

把整个AI成本链条打开,能看到五个清晰的战场。这五个战场不是理论推演,而是每一家正在把AI放进生产流程的企业,都在面对的真实账单。

第一层:电力成本

这是最底层,也是最容易被忽略的一层。企业习惯讨论"每百万Token多少钱",但真正决定长期成本的,是"每度电最终能转化成多少有效Token"。GPU利用率、推理框架优化、模型部署方式、网络通信效率、存储读写速度——所有技术指标最终都指向一个数字:一度电的Token产出率。

第二层:算力效率

GPU不是插上电就能产出Token的。推理框架的选型、模型部署的参数量、是否做量化、是否做蒸馏——这些都直接决定一张GPU能跑出多少有效Token。这里说的"有效",指的是真正产生业务价值的Token,不是浪费在重复计算、无效推理和调试中的Token。

第三层:模型选择

不是所有任务都需要调用最贵、最强的模型。一个85分的模型在某些任务上确实更好,但一个80分模型如果也能完成任务、且成本低得多,就更现实。国内模型相对海外旗舰有巨大的价格优势——DeepSeek V4-Pro仅相当于Claude Opus 4.7的十分之一——这已经推动美国企业"用脚投票"。

第四层:模型组合

企业不能总想着用一个模型解决所有问题。一个复杂任务里,真正需要顶级模型处理的部分可能只有20%,其他部分可以交给更便宜、更快的模型完成。前端代码用一种模型,后端用另一种,测试、需求分析、写作各自匹配。未来更合理的方式,是把任务拆开、由平台自动帮用户做智能路由——在"效果"和"成本"之间动态优化。

第五层:Token治理

这是最容易被忽视、但恰恰是当前企业最大的成本漏洞所在。很多企业一边喊AI成本高,一边没有建立内部使用规则——谁在调用、调用了哪个模型、调用了多少次、同一个请求是否被反复重复、简单问题是否用上了高价模型。SaaS时代按账号付费,员工越活跃越值。AI时代以调用次数计费,用得越多账单越厚。没有治理体系,AI越推越亏。

这五层从上到下,每一层都是"如何在效果和成本之间做最优选择"。企业往往只盯着第三层(模型降价),却忽略了其他四层加起来的总优化空间远大于模型降价本身。

三、为什么这个框架现在特别重要

2026年中期,一个关键变化正在发生:AI从"尝鲜期"进入"算账期"

Ramp的2026年6月软件趋势榜上,DeepSeek首次登顶美国企业增速榜首。首席经济学家Ara Kharazian说这或许是最明确的信号——美国企业正在寻找OpenAI和Anthropic的低成本替代品。更值得注意的是,这些企业不是下载开源权重自己部署,而是直接向DeepSeek付费、数据直连托管服务器。

"从拿开源权重自己跑,到付钱直连托管",这才是这张榜单真正的新意。

但便宜也可能是一段麻烦的开始。当Agent渗透率爬到8%,它消耗的Token就追平了聊天机器人,往后还有5倍以上的空间。单价降到四分之一,调用量翻十倍,账单只会更厚。DeepSeek的低价把更多公司请进了门,也把它们更深地推进了这场停不下来的消耗。

这就是五层成本模型需要被认真对待的原因。

四、框架的跨场景验证

这个模型不只是中国企业的问题。全球范围内,AI基础设施的瓶颈始终在移动。

季昕华描述了这一过程:最开始觉得GPU不够,于是先提升GPU;GPU提升后,发现内存成为瓶颈;内存做大后,卡与卡之间的网络连接又出问题;网络解决后,CPU调度跟不上;再往后,不同机器之间、不同机房之间的连接成为新挑战。

整个系统的工作,就是不断找到瓶颈点、突破瓶颈点、然后迎接下一个瓶颈点。

这种"瓶颈迁移"的模式,同样适用于Token的五层成本。当所有企业都在抢模型降价(第三层),最先行动的玩家已经在做模型组合优化(第四层);当大家都在做组合,真正拉开差距的其实是Token治理(第五层);而当治理做好,底层电力成本(第一层)和算力效率(第二层)又变成了新的天花板。

这不是一个静态的优化清单,而是一个动态的竞争阶梯。

优刻得提到一个细节:国内现在有些低功率数据中心空闲率高,但高功率数据中心还没有开始建就有订单进来。这背后是新旧基础设施的切换——数据中心的能力,正在从"有没有楼"转向"能不能承载AI"。

国产算力面临的也是类似的瓶颈。不是单卡参数不够强,而是没有形成模型、框架、工具链和应用端的生态闭环。降本从来不是单一环节的事。

五、落到行动

所以,如果你正在管理一支AI投入账单,五层模型给了你一个按优先级行动的清单:

  • 如果你还在用最贵的模型处理所有任务→ 先卡第三层(模型选择)。把常规任务切到便宜的模型,只有需要深度推理时才用旗舰。这是门槛最低、见效最快的降本动作。
  • 如果你的模型组合已经做了,但账单仍在涨→ 检查第四层和第五层。你的不同模型之间有没有做智能路由?员工调用有没有规范?同一个请求被重复计算了多少次?
  • 如果你正在规划AI基础设施建设→ 第一层和第二层才是你真正应该关注的地平线。数据中心选址、电力配套、GPU利用率优化——这些决策一旦落定,会在未来三到五年内持续影响Token成本。
  • 如果你已经感受到"AI越用越贵"的困局→ 这不是模型厂商的问题。这恰恰说明你需要从"模型降价思维"切换到"Token治理思维"。每一笔AI支出都要能追溯回具体的业务产出。

终局思考:Token降本不会止于模型降价。它最终是一场从"一度电到一组Token"的转化效率竞赛。谁能在每一层都做出最优选择——合适的模型配合适任务、智能的路由、可衡量的产出——谁就能在这场持续五到十年的结构成本优化中拿到真正的竞争力。

降本不是压价。降本是一个系统工程。


来源备注:

  • InfoQ采访优刻得CEO季昕华,《Agent狂吞Token,表面是模型之争,底层全是煤电博弈》
  • Ramp 2026年6月软件趋势报告
  • 贝恩咨询全球企业AI支出调查
  • NavyaAI Cost Report 2026: Token Prices & Rising AI Bills
滚动至顶部