DeepSeek 为什么敢涨价:AI 定价的计量单位,正从 Token 变成「任务」

同一个星期,两条方向完全相反的价格信号同时出现:Anthropic 悄悄取消了 Claude Sonnet 5 原定 50% 的涨价,OpenAI 把 GPT-5.6 Luna 的价格砍掉 80%;而 DeepSeek 向 API 用户预告"整体涨价、涨幅较大"。全球最重要的两个 AI 定价动作,在同一时刻背道而驰。

分叉本身才是新闻,而不是那几个百分比。真正在发生的结构变化是:AI 的计量单位正在从"每百万 Token 单价"切换成"每成功任务成本"(cost per successful task),这一变化正在重写谁能给智能定多高的价。

一边降价,一边涨价

美国这边,头部厂商在主动压低价格。7 月 30 日 OpenAI 把 Luna 砍了 80%(Sol 的 30 美元输出价保住),同时反复重置 Codex 和 ChatGPT 付费额度——API 和订阅两端都在变相降价。8 月 10 日 Anthropic 取消 Sonnet 5 原定 9 月生效的 50% 涨价,2 美元/10 美元成为长期价格。

中国这边,最强的一批模型在涨价。DeepSeek(V4-Flash 输入 0.14 美元、输出 0.28 美元,仍是全球前沿模型最低价区间)预告整体涨价;月之暗面 7 月 16 日把 Kimi K3 定在普通输入 20 元、输出 100 元的高价格带。连续两年向下的价格曲线,罕见地出现分叉。

美国为何降价:抢的不是利润率,是工作负载

OpenAI 和 Anthropic 争夺的是同一件事:Agent 工作负载。Claude Code 和 Codex 打的是同一批开发者和企业客户,每多跑一个真实任务,就多暴露一批 Agent 失败、重试、调用工具的模式——这些反馈会回流到评测、产品和推理策略迭代里。竞争链条很直白:降低使用门槛 → 更多真实任务运行 → 暴露更多失败模式 → 改进 Agent → 再争取更多工作负载。对承担主力 Agent 工作的模型来说,价格直接决定调用频率,所以 Anthropic 宁可放弃 50% 的涨价。

来自下方的挤压:开放权重模型正在吃掉中段

但美国降价只有放到第二个力量里才成立:中国开放权重模型正在迅速接管一切不需要前沿智能的活。OpenRouter 上开放模型处理的 Token 占比从 1 月的 34% 涨到 6 月的 65%,平台最受欢迎的四个模型全部来自中国。

斯坦福数字经济实验室 4 月的《Enterprise AI Playbook》给出了一个让模型公司警觉的数据:51 个成功部署的企业 AI 项目中,42% 认为底层模型完全可以替换;常规、规则明确的任务里这个比例高达 71%,只有需要复杂推理、专业知识或高风险决策的高级任务才降到 18%。

这就是真正的结构性挤压。企业开始把规划和复杂推理交给 Claude 或 GPT,把分类、抽取、简单代码修改、格式转换分给 DeepSeek、Qwen、GLM。一个过去 100% Token 都流向单一旗舰模型的任务,现在被 Router 拆开分配。中国开放权重模型压缩了美国旗舰模型收取高溢价的任务范围——这也解释了为什么 OpenAI 保住 Sol 的价格、却把 Luna 砍掉 80%。

计量单位变了:每成功任务成本

Agent 让旧的计量方式彻底失效。聊天时代一个问题对应一两次调用;一个 Coding Agent 会读文件、制定计划、调终端、改代码、跑测试、看报错、再循环——一次指令背后可能是几十甚至上百次调用。真实的成本公式变成:

任务成本 = Token 价格 × Token 数量 × Agent 步骤 × 重试次数

开发者社区维护的 DRadar 实测把后果摆在了明面上:高推理档位能拿到更好的任务表现,但边际成本往往以数倍甚至数十倍的速度上升;DeepSeek V4 Flash 这类低价模型绝对能力略低,却能以低得多的成本完成相当一部分真实软件工程任务。企业真正该盯的指标变成"每成功任务成本"——一个 0.5 美元但需要试 40 次的模型,可能比 5 美元但 8 步完成的模型更贵。斯坦福的研究也印证了这一点:高自主度"Escalation"模式下(AI 自主完成 80% 以上任务、人类只管异常),中位生产率提升达 71%,而人工审批模式只有约 30%。

DeepSeek 为什么敢涨:它测试的不是价格,是定价权

DeepSeek 现在还没有定价权,但它拥有测试定价权的资格。它的基本盘是靠"便宜得惊人"建立起来的,所以涨两三倍本身就是一场实验:如果调用基本留存,说明全球采用从来不只是因为便宜;如果大量任务迅速迁移到 Qwen、Kimi、GLM,说明低价在采用中的作用比想象中更大。月之暗面则是另一条路线——开放权重负责分发,高价 API 负责收割高价值的长程 Coding 和知识工作。

斯坦福调研里那个"multi-LLM gateway"负责人的话最有代表性:每一个请求都在成本、准确率、相关性和延迟之间重新判断,"这个任务真的需要 deep search 吗?还是 mini 模型已经足够?"另一家公司的原则更干脆——"谁变得更好或更便宜,就转向谁"。客户还在,但模型忠诚度正在崩塌。

给你的行动建议

  • 别再按 Token 做预算。 在自己真实负载里跟踪"每成功任务成本"。Token 单价对 Agent 经济学几乎不提供信息。
  • 搭一层路由。 一个简单的多模型网关,让每个请求匹配到能完成它的最便宜模型——规划给前沿模型,执行给便宜模型,大部分省钱空间都在这。
  • 评"模型+Harness"组合,不是评模型。 Agents' Last Exam 这类新 Benchmark 已经把模型和 Harness 绑在一起测,因为前沿模型装进错误的 Harness,可能不如便宜模型配对的组合。先在自己的真实任务上跑评测再决策。
  • 盯住 DeepSeek 这场实验。 如果涨价后采用基本稳住,"便宜 + 开放"就从定价策略升级成品牌位置,整个开放权重路线图都会跟着变;如果扛不住,中国模型价格的地板就要重新谈判。

两条价格曲线正从两个方向同时收敛——前沿模型的溢价被上压下挤——最终都会朝同一个均衡点靠拢:完成一件真实任务要花多少钱。模型正在变成可替换的零件,被重新定价的是 Task 本身。

滚动至顶部