GPT-5.6 Luna 降价80%正面硬刚DeepSeek:AI模型进入「按效用计价」时代

7月31日,AI行业在同一天迎来两记重拳。

一边是 OpenAI 突然宣布 GPT-5.6 Luna 输入价格从 $1/M 砍到 $0.2/M,输出从 $6/M 降到 $1.2/M,降幅达80%;另一边是 DeepSeek 正式发布 DeepSeek-V4-Flash 官方版(0731),agent 能力大幅提升,价格仍维持 $0.14/$0.28 per million tokens。

表面看,这是又一轮价格战的延续。但把两件事情放在一起,真正的信号是:前沿模型的定价权正在从「能力溢价」转向「效用溢价」,AI 服务正在加速商品化。

01 破题:同一天的两步棋,不是巧合

OpenAI 选择在新模型发布仅三周后大幅降价,本身就不寻常。

GPT-5.6 家族(Sol / Terra / Luna)7月9日刚发布,三周后 Luna 和 Terra 就降价,旗舰 Sol 虽然价格不变,但新增了 Fast mode——花双倍价格换取 2.5 倍速度。这意味着 OpenAI 的产品逻辑变了:不再按「模型智商」单一维度定价,而是按「任务场景 + 时间敏感度 + 调用规模」组合计价。

同一天,DeepSeek-V4-Flash 官方版上线,API 调用方式完全不变,只需指定 deepseek-v4-flash。根据 DeepSeek 官方数据,新版本在 agent 基准上全面超越自家 V4-Pro-Preview:

  • Terminal Bench 2.1:82.7
  • NL2Repo:54.2
  • DeepSWE:54.4
  • Agent Last Exam:25.2

更关键的是,价格没变。DeepSeek 的意思很直接:性能我升级,价格我不涨,你 OpenAI 要降,我奉陪。

02 拆解:OpenAI 为什么敢降80%?

降价底气一部分来自工程优化。OpenAI 在前一天的博客里披露,Sol 已经被接入生产推理栈,开始自己优化自己的运行成本:

  • 用 Triton / Gluon 重写 GPU kernel,端到端服务成本降低 20%
  • 改进 speculative decoding,token 生成效率提升 15% 以上
  • 优化负载均衡和 KV cache 配置

但 20% 成本优化 + 15% 效率提升,远远解释不了 80% 的降价幅度。剩下的驱动力来自市场竞争。

根据 OpenRouter 数据,自2026年4月下旬以来,中国模型的 token 调用量已连续13周超过美国模型;7月20日至26日当周,中国模型处理了约 38.6 万亿 token,占平台总量的 66.5%。CNBC 调查也显示,美国企业通过 OpenRouter 使用中国 AI 模型的 token 占比自2月8日以来每周都超过 30%,最高达 46%。

压力之下,OpenAI 必须证明:即便在性价比维度,GPT-5.6 Luna 也能和中国模型正面竞争。

03 建框架:三个层面的结构性变化

这件事不能只当新闻看。它同时改写了三个层面的行业规则:

第一层:模型分层取代单一旗舰

过去开发者选模型,常常是非此即彼:要么用最强最贵的,要么用便宜但能力明显差的。现在 GPT-5.6 家族提供了清晰的三层分工:

  • Luna:高并发、高频、工具调用和多步骤 workflow,价格接近上一代 nano
  • Terra:日常复杂任务,降价 20% 后成为「工作主力」
  • Sol:高价值、高不确定性任务,Fast mode 单独售卖「速度」

这标志着模型选择从「选最好的」变成「选最合适的」。

第二层:AI 开始自己优化 AI 基础设施

Sol 重写 kernel、设计实验、监控训练、自动干预硬件故障——这不是未来时,而是已经发生的生产实践。模型越强,它优化自身运行成本的能力就越强,反过来又能支撑更低的价格。这是一个自我强化的成本下降飞轮。

第三层:低价成为分发和锁定的手段

OpenAI 把 Luna 降到比 DeepSeek V4 Pro 还便宜的输入价格,同时把 Auto-review 从 GPT-5.4 切到 Luna。这意味着开发者一旦在 Codex / ChatGPT Work 里习惯了这个性价比,迁移成本会越来越高。价格战的终点不是谁最便宜,而是谁的生态能把用户留得住。

04 推演:谁会先撑不住?

价格战中,最先出局的通常不是最便宜或最贵的,而是「既没有规模,又没有差异化」的玩家。

对 API 提供商而言,模型层毛利会被持续压缩。能活下来的需要具备以下至少一项:

  • 自研芯片 / 推理优化能力(降低成本结构)
  • 自研模型 + 开源权重(建立社区和分发渠道)
  • 应用层生态绑定(Codex、ChatGPT Work、GitHub Copilot 等)

对应用开发者而言,这是利好。过去一个 agent workflow 动辄调用数千 token,成本敏感到决定产品形态;现在 Luna / V4-Flash 的价格让「高频 agent」真正具备了商业化空间。

对中国模型厂商而言,OpenAI 的降价既是压力也是验证。它证明 DeepSeek 们已经成功把全球价格锚点拉低,但同时也把「性价比」竞争的门槛抬高到了新的量级。

05 落到行动:开发者该怎么做?

如果你正在用 AI 做产品,三件事可以立刻做:

  1. 重新盘点成本结构:把高并发、可明确规范的任务迁移到 Luna / V4-Flash,把 Sol / Opus / GPT-5.6 Sol Pro 留给真正需要深度推理的环节。
  2. 把「模型」从护城河清单里删掉:当输入价格降到 $0.2/M,模型本身不再是壁垒。真正的壁垒变成工作流集成、专有数据、用户习惯和 agent 编排能力。
  3. 为「速度」单独定价做准备:Fast mode 的出现意味着延迟开始像云计算的预留实例一样,成为一个可交易的维度。未来你的产品可能也需要区分「标准响应」和「极速响应」两档。

结语

GPT-5.6 Luna 的 80% 降价和 DeepSeek-V4-Flash 官方版的发布,不是两条独立新闻,而是同一场产业重构的两面。

一面是 OpenAI 用价格换规模、用生态换粘性;另一面是 DeepSeek 用开源权重和不变的价格证明:中国模型已经把全球 AI 定价的锚点永久下移。

对大多数从业者来说,好消息是模型成本快速下降;坏消息是,模型本身越来越不值钱,值钱的将是你用它做了什么。


参考来源:

滚动至顶部