8 月 12 日晚,AI 圈一夜三响:马斯克放出 Grok 4.6,千问开源 Qwen 3.8 Max,DeepSeek 则在深夜把 V4 Pro 正式版(DeepSeek-V4-Pro-0813)悄悄转正。媒体抓的重点很一致——性能逼近甚至局部超越 Claude Fable 5,价格还没涨。
但跑分从来不是这则新闻的深层结构。真正值得读的信号藏在两个数字里:一个是能力跃迁,一个是价格按兵不动。把它们放在一起,我们看到的是模型层竞争的终局信号——比赛正在换赛道,从「谁更聪明」变成「谁的执行结构更适合 Agent 时代」。
一、两个数字比跑分更有信息量
第一个数字:DeepSWE 从 12.8 涨到 62.7。DeepSWE 测的不是一道题,而是「长周期、高复杂度、真实软件工程」——一个 Agent 要像工程师一样把一个大任务从头干到尾。预览版只有 12.8,正式版接近 5 倍的增长,说明这一代的研发重心根本不在通用智商,而在「把复杂活干完」的执行能力。
第二个数字:Agent 基准直接反超。在 AI 安全智能体套件 Cybergym、工作流智能体 AutomationBench 上,V4 Pro 正式版的表现超过 Fable 5。官方定价维持 3 元/百万 Token 输入、6 元/百万 Token 输出(缓存命中输入仅 0.025 元),大约是 V4 Flash 的 3 倍。注意 8 月 6 日 DeepSeek 刚预告要「大幅涨价」,结果正式版落地时价格纹丝不动。
能力大涨、价格没动——这不是单纯的厚道,而是成本结构在被重新定义:昇腾 950 超节点下半年批量上市,国产算力开始兑现规模红利。DeepSeek 的意思是:我能把价格压住,因为我赌的是算力国产化的成本曲线。
二、顶级模型已经进入「结构分工」而非「能力排名」
一个常被忽略的事实:现在的第一梯队旗舰,已经不是谁比谁强的关系,而是能力结构的分工关系。
Claude Opus 是「思考型」——推理深度是它的护城河;Kimi K3 是「长程型」——把长时间、多步骤的执行 hold 住是它的强项;DeepSeek V4 Pro 是「工具化执行型」——把工具调用、结构化输出、Agent 循环当成母语来写。三者都站在第一梯队(V4 Pro 综合 60.73 vs Fable 5 的 67.77 vs Opus 4.8 的 61.01),但护城河分布在 Agent 栈的不同环节。
这不是能力高低之差,是「Agent 能力结构」之差。模型竞争进入结构分工阶段之后,比的不再是「谁想得深」,而是「在 Agent 执行链路的哪一环做到极致」。DeepSeek 选择把「工具化执行 + 性价比」作为自己的生态位——这也是它敢在顶级性能面前打价格牌的原因。
三、模型层转正只是前菜,Harness 才是正餐
社区已经在等下一件事:DeepSeek Harness。V4 Pro 只是 API 转正,完整的 Harness 尚未发布——而这恰恰印证了上周我们写的判断:Harness 赢了模型。模型层的能力趋同越来越快(Flash/Pro 半年一更,跑分差距收窄到个位数),竞争单位已经从「模型」上移到「模型 + Harness」组成的系统。
同样的逻辑也在改写产业链其他地方:推理成本从「成本线」变成「利润中心」,国产算力叙事开始兑现,Agent 时代的瓶颈从「想得多深」转移到「调得动多少外部系统」。
四、落到行动
- 开发者/独立开发者:别只跑分。用你自己的多步工具链实测一次——V4 Pro 的价值在「工具化执行 + 缓存命中 0.025 元」的组合,而不是某个榜单名次。
- 团队选型:先问「我们的 Agent 栈缺哪一环」,再问「谁在这一环最强」。思考型上 Opus、长程型上 Kimi、工具执行型上 DeepSeek——按环节配模型,而不是迷信单一旗舰。
- 成本管理:官方预告的涨价只是延迟不是取消。抢在落地前锁定价位与缓存命中方案;关注 DeepSeek Harness 的发布节奏,它才是这轮 DeepSeek 叙事的主菜。
来源备注:信息综合自 DeepSeek 官方 API 文档与定价页、快科技、智东西、BlockBeats、机器之心、知乎讨论(2026-08-12/13)。
延伸阅读
- DeepSeek 工具页:模型参数、定价、API 文档一览
- 2026 主流 AI 大模型盘点与选型指南:DeepSeek 在大模型格局中的定位
- 2026 AI 发展趋势盘点:推理成本崩塌与 Agent 化是今年主线
- DeepSeek 官方 API 文档:定价、模型列表与更新日志