8 月 13 日凌晨,DeepSeek 悄悄把 API 文档换成了 V4 Pro 正式版:模型名还是 deepseek-v4-pro,但 fingerprint 已变成 fp_v4pro_20260812,距离 4 月 24 日预览版发布整整 111 天。架构没变,变的是后训练——Agent 能力从「几乎不可用」跳到「能跟头部闭源正面对打」,还首次原生支持图像推理,价格一分没涨。
核心变化:Agent 暴涨 + 图像推理
架构参数没动(1.6T 总参数 / 49B 激活 MoE,1M 上下文、384K 最大输出),提升全部来自后训练,且精准落在预览版最容易翻车的地方——长链路代码修改、环境操作、工具调用:
- DeepSWE(自家软件工程基准):12.8 → 62.7,约 4.9 倍
- Cybergym:52.7 → 83.3
- Terminal Bench:72.1 → 87.9
- DSBench-Hard:翻倍以上,达 67.2
另一大变化是原生图像推理:预览版是纯文本,正式版首次支持在 DeepThink 同一个思考流程里分析图片、截图、混合文档,做「看图干活」的 Agent 不用再单独接 VLM。
上手调用
OpenAI 兼容接口,模型名不变,图片走标准 image_url 消息格式:
curl https://api.deepseek.com/chat/completions \
-H "Authorization: Bearer $DEEPSEEK_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "deepseek-v4-pro",
"messages": [{
"role": "user",
"content": [
{"type": "text", "text": "分析这张报错截图并给出修复建议"},
{"type": "image_url", "image_url": {"url": "data:image/png;base64,..."}}
]
}],
"max_tokens": 8192
}'
踩坑提示:thinking 模式会吃输出配额
DeepThink 的推理 token 计入 max_tokens。在复杂代码生成任务里,它可能吃掉 80% 以上的输出预算——实测中 16,384 token 的配额有 13,394 花在「思考」上,HTML 写到一半被截断;关掉 thinking 重跑,54 秒输出完整 715 行代码。
经验法则:需要长结构化输出(代码、配置、文档)时,任务不需要深度推演就主动关 thinking,或者把 max_tokens 调得远高于预期输出量(上限 384K,空间充足)。
实践建议
- 高吞吐 Agent 场景默认选它:多步工具调用、长程编码的实测提升是真的。输入每百万 token 3 元,约为 Fable 5 的 1/10、Kimi K3 的 1/3,性价比极强。
- 纯推理仍非最强:HLE(无工具)42.7,落后 Opus 4.8(49.8)和 Fable 5(53.3)。要极致推理和最难 SWE 任务,头部闭源仍是首选——只在那最后一段距离上多花钱。
- 盯紧涨价窗口:DeepSeek 8 月 6 日已预告「近期整体上调 API 定价、涨幅较大」,0813 版本暂时没动。长跑任务趁现在锁定,预算按涨价预留。
- 截图理解类 Agent 简化架构:UI agent、文档解析现在可以在同一推理流程里看图,省掉单独的 VLM 路由层。