DeepSeek V4 Pro 正式版上线:Agent 能力暴涨,图像推理首次原生支持

8 月 13 日凌晨,DeepSeek 悄悄把 API 文档换成了 V4 Pro 正式版:模型名还是 deepseek-v4-pro,但 fingerprint 已变成 fp_v4pro_20260812,距离 4 月 24 日预览版发布整整 111 天。架构没变,变的是后训练——Agent 能力从「几乎不可用」跳到「能跟头部闭源正面对打」,还首次原生支持图像推理,价格一分没涨。

核心变化:Agent 暴涨 + 图像推理

架构参数没动(1.6T 总参数 / 49B 激活 MoE,1M 上下文、384K 最大输出),提升全部来自后训练,且精准落在预览版最容易翻车的地方——长链路代码修改、环境操作、工具调用:

  • DeepSWE(自家软件工程基准):12.8 → 62.7,约 4.9 倍
  • Cybergym:52.7 → 83.3
  • Terminal Bench:72.1 → 87.9
  • DSBench-Hard:翻倍以上,达 67.2

另一大变化是原生图像推理:预览版是纯文本,正式版首次支持在 DeepThink 同一个思考流程里分析图片、截图、混合文档,做「看图干活」的 Agent 不用再单独接 VLM。

上手调用

OpenAI 兼容接口,模型名不变,图片走标准 image_url 消息格式:

curl https://api.deepseek.com/chat/completions \
  -H "Authorization: Bearer $DEEPSEEK_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "deepseek-v4-pro",
    "messages": [{
      "role": "user",
      "content": [
        {"type": "text", "text": "分析这张报错截图并给出修复建议"},
        {"type": "image_url", "image_url": {"url": "data:image/png;base64,..."}}
      ]
    }],
    "max_tokens": 8192
  }'

踩坑提示:thinking 模式会吃输出配额

DeepThink 的推理 token 计入 max_tokens。在复杂代码生成任务里,它可能吃掉 80% 以上的输出预算——实测中 16,384 token 的配额有 13,394 花在「思考」上,HTML 写到一半被截断;关掉 thinking 重跑,54 秒输出完整 715 行代码。

经验法则:需要长结构化输出(代码、配置、文档)时,任务不需要深度推演就主动关 thinking,或者把 max_tokens 调得远高于预期输出量(上限 384K,空间充足)。

实践建议

  • 高吞吐 Agent 场景默认选它:多步工具调用、长程编码的实测提升是真的。输入每百万 token 3 元,约为 Fable 5 的 1/10、Kimi K3 的 1/3,性价比极强。
  • 纯推理仍非最强:HLE(无工具)42.7,落后 Opus 4.8(49.8)和 Fable 5(53.3)。要极致推理和最难 SWE 任务,头部闭源仍是首选——只在那最后一段距离上多花钱。
  • 盯紧涨价窗口:DeepSeek 8 月 6 日已预告「近期整体上调 API 定价、涨幅较大」,0813 版本暂时没动。长跑任务趁现在锁定,预算按涨价预留。
  • 截图理解类 Agent 简化架构:UI agent、文档解析现在可以在同一推理流程里看图,省掉单独的 VLM 路由层。

资源

相关资讯