DeepSeek 首个多模态模型「长眼」:V4-Flash Vision 上线,1000 张图只要 1 块钱

DeepSeek 首个多模态 API 模型 DeepSeek-V4-Flash-Vision-Exp 于 8 月 21 日上线,定价延续 V4-Flash:一张图最多计 384 token,按文本同价计费。折算下来,1000 张图高峰期成本约 1.15 元、谷时不到 6 毛——比 Claude Sonnet 4.6 同场景约 4 美元(约 29 元)便宜约 25 倍,谷时差距近 50 倍。视觉从“溢价功能”变成“标配”,Agent 从此可以每跑一步都截个屏自查。

DeepSeek 发了什么

DeepSeek-V4-Flash-Vision-Exp 已可直接调用,计费与纯文本 V4-Flash 完全一致:每百万 token 3 元,低谷时段再打五折。视觉不是加价项而是封顶项——单张图无论多复杂,最多消耗 384 token。

文本侧它也比被扩展的版本更强:七项 Agent 评测里六项超过 V4-Flash-0731,部分多模态任务还一度压过硅谷顶级模型。对开发者最直接的意义:不用再为“看图”单独接第二个模型。

实测:从截图到可交付代码

实测第一题:把 OpenAI 官网截图 1:1 复刻成可运行的单文件 HTML——先逐块描述布局、字体、主色 hex 与间距节奏再写代码,文案照抄、还原 hover 与滚动渐入、375px 窄屏不崩。复刻结果几乎一模一样。

第二题完全不同:给精品咖啡烘焙工坊做 11 页 B 端合作提案——只做浅烘单品豆、最小起订 5 公斤、三档真实供货方案、调性手作且有点固执、全程不碰行业黑话。模型交出一份能直接发给客户的完整提案:数字具体、没有给外行看的科普。一句模糊需求进去,一份成品出来。

“1000 张图 1 块钱”的价格账

各家按图计 token 的差价极大。按 TokenMix 视觉 API 横评,读一张 1024×1024 图:

  • Claude Sonnet 4.6:1334 token,约 4 美元/千图(约 29 元)
  • GPT-5.4 Vision:765 token,约 1.9 美元/千图
  • Gemini 3.1 Pro:258 token,约 0.5 美元/千图
  • DeepSeek V4-Flash Vision-Exp:封顶 384 token

按 V4-Flash 价格,1000 张图高峰约 1.15 元、谷时不到 6 毛,与最贵档相差约 25 倍,谷时接近 50 倍。

这个数字本身就是重点:同样的 1000 张图,29 元和 1 元是两种产品设计。贵的那档逼你权衡“这一步到底值不值得看”;便宜的那档允许 Agent 每跑一步都截图、自查自己的产出。(各模型视觉质量差异可对照我们此前的 GPT-5.6 Sol 视觉评测。)

八天补齐 Agent 闭环

DeepSeek 正在快速拼齐完整 Agent 栈。8 月 13 日,DeepSeek Harness 开源并原生支持 Responses API——运行时这半块;8 月 21 日视觉上线,覆盖 Chat Completions、Messages、Responses 三种格式——输入端这半块;同一天 Harness 0.1.1 发布,开箱支持新模型,一行适配代码都不用写。

图片有三条进入路径:base64 内联、外部 URL、以及当天免费开放的 Files API——传一次后用 file_id 引用。对反复读同一张设计稿、报表、页面截图的 Agent 来说,这省掉的是每一轮的往返成本。刚接触运行时的话,可参考我们的 Harness 插件安装指南

25 倍价差为什么是结构性变化

多模态输入一直是按“溢价功能”定价的,DeepSeek 把它变成了标配能力,等于改写了 Agent 设计底层的成本假设。当视觉接近免费,“看一眼自己的产出”就从优化项变成默认校验步骤——会自我检查画面的 Agent,和只会回读文本的 Agent,行为方式完全不同。

它还消掉了一个开发痛点:团队不再为了 OCR 或界面理解把图片单独路由到另一家服务商。一个端点、三种 API 格式、三条输入路径——把视觉挡在 Agent 循环之外的那层摩擦没有了。

你可以怎么用

  • 给 Agent 加视觉自查。 截取渲染后页面让模型核对布局、颜色与内容——规模化后成本以分计。
  • 重复读取走 Files API。 设计稿或报表传一次、按 file_id 引用,别再每轮重新编码 base64。
  • 重算视觉预算。 如果别处按图收溢价,把 OCR 与文档类负载拿来和这个端点做基准对比。
  • 用足谷时档。 五折价下,批处理与夜间流水线会显著更便宜。

FAQ

Q:DeepSeek V4-Flash Vision 看图多少钱?
A:一张 1024×1024 图最多计 384 token,按 V4-Flash 每百万 token 3 元计费。1000 张图高峰约 1.15 元、谷时不到 6 毛,比 Claude Sonnet 4.6 便宜约 25 倍。

Q:DeepSeek-V4-Flash-Vision-Exp 支持哪些格式?
A:支持 Chat Completions、Messages、Responses 三种 API 格式,图片可经 base64 内联、外部 URL 或免费 Files API 传入。

Q:模型什么时候上线、现在能用吗?
A:2026 年 8 月 21 日上线、立即可用;同日发布的 DeepSeek Harness 0.1.1 开箱支持,无需适配代码。

发表评论

滚动至顶部