提示工程被宣告「死亡」已经不是第一次了。但 Google DeepMind 的最新论文没有否定提示工程,而是把它从一个模态扩展到了另一个模态——从文本扩展到视觉。
论文提出的 VIPE(Visual Prompt Engineering,视觉提示工程)核心观点非常直接:对于视频模型,改输入画面,比改提示词更有效。一张抽象草图被改写成照片级写实场景,Veo 3.1 在物理推理任务上的准确率从 41.3% 直接拉到 59.3%——全程没有动过一句提示词。
一、什么是「视觉提示工程」
提示工程的底层逻辑是:只要模型的输入空间足够丰富,优化输入就能提升下游性能。过去这个「输入」被默认理解为文本指令,但视频模型正在成为视觉任务的基础模型,它们的输入里本来就有一张图。
VIPE 做的就是:在不改变任务逻辑的前提下,把任务图像改写成模型更容易理解和推理的视觉形式。比如「小球滚过障碍后落在哪个桶里」这类物理推理题,把抽象的球+斜面示意图,改写成台球+木板的写实场景,同时保持空间关系不变。
整个过程可以全自动,由三个模块组成:
- Conceptualizer(概念器):用视觉语言模型(VLM)生成图像改写指令,明确哪些任务要素必须保留(物体数量、位置、朝向、相对关系);
- Editor(编辑器):按指令改写原图,生成一张或多张候选图,可由图像编辑模型完成,也可人工编辑;
- Filter(过滤器):可选步骤,从多张候选中挑出质量最好、且保留关键任务信息的那张。
二、实验数据:收益有多大
论文在 VPCT 物理推理任务等多组测试上验证了效果:
- Veo 3.1:准确率从 41.3% 提升到 59.3%(单次采样);
- Omni Flash:从 56.3% 提升到 67.5%;
- 自动化自由式改写:部分任务错误率下降超过 75%;
- Sort 3 Numbers 任务:逐样本选择最佳视觉版本,错误率可降到 0。
更值得注意的是它与 test-time scaling 的组合效应:不做 VIPE 时,Veo 3.1 靠多次采样最多从 41.3% 提到 50.0%;做了 VIPE 后,单次采样就到 59.3%,再叠加多次采样可以到 68.0%。一次输入改写,比多烧算力做采样更划算,而且两者还能叠加。
论文还发现,视频模型系统性地偏好写实输入——改写的每一步向真实感靠近,生成一致性都在提升。有效的改写普遍具备三个特征:场景更真实、目标更突出、语义更直接。
三、框架:提示工程的本质是「输入表征优化」
把 VIPE 放到更大的坐标系里看,它验证了一个更一般的规律:提示工程的本质不是「写话术」,而是优化模型的输入表征。
文本时代,输入表征是 token 序列,所以提示词工程有效;视频模型时代,输入表征里最重的一块是视觉内容,那么「画面的可理解性」就成了新的优化面。模型对照片级真实输入的偏好,本质上是抽象输入与训练数据分布之间的 gap——把 gap 填上,推理自然变好。
这里还有一条值得记住的成本定律:图像编辑比视频生成便宜一个数量级。用一次便宜的图像编辑调用,去降低一次昂贵的视频生成的失败概率,是计算效率上的结构性套利。论文原话:「一次廉价的图像编辑,可以减少一次昂贵视频生成失败的概率。」
四、推演:提示工程不会死,而是「换战场」
第一,「提示」的定义在扩张。未来多模态模型的提示,很可能是「图片 + 视频 + 指令」的组合优化,文本只是其中一环。论文团队也明确表示,随着视频模型接收更丰富的多模态上下文,视觉提示工程可能从单图编辑扩展到多参考图甚至视频。
第二,图像编辑模型的价值被重估。它们不再只是「生成工具」,而是可以成为视频推理前的「输入预处理芯片」——这个角色转换会改变这类模型的评估和使用方式。
第三,自动提示工程从文本走向视觉。整套管线(VLM 出指令 → 编辑模型改写 → 自动打分器筛选)已经可以全自动运行,意味着「推理时自适应优化输入」会成为一个新的研究方向,而不是靠人工调图。
当然,边界同样清晰:论文测试的原生图像生成模型(Nano Banana 系列)并没有稳定获益——它们对抽象和写实风格同样熟悉;个别任务上文本提示仍然更强。所以更准确的表述是:视觉提示工程不是替代文本提示工程,而是为视频模型补上了一块此前被忽略的优化空间。
五、落到行动
- 做视频模型应用或评测的人:先检查输入画面的「真实度」。把抽象示意图、线稿改写成写实场景再喂给模型,可能是零成本的提点手段。
- 对照三特征清单自查:场景够不够真实?目标物够不够突出?语义表达够不够直接?三条都满足,改写基本就到位了。
- 算成本账:当视频生成重试成本高企时,先试「先改图再生成」,一次便宜的编辑可能省掉整轮昂贵的重试。
- 别盲目套用:对原生图像生成模型、以及文本优势明显的任务,先小范围验证再上规模。
- 关注自动化方向:VIPE 管线已可全自动,未来「推理时自动优化输入」很可能成为视频智能体的标配能力,值得提前布局。
提示工程没有死,它只是学会了看图。
论文:Visual prompt engineering for video models(arXiv:2607.25537,Google DeepMind,2026-07-28)。项目页:visual-prompt-engineering.github.io
