面向视频模型的视觉提示工程 Visual prompt engineering for video models
用图像编辑模型改造任务图片,系统提升视频模型视觉推理能力
前置知识
提示工程(Prompt Engineering)
提示工程指在不修改模型权重的前提下,通过精心设计输入文本来引导语言模型产出更好输出的技术。大量研究表明,像「Obama worked as a ___」与「Obama is a ___ by profession」这类同义但措辞不同的提示,会系统性地影响模型准确率,从问答到代码生成都是如此。其核心前提是:只要模型输入空间足够丰富,就有空间去优化该输入以提升下游表现。
本文正是把这一已成熟的文本提示工程思想,迁移到视频模型的「视觉输入」上,提出视觉提示工程(VIPE)。理解文本提示工程为何有效、如何系统化,是理解 VIPE 类比和价值的基础。
视频生成基础模型(Video Generation Foundation Models)
视频生成基础模型(如 Veo 3.1、Wan2.2、Omni Flash)接收一个文本提示(描述要发生什么)和一个视觉提示(通常作为生成视频的首帧图像),然后生成一段描绘任务求解过程的视频。近期工作表明它们能处理迷宫求解、逻辑谜题、物理模拟等颇具挑战的视觉推理任务,被视为视觉任务的「基础模型」。
本文的研究对象正是这类视频模型。理解它们的双模态输入结构(文本+图像)以及「生成视频来解题」的工作方式,才能明白为何视觉提示(图像)是被忽视的优化维度,以及 VIPE 是如何插入到这个推理流程中的。
测试时扩展(Test-Time Scaling)
测试时扩展指在推理阶段(而非训练阶段)投入更多计算来提升模型表现,常见手段包括自洽性(self-consistency,即多次采样后做多数投票)和对多个早期解码结果用启发式挑选最优。语言模型已从预训练、后训练到测试时三个维度受益于扩展,而视频模型的测试时扩展研究还很少。
本文把 VIPE 定位为一种新的、成本高效的测试时扩展策略,并与自洽性多数投票直接对比。理解测试时扩展的概念,才能看懂第 5 节关于「在固定预算下,探索更多 VIPE 变体比生成更多视频更划算」这一关键结论。
图像编辑模型(Image Editing Models)
图像编辑模型(如 Nano Banana Pro / Nano Banana 2,即 Gemini 3 Pro Image 与 Gemini 3.1 Flash Image)能够根据自然语言指令对输入图像进行风格迁移、物体替换、场景重构等修改,同时尽量保持空间布局和元素对应关系。随着这类模型日益成熟,整库地改写一个数据集的视觉风格已成为低成本操作。
图像编辑模型是 VIPE 流水线中「Editor」这一步的核心组件,正是它的存在让「把抽象草图批量改写实」变得可行。论文也明确指出 VIPE 变体质量高度依赖图像编辑模型的质量,这是该方法当前最大的局限。
表现与能力之分(Performance vs. Competence)
这一经典区分指出:模型在某个任务上测得的「表现」(performance)可能低于其真实的「能力」(competence),原因是评测环境没有给模型发挥的舞台。论文用了一个生动比喻——要测一条鱼的最大速度,应该在水里而不是在陆地上测。模型可能有能力解某任务,但若任务呈现方式使其「离分布」,表现就会被低估。
本文核心发现之一就是视频模型存在「真实感偏差」:在抽象/合成任务上的表现往往只是其真实推理能力的下界。理解这一概念框架,才能把握作者「别再用抽象任务评测视频模型」这一呼吁的分量,以及 Figure 8 中 VLM 物理理解「浅薄」的论断。
研究动机
在大模型时代,文本提示工程已是提升语言模型表现的成熟技术,但视频生成模型作为新兴的视觉推理基础模型,其输入侧存在一个明显的「不对称性」:文本提示被广泛研究和优化,而视觉提示(输入图像)却被当作固定不变的东西。这种忽视令人意外,因为对视觉推理任务而言,图像才是主导性的条件信号——它占据大量 token,定义了空间布局、物体和约束。更具体地说,现有视觉推理基准(如 VPCT 物理推理、Maze 迷宫、RushHour 停车场)大多用抽象、合成的草图风格呈现,而视频模型恰恰在这种「离分布」的输入上表现糟糕,导致评测结果严重低估了模型的真实能力。例如 Wan2.2 在 VPCT 的草图基线上几乎只有随机猜测水平(chance level 33.3%)。
本文的目标是本文要回答的核心问题是:能否通过改造视频模型的输入任务图像(而非修改模型本身或仅优化文本),来系统性地提升其视觉推理能力?作者把这个方法命名为视觉提示工程(Visual Prompt Engineering, VIPE)。他们希望证明三件事:第一,VIPE 像文本提示工程一样能稳定提升表现;第二,VIPE 可以被自动化,无需依赖人类直觉;第三,VIPE 是一种成本高效的测试时扩展策略,甚至比传统的自洽性多数投票更有效。此外,作者还想揭示视频模型存在系统性的「真实感偏差」——即偏好写实场景而非抽象输入——并据此呼吁社区停止在抽象任务上评测视频模型。
与已有工作不同的是,此前确实有人探索过修改视觉输入以影响模型,比如在分类器输入图上叠加形状、为 CLIP 学习像素级扰动、向 ViT 注入可学习 token,以及通过 inpainting、视觉 cloze、视觉指令等方式做提示。但这些都是针对图像分类器或判别式模型的,而且「工程化视觉输入以提升视频生成模型的推理表现」这一具体问题始终是空白。本文的独特切入在于:把视觉提示当作与文本提示对等的、可优化的空间,用现成的图像编辑模型把抽象任务图改写成写实场景,再交给视频模型推理——任务逻辑保持不变,只改视觉呈现。这种「翻译表示鸿沟」的视角,加上对真实感偏差的机制性解释,是此前工作从未触及的。
核心方法
直觉上,如果一条鱼在水里游得最快,那测它的速度就该把它放进水里。同理,视频模型主要在写实视频上训练,给它抽象草图就等于让它「在陆地上」解题。VIPE 的整体思路就是:用图像编辑模型把抽象任务图「翻译」成模型更熟悉的写实场景,再让视频模型在新场景上推理。技术路线分三步。首先定义任务样本为 $(x_i, t_i)$,其中 $x_i \in \mathcal{X}$ 是视觉提示(图像),$t_i \in \mathcal{T}$ 是文本提示;VIPE 的目标是找一个变体 $v_i^*$ 替换 $x_i$ 但不改变任务逻辑。整个流水线可重复 $n$ 次产生多个变体用于集成,全部建立在标准现成组件之上(图像编辑模型、VLM),不依赖任何新模型架构。
核心创新点是「视觉提示是可优化空间」这一观念转变,而非某个新模型。它与已有方法的本质区别在于:过去的提示工程几乎只盯着文本,过去的视觉输入修改只针对判别式分类器且未被工程化;VIPE 首次把「改造任务图像」当作与文本提示工程对等、可自动化、可复用的手段,并揭示出视频模型的真实感偏差这一深层现象。另一个关键洞察是,VIPE 的有效性来自「桥接表示鸿沟」:把抽象输入翻译成模型内部表示更熟悉的写实形式,从而大幅改善生成一致性(场景不再随机出现/消失/变形的物体),而不是因为单纯加了 3D 深度——Figure 2 的「不自然纹理」消融实验证实 3D 深度本身并不够,真正起作用的是视觉真实感。
方法步骤详情
VIPE 分三步。**Step 1 Ideator(构思器)**:给定构思提示 $t_{ideate} \in \mathcal{T}$ 和 $k$ 个任务样本,构思器 $I: (\mathcal{X} \times \mathcal{T})^k \times \mathcal{T} \to \mathcal{T}$ 输出一段自然语言编辑指令 $t_{edit} \sim I(X, t_{ideate})$,其中 $X = \{(x_i, t_i)\}_{i=1}^k$。构思器可以是人或 LLM/VLM,编辑指令只受 $t_{ideate}$ 约束(确保核心任务不变,如规定哪些场景元素不可改)。**Step 2 Editor(编辑器)**:图像编辑器 $E: \mathcal{X} \times \mathcal{T} \to \mathcal{X}$(本文用 Nano Banana Pro / Nano Banana 2)根据 $t_{edit}$ 对原图 $x_i$ 采样 $m$ 个候选变体 $V_i = \{v_{i,j}\}_{j=1}^m$,$v_{i,j} \sim E(x_i, t_{edit})$。例如 VPCT 的编辑指令是「转成写实照片,保持正对墙面的视角,把白圆换成小红台球,每条黑线换成等长等向同位的木板,不要添加任何东西」。**Step 3 Filter(过滤器,可选)**:用打分函数 $S: \mathcal{X} \times \mathcal{X} \to \mathbb{R}$(如 VLM)评估候选质量及对原图 $x_i$ 的忠实度,选最优 $v_i^* = \arg\max_{v \in V_i} S(v, x_i)$。自动化版本有两种:自由构思(freeform ideation,VLM 开环生成 $t_{edit}$,Gemini 3.1 Pro 构思 + Nano Banana 2 编辑 + Gemini 3.1 Pro 从 5 个候选中筛 1 个,迭代 $n$ 次累积多样性)和原子概念编辑(ACE,把图像逐概念、一步步树搜索式修改,深度 3 层、分支因子 6/5/3,闭环接收 autorater 反馈并学习「宪法」总结有效编辑策略)。
技术新颖性
技术新颖性体现在几个层面。**概念层面**:首次提出并系统验证「视觉提示工程」这一范式,把视觉输入从固定项提升为与文本提示对等的可优化空间,填补了视频模型输入优化研究的空白。**方法层面**:尽管 ideator/editor/filter 各组件都是现成模型(作者明确声明不主张这些组件的新颖性),但把它们组装成可自动化、可重复、可集成的流水线,并设计自由构思与 ACE 两种互补的自动化方案,是新的工程贡献;ACE 还通过「宪法学习」把哪些编辑策略有效/无效归纳成可迁移的知识(如高对比背景隔离、语义简化、把抽象元素做成「磨砂黏土」「粉笔板」等可触 3D 物体)。**实证层面**:首次揭示视频模型的真实感偏差,并用「不自然纹理」消融、Figure 7 的逐步写实实验(场景一致性从 0% 升到 59%)给出机制性解释。**评测层面**:作者还附带设计了「倒扣桶」对照实验(Figure 8),证明号称已解决 VPCT 物理推理的 VLM(Gemini 3.1 Pro 达 96%)其实只是浅薄理解——桶倒过来准确率就掉到 4%。
实验结果
论文用六个 Takeaway 总结核心发现。**发现一(Figure 2)**:在 VPCT 物理推理上,VIPE 把抽象草图改写实后,开源闭源模型普遍提升。Veo 3.1 从 41.3% 升到 59.3%(+18 pp),Omni Flash 从 56.3% 升到 67.5%(+11.2 pp),Wan2.2 的 TI2V 与 I2V 在中英文提示下均从近随机水平(32–40%)跃升到 42–45% 的显著高于随机。「不自然纹理」消融显示,仅加 3D 深度而无真实纹理并不能提升,证明起作用的是真实感本身。**发现二(Figure 3)**:VIPE 可自动化,在六大任务(VPCT、四种 Maze、Connect the Dots、Conjunctive Search、Sort 3 Numbers、RushHour 两个难度)上共评估 18,160 个视频,自由构思和 ACE 都能系统降低错误率,部分任务错误率降低超 75%,ACE 在 Sort 3 Numbers 上达 100% 错误率削减。**发现三(Figure 4、5)**:在 VPCT 上,20 次自洽性投票把基线从 41.3% 提到 50.0%(+8.7 pp),而单次 VIPE 就达 59.3%(+18 pp),两者叠加可达 68.0%(+27.7 pp);成本分析显示一个 VIPE 变体仅花一次视频的 1/8(USD 0.40 vs USD 3.20),固定预算下应优先多探 VIPE 变体而非多生成视频。**发现四(Figure 6)**:在 Sort 3 Numbers 上,最佳文本变体和最佳图像变体都把准确率从 4% 提升约 20 倍(分别达 86% 和 76%),视觉工程常比文本工程更有效。**发现五(Table 1)**:VIPE 对原生图像生成模型帮助不大甚至有害(NB Flash 图像模式从 37% 掉到 21%),支持「表示鸿沟」假说。**发现六(Figure 7、8)**:场景一致性随真实感单调上升(0%→11%→24%→59%),VLM 物理理解其实浅薄(倒扣桶准确率仅 3–4%)。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| VPCT 物理推理(预测球落入哪个桶) | 三分类准确率(chance 33.3%) | Veo 3.1 + VIPE 单次 59.3%,VIPE + 20 次自洽性 68.0% | Veo 3.1 草图基线 41.3%,20 次自洽性 50.0% | 单次 VIPE +18 pp;叠加后 +27.7 pp,超过纯自洽性的 +8.7 pp |
| VPCT 物理推理 | 三分类准确率 | Omni Flash + VIPE 67.5%;Wan2.2 各配置 VIPE 后 42–45% | Omni Flash 56.3%;Wan2.2 近随机 32–40% | Omni Flash +11.2 pp;Wan2.2 从随机水平升到显著高于随机 |
| Sort 3 Numbers(数字升序消失) | 准确率 | 最佳图像变体 76%,最佳文本变体 86%(ACE 达 100% 错误率削减) | Veo 3.1 基线约 4% | 约 20 倍提升 |
| Conjunctive Search(合取搜索) | 准确率 | 最佳图像变体 62% | 约 4% | 图像变体平均提升幅度显著大于文本变体 |
| 六大任务自动化 VIPE(Figure 3) | 相对错误率削减百分比 | 多个任务/切分错误率削减超 75% | 无 VIPE 基线 | 自由构思与 ACE 均系统降低错误率 |
| 原生图像模型 VPCT(Table 1) | Pass@1 / 多数投票 | NB Pro 图像 VIPE 50% vs 草图 45%;NB Flash 图像 VIPE 21% vs 草图 37% | 草图基线 | 几乎无系统性提升甚至负向,支持表示鸿沟假说 |
局限与改进
作者承认的最大局限是:VIPE 变体质量高度依赖图像编辑模型的质量——若编辑器改变了任务性质或引入伪影,下游视频模型就不可能正确求解原任务。他们用过滤/质量控制步骤(VLM 审核并可能拒绝编辑)来缓解,并预期随着图像编辑模型进步这一步将不再必要。第二个局限是潜在的成本开销,但因为图像编辑成本远低于视频生成,实践中这反而成了 VIPE 的优势(便宜的图像编辑能显著降低昂贵的失败视频生成概率)。从我的观察看,还有几个未明说的局限:一是所有自动化实验(第 4 节起)基本只用 Veo 3.1 单一模型,泛化性证据有限;二是自由构思在某些任务(如 Maze)上只能产生细微视觉变化,且难以找到跨切分(如不同迷宫尺寸、不同 RushHour 难度)都有效的单一变体;三是联合文本+图像工程的简单 ideator 反而不如单独改图像,说明「同时改两维」比想象中难;四是 Connect the Dots 即使加了 VIPE 仍是 Veo 的硬骨头,说明 VIPE 并非万能。
独立分析的弱点
**弱点一:强依赖图像编辑器且存在忠实度风险。** 当编辑器把任务改「跑题」(如改变了斜坡角度、漏掉障碍)时,VIPE 反而引入新错误。改进方向是引入更强的、可证明保持几何/拓扑不变的编辑器(如基于约束的可控生成),或用确定性几何校验自动检测忠实度违规,替代当前靠 VLM 主观筛选的过滤步。**弱点二:评测主模型单一。** 第 4 节后的自动化与扩展实验几乎只用 Veo 3.1,结论能否迁移到 Wan、Omni、开源模型乃至未来模型存疑;尤其作者自己也提出「随着模型变强,VIPE 会不会变得不需要」这一悬而未决的问题。改进方向是跨多代、多家模型做纵向追踪,刻画 VIPE 收益随模型能力演化的曲线。**弱点三:对真实感偏差只给出了相关性解释。** Figure 7 证明真实感↑则一致性↑,但「是因为抽象场景把模型带出分布,还是只是把它带到另一种先验(如卡通里物体本就可随意消失)」仍未区分。改进方向是设计受控实验,用合成数据明确操控训练分布中抽象样本的比例,做因果归因。**弱点四:自动评估的 autorater 一致性参差。** Maze 的 VLM autorater 与人类仅「中等」一致(κ=0.583),RushHour 的算法解析器在严格模式下几乎失效(κ=0.000),这可能让 Figure 3 的绝对数字带有噪声。改进方向是开发更鲁棒的任务特定解析器或更高一致性的评估协议。**弱点五:跨切分泛化弱。** 自由构思难产出一个对所有迷宫尺寸/难度都有效的变体,意味着每换一个切分可能都要重新搜索,工程成本高。改进方向是研究「可迁移编辑策略」或元学习。**弱点六:联合文本+图像工程反而更差**,暴露了多维同时优化的难度,值得专门研究如何协调两个通道。
未来方向
作者在 Outlook 中明确展望:随着前沿视频模型接受更丰富的多模态上下文,VIPE 可能从编辑单张图像扩展到涉及多张参考图甚至参考视频;并抛出一个开放问题——模型变强后 VIPE 是会越来越不需要(模型直接懂抽象任务),还是越来越强(图像编辑越来越好)?基于本文成果,我认为可延伸的方向还有:第一,把 VIPE 思想推广到视频本身的编辑(而不仅是首帧),例如对中间帧做提示工程;第二,研究 VIPE 与强化学习/偏好优化的结合,把「找好视觉提示」变成可微或可奖励的过程;第三,沿「表示鸿沟」假说做更系统的诊断工具,量化任意模型在任意输入分布上的表示不匹配程度,从而预测 VIPE 收益;第四,把 ACE 的「宪法学习」做成跨任务可迁移的通用编辑策略库;第五,针对真实感偏差,探索训练时增强(如对抗式抽象样本训练)以从根上消除偏差,而不只在推理时补救;第六,作者自己提出的「性能 vs 能力」框架可扩展为:为每类视频模型建立一套「最小真实化」的 VIPE 预处理标准,让评测更公平可比。
复现评估
复现评估整体偏好但有几个门槛。**有利因素**:作者公开了几乎所有关键细节——VPCT 数据集本身在 HuggingFace 上以 MIT 许可发布(100 样本),其他任务来源(Wiedemer et al. 的 Maze/Connect the Dots/Sort 3 Numbers/Conjunctive Search、MentisOculi 的 RushHour)均标注许可;附录给出了完整的 ideator/filter/text-ideator/ACE 系统提示词、各任务的基础任务描述、ACE 树搜索配置(深度 3 层、分支因子 6/5/3、每节点 3 视频)、评估器的帧级打分 prompt,以及成本明细(Veo 3.1 每 720p 8s 视频 USD 3.20,一次含 5 次编辑的 VIPE 约 USD 0.40)。还报告了 autorater 与人类的一致性(Conjunctive/Search/Sort 任务 216 视频上 85.6% 一致、κ=0.711;Maze 加网格后 κ=0.583;RushHour 宽松算法 κ=0.570)。**主要门槛**:核心模型(Veo 3.1、Gemini 3.1 Pro、Nano Banana Pro/2、Omni Flash)多为 Google 闭源 API,需通过 Vertex AI 调用,第 4 节一次实验就生成 18,160 个视频,按 USD 3.20/视频粗估仅视频生成就约 5.8 万美元,加上 VIPE 与评估调用,复现成本极高;开源的 Wan2.2 虽可本地跑但表现远弱于 Veo。**项目页**承诺提供示例视频(论文多处提到「See videos on our project page」),但未见代码/数据编辑流水线的开源仓库。综合来看,方法层面高度可复现(提示词齐全),但完全复现实验结果受算力和闭源模型访问限制,难度较大。
论文图表
三列展示 VPCT 控制条件:原图(VLM 正确预测桶)、倒扣桶草图(VLM 仍预测球会落入桶,准确率掉到 3–4%)、写实倒扣桶(排除「看不懂草图」的可能后模型仍答错)。证明号称已解决该任务的 VLM(Gemini 3.1 Pro 在原图达 96%)其实只用了浅薄捷径,缺乏对物理原理的真正理解。
这是论文的重要副产品发现,虽然不是 VIPE 主体,但强化了「表现≠能力」的论点,并警示社区高准确率可能掩盖浅薄理解。对理解为何需要更扎实的视觉推理评测至关重要。