← 返回 2026-08-04

DeepVoyager-VL:激励长时程多模态智能体的视觉在环搜索 DeepVoyager-VL: Incentivizing Vision-in-the-Loop Search for Long-Horizon Multimodal Agents

Huanyao Zhang, Jiepeng Zhou, Runhao Zhao, Yanzhe Shan, Jiaoyang Chen, Bowen Zhou, Bo Li, Fang Wang, Jialong Wu, Zhengwei Tao, Lang Mei, Xiaohan Yu, Liyan Liu, Chong Chen, Wentao Zhang 📅 2026-08-03 👍 17 2026-08-09 18:30
MLLM 事件图 多模态深度搜索 数据合成 智能体 监督微调 视觉在环搜索

用结构先于语言的事件图数据,让视觉证据真正驱动多轮搜索。

前置知识

多模态深度搜索智能体 (Multimodal Deep Search Agent)

在 ReAct 式的「推理-行动-观察」循环基础上,扩展出图像搜索、反向图搜、图像裁剪等视觉工具的智能体。它不依赖模型自身的参数化知识,而是通过多轮工具调用从开放网络采集文本与图像证据,把证据整合进上下文 $C_{t+1} = C_t \oplus (r_t, a_t, o_t)$ 后给出答案。代表系统有 MMSearch-R1、WebWatcher、Vision-DeepResearch、OpenSearch-VL 等。

DeepVoyager-VL 正是这一范式下的新工作,其全部方法设计(工具协议、轨迹合成、SFT 目标)都建立在多模态搜索循环之上,不理解这个循环就读不懂 Equation 1 与 Algorithm 1。

视觉在环 (Vision-in-the-Loop)

指「搜索过程中新获取的视觉观察会决定下一步检索什么」这一性质。形式化地,轨迹 $\tau = (x, r_1, a_1, o_1, \ldots, r_T, a_T, o_T, y)$ 是视觉在环的,当且仅当存在 $1 \le t < t' \le T$ 使得新获取的视觉观察 $ov_t$ 解决了后继行动 $a_{t'}$ 所需的某个变量(记作 $ov_t \rightsquigarrow a_{t'}$)。它区别于「视觉只在输入端」或「只在答案附近」两种弱形态。

这是全文最核心的概念,也是标题里 Vision-in-the-Loop 的来源。论文所有方法(事件图合成、接口约束、反事实检查)都是为了构造出真正满足这一定义的数据,读懂它才能判断论文相对三类旧范式的本质区别。

反事实视觉必要性 (Counterfactual Visual Necessity)

为了排除「视觉只是装饰」的伪依赖,论文要求:用检索到的图像 $I_r$ 和其他证据 $K$ 能唯一确定答案 $Y(q, I_s, I_r, K) = \{y\}$,但去掉所有检索图像后答案不再唯一 $|Y(q, I_s, \emptyset, K)| > 1$(Equation 3)。即必须做反事实实验——「若中途没有这张图,答案会不会变多解」——来证明视觉证据不可替代。

这是论文用来过滤掉装饰性图像与伪跳转的关键机制。理解它才能看懂 QA realization 为何把每条约束设计成在候选宇宙 $U$ 中必要($|U_L|=1, |U_L \setminus \{\ell\}| > 1$),也才能评估 VIL 数据的质量。

监督微调与冷启动 (Supervised Fine-Tuning / Cold Start)

通过让模型模仿高质量教师轨迹来建立工具使用行为,损失为 $\mathcal{L}_{\text{SFT}}(\theta) = -\frac{\sum_i \sum_t m_{i,t} \log p_\theta(z_{i,t} | z_{i,<t})}{\sum_i \sum_t m_{i,t}}$,掩码 $m_{i,t}=1$ 仅对助手推理、工具调用、最终答案计损失,观察与系统消息只作条件。与之相对的是 MMSearch-R1 等用基于结果的强化学习从零激励工具行为的路线。

论文的一个核心主张是「不需要额外 RL,仅靠高质量 VIL 轨迹 SFT 就能训出长时程视觉搜索行为」。不熟悉 SFT 冷启动与 RL 激励的区别,就无法理解论文为何反复强调 no RL 以及它对 DeepEyesV2「纯 RL 不可靠」结论的呼应。

多模态事件图 (Multimodal Event Graph)

论文 EventVoyage-VL 数据合成的底层数据结构 $G = (V, E, M, \mathcal{I}, A, F)$:$V$ 实体节点、$E$ 实体对边、$M$ 宏事件(同日同城事件聚类)。每条原子事件归一化为 $r = (u_s, u_t, c, t, l)$,含参与方、关系类型、时间、地点。图还挂载图像集 $\mathcal{I}$,每张图分离存储检索上下文 $K_{\text{ret}}(I)$(用于重新定位)与视觉内容证据 $F_{\text{vis}}(I)$(像素级事实),并用 $A$ 把图像与实体/事件对齐。

整个 VIL 数据都从这张图上确定性抽取子图、再反向构造 inference program 而来。理解图的 schema(Table 5)与防泄漏约束 $K_{\text{ret}}(I) \cap \text{Alias}(y) = \emptyset$ 是看懂数据合成流水线的前提。

研究动机

多模态大模型(MLLM)虽然在视觉理解与推理上进展显著,但其参数化知识是静态的,遇到知识密集或动态演化的开放世界问题就力不从心。深度搜索智能体通过迭代推理加工具调用来采集外部证据缓解了这一局限,近期更出现了接入图像搜索与视觉工具的多模态版本。然而真实世界的信息检索往往要跨越页面、模态、事件与时间把零散证据串起来:搜索中途发现的一张图可能解开某个中间实体,从而决定下一条查询,最终答案要在若干次这样的跳转之后才浮现。这要求智能体用新获取的视觉证据驱动后续检索,并把过程维持很长一段时程——论文称之为 vision-in-the-loop search。可现有方法在数据与机制两层都未做好准备:训练数据几乎不为「中间视觉依赖」提供监督,三类主流范式(实体替换、前置视觉推理、答案侧嫁接)都先用文本搭好推理链再把图像塞进去,导致中途的视觉观察很少真正决定下一步跳转;机制层面,把每个候选图都加载进上下文会带来昂贵开销,只保留文本摘要又会丢失日后需要的细节,而现有压缩/卸载方案又没把「候选发现、选择性观察、局部视觉操作、后续检索」在跨轮次上打通。结果是:现有数据教不会这个 loop,现有智能体也撑不住这个 loop。

本文的目标是论文要造出一个真正能做长时程、视觉在环搜索的智能体,并把这种能力数据化、可训练化。具体目标有四:第一,提出 EventVoyage-VL 数据合成流水线,从视觉丰富的事件图出发构造「中间必须看图才能继续搜索」的问题,使生成的轨迹满足形式化的视觉在环定义(Equation 2)和反事实视觉必要性(Equation 3);第二,设计 DeepVoyager-VL 智能体框架,把图像发现与图像观察解耦——搜索只返回轻量引用,按需 FETCHIMAGE/CROPIMAGE 才把视觉 token 注入策略上下文,并用目标条件摘要压缩网页;第三,仅用监督微调(不引入 RL)就能让模型学会这种长时程视觉搜索行为;第四,在十个多模态信息检索基准上验证有效性,目标是 8B/30B 两个规模都能显著超过同骨架的 Agentic Workflow 基线,并在公开同规模智能体中拿到最好或第二的成绩。

与已有工作不同的是,论文的独特切入角度是「结构先于语言」(structure-before-language)。已有三类范式(实体替换、前置视觉、答案侧嫁接)无论把图像插在哪里,主推理链都是先用文本构造的,因此中途的视觉观察几乎从不充当「决定下一步检索的变量」。论文抓住的正是这个被忽视的点:先从一张视觉丰富的多模态事件图上确定性抽取子图(视觉共现网络、时间事件链、空间共现结构、多关系稠密 motif),在子图层面反向从「视觉端点」构造一个带显式内部视觉接口的 inference program,要求相邻 primitive 接口兼容且至少有一个内部接口必须由视觉证据 $F_{\text{vis}}(I_r)$ 解析,再 verbalize 成问题。这样视觉证据从设计阶段就是依赖结构的一部分,而非事后贴上的替换符或子链。配合反事实必要性检查,这套流程直接从数据生成机制上保证「中途不看图就答不出来」。

核心方法

可以打个比方:旧方法像先写好纯文字调查报告,再在某段落贴张图当插图;DeepVoyager-VL 则像先画一张带视觉锚点的事件地图,再沿「必须看图才能过桥」的路径来出题。技术上整套方法是一个五阶段流水线(Figure 2):前两阶段做数据合成(事件图构建与丰富 + 子图抽取与 VQA 合成),中间两阶段做难度感知轨迹筛选(难度分层 + 教师轨迹生成与验证),最后阶段做纯 SFT 训练。智能体遵循标准多模态搜索循环(Equation 1),每轮产出推理 $r_t$ 与动作 $a_t$、接收观察 $o_t$、更新上下文。核心设计是把图像「可发现性」与「可观察性」解耦:搜索工具只返回 URL–caption 轻量引用,只有显式的 FETCHIMAGE/CROPIMAGE 才把视觉 token 物化进策略上下文,并用跨轮次视觉寄存器 $V$ 保留这些观察供后续操作复用,使上下文增长跟随证据需求而非工具返回量。

全文最核心的创新是把「视觉证据」从推理链的装饰品提升为依赖结构的一等公民,并把这个提升同时做到数据层和机制层。数据层的本质区别在于:旧范式都用文本先建链,图像是事后插入的替换符或局部子链;EventVoyage-VL 则从视觉丰富事件图反向构造 inference program,强制要求存在一个内部接口由 $F_{\text{vis}}(I_r)$ 解析($\exists j < n: \text{out}(g_j) \in \text{Var}(F_{\text{vis}}(I_r))$,Equation 7),并用反事实检查 $|Y(q, I_s, \emptyset, K)| > 1$ 排除伪依赖。机制层的本质区别在于:现有上下文管理(LMM-Searcher 卸载视觉资产、Glyph 折叠旧上下文)都是「证据已进上下文之后」被动管理;DeepVoyager-VL 则在「证据进上下文之前」主动决定何时、加载什么图像——把候选发现(只回引用)与选择性观察(FETCHIMAGE/CROPIMAGE 物化)拆开,并用目标条件摘要只保留与当前目标相关的结论。两个层面协同,使得「看图-再搜」的 loop 既在训练数据里被显式教过,又能在推理时被低开销执行。

方法步骤详情

完整流程分五步。第一步构建并丰富事件图:从 Wikipedia 与多领域新闻抽取实体与事件,归一化为 $r = (u_s, u_t, c, t, l)$,时空共现记录聚成宏事件,重复实体对聚成关系边,得 $G_0 = (V, E, M)$;再派搜索智能体为每个实体/事件补充当输入锚点、跨实体跳转或视觉中间/终点的图像,每张图分离存 $K_{\text{ret}}(I)$ 与 $F_{\text{vis}}(I)$,并用 $K_{\text{ret}}(I) \cap \text{Alias}(y) = \emptyset$ 防泄漏,身份假设跨页面与图像交叉验证,得 $G = (V, E, M, \mathcal{I}, A, F)$。源数据约 378 万条原子事件 → 30,337 宏事件 → 约 7K 任务。第二步抽取子图并合成 VQA:用谓词 $\rho$ 抽取 $\Phi_\rho(G) = \{g \subseteq G : \rho(g) = 1\}$,得视觉共现网络/时间事件链/空间共现结构/多关系稠密 motif,组合相邻 primitive(要求 $\text{out}(g_i) = \text{in}(g_{i+1})$ 且至少一内部接口由视觉解析),反向从视觉端点构造 $\Pi = (D, U, L, I_s, I_r, y)$,要求每条主约束在 $U$ 中必要,再 verbalize 并做完整性/泄漏/反事实可解性校验。第三步难度分层:直答探测(Qwen3-VL-8B 无工具答 3 次,Pass@3 正确即丢弃)过滤不需要工具的题,再用 8 次工具 rollout 按 Pass@K 分易(7-8 对,丢弃)/中(4-6 对,保留)/难(0-3 对,保留)。第四步教师轨迹:在 DeepVoyager-VL 接口下用 doubao-seed-2-0-pro-260215 为保留题重新生成轨迹,Qwen-3.6-Flash 判答,只留正确合法可回放者(探测 rollout 永不进监督集)。第五步纯 SFT:20K 开源 + 7K 自合成共 27,180 条轨迹,4 epoch,全局 batch 64,峰值学习率 $2 \times 10^{-5}$ 余弦衰减到 $5 \times 10^{-7}$,冻结视觉编码器与多模态合并层,64 张 H20、序列长 131,072,共 199 步,无 RL,推理最多 50 轮。

技术新颖性

技术新颖性体现在四处。其一,数据合成的「结构先于语言」是全新的:以往所有多模态搜索数据合成(OpenSearch-VL 实体替换、Vision-DeepResearch 前置视觉、Visual-Seeker 答案侧嫁接)都先建文本链再插图,EventVoyage-VL 首个从视觉丰富事件图反向构造带显式视觉接口的 inference program,并用反事实必要性从机制上杜绝装饰性图像。其二,把图像「可发现性」与「可观察性」解耦:搜索只回引用,FETCHIMAGE/CROPIMAGE 才物化视觉 token 并用跨轮次寄存器 $V$ 保留,这种「证据进入上下文前就主动管理」的思路区别于 LMM-Searcher/Glyph「证据进入上下文后被动管理」的方案。其三,把难度估计与教师轨迹生成解耦:低能 rollout 只做分层、强教师重新生成监督轨迹,避免噪声探测行为污染监督。其四,纯 SFT 路线:呼应 DeepEyesV2「纯 RL 难可靠诱发工具行为」与 Pixel Reasoner 的「学习陷阱」观察,证明只要数据真正视觉在环,无需 RL 也能训出长时程视觉搜索。

Overview of DeepVoyager-VL
Figure 2: Overview of DeepVoyager-VL

实验结果

论文在十个多模态信息检索基准上做了系统评测,结论很一致。主表(Table 1)的整体轨迹:30B-A3B 从直答 20.7、加 Agentic Workflow 升到 40.7(+20.0)、再加轨迹 SFT 升到 58.6(+17.9);8B 同样 17.5 → 35.3(+17.8)→ 54.8(+19.5),工具环境与轨迹监督各贡献约一半增益。同规模开源智能体里,30B 在十基准拿九个最好、8B 拿八个最好。增益高度集中在「更需要搜索」的基准:相对同骨架 Agentic Workflow,30B 在前四个偏事实基准平均涨 10.3 分,而在 BrowseComp-VL 到 VisBrowse-Bench 六个搜索密集基准平均涨 23.1 分;8B 对应 13.8 与 23.4。单项最大提升是 BC-VL +22.6、BC-V3 +23.7、VisBrowse +30.7,恰是图像密集长时程任务。值得注意的是,仅用 30B 开源骨架加纯 SFT,平均 58.6 已逼近同 Agentic Workflow 下闭源模型(GPT-5.5 等)6.1–8.6 分之内。Framework 对比(Table 2)把框架套到 GPT-5、Gemini-2.5-Pro、Qwen3-VL-30B-A3B-Thinking 三个底座,平均分都最高:相对 LMM-Searcher 分别 +18.2、+11.5、+4.8,增益随底座能力递减。数据消融(Table 3)显示在 20K 多源轨迹之上再加 7K VIL,8B 仍涨 5.4、30B 涨 6.5,VisBrowse 上 30B 涨 11.2。组件消融(Table 4,Qwen3.6-35B-A3B)逐一去 Summary/Image Search/Fetch/Crop 平均都掉 2.5–4.0 分,Summary 掉最多(−4.0)、Crop 在 VDR 上最关键,四组件互补。轨迹分析(Figure 3)最能说明为何有效:1000 题统一 Doubao-2.0-Pro rollout 下,EventVoyage-VL 视觉工具占比 64.3%(OSVL 40.6%、VDR 30.3%、RED-MM 10.1%),轨迹峰值落在 16–20 轮(其他 1–5 或 6–10 轮),证实数据诱导出更多视觉调用与更长时程。

Performance across ten multimodal information-seeking benchmarks
Table 1: Performance across ten multimodal information-seeking benchmarks
Performance comparison of different multimodal search frameworks across three base models
Table 2: Performance comparison of different multimodal search frameworks across three base models
Cumulative training-data ablation
Table 3: Cumulative training-data ablation
DeepVoyager-VL component ablation
Table 4: DeepVoyager-VL component ablation
Trajectory statistics from unified Doubao-2.0-Pro rollouts
Figure 3: Trajectory statistics from unified Doubao-2.0-Pro rollouts
查看结构化数据
任务指标本文基线提升
MMSearch (多模态搜索整合) 准确率 DeepVoyager-VL-30B-A3B 74.0 / 8B 72.7 同骨架 Agentic Workflow 64.7 / 61.7;最强开源 SimpleSearch-VL-30B-A3B 83.6 30B 相对自身 Agentic Workflow +9.3;8B +11.0
BrowseComp-VL (深度多步视觉浏览) 准确率 30B 64.2 / 8B 58.4 同骨架 Agentic Workflow 41.6 / 34.6;次优 Visual-Seeker-8B 47.6 +22.6(30B,全文最大单项之一)
VisBrowse-Bench (视觉原生浏览) 准确率 30B 53.8 / 8B 47.3 同骨架 Agentic Workflow 23.1 / 15.4;Visual-Seeker-8B 34.7 +30.7(30B,全文最大单项)
BrowseComp-V3 (视觉/垂直/可验证浏览) 成功率 30B 35.0 / 8B 32.3 同骨架 Agentic Workflow 11.3 / 7.7 +23.7(30B)
十基准平均 平均准确率 30B 58.6 / 8B 54.8 同骨架 Agentic Workflow 40.7 / 35.3;直答 20.7 / 17.5 8B/30B 相对 Agentic Workflow 提升 55.2% / 44.0%(论文结论原文)
框架迁移性 (Table 2 四基准平均) 平均准确率 GPT-5 59.8 / Gemini-2.5-Pro 42.1 / Qwen3-VL-30B-A3B-Thinking 30.4 LMM-Searcher 同底座 41.6 / 30.6 / 25.6 +18.2 / +11.5 / +4.8

局限与改进

作者在附录 D 坦承三方面局限,都很实在。第一是范围:DeepVoyager-VL 只评测「回答导向的多模态搜索」,基准强调答案正确性与证据获取,没有系统评估开放式目标分解、迭代假设形成、冲突来源对比、长文综合与细粒度引用组织,结果应理解为「更强的长时程多模态搜索」而非「完整的自主研究智能体」。第二是延迟:目标条件摘要虽减少了原始网页/图像搜索内容进入上下文的量,但每次 WEBVISIT/IMAGESEARCH/REVERSEIMAGESEARCH 都要调一个辅助 VLM 抽证据和图像引用,这条处理处在工具返回与下一步动作的关键路径上,会带来额外延迟和部署成本,尤其访问大量页面的轨迹里更明显,论文没系统刻画「摘要质量 vs 上下文缩减 vs 延迟 vs 货币成本」的权衡。第三是视觉工作记忆边界:当前 $V$ 只是累积式、轨迹局部的,不学习哪些观察该保留/合并/压缩/丢弃,也不按来源/子任务/置信度组织,随交互时程变长冗余或低价值观察会越积越多、相关证据越来越难定位。我自己额外观察到两点:所有评测上限 50 轮,但数据峰值在 16–20 轮,模型在更极端长程(>30 轮)下缺乏直接证据;判答统一用 Qwen3.6-35B-A3B 这一个 LLM-as-judge,存在系统性偏好风险,尤其对开放视觉题。

独立分析的弱点

我独立分析后认为有几个值得改进的点。第一,视觉工作记忆 $V$ 是无脑累积的——作者也承认——50 轮内还能撑,一旦任务需 80–100 轮(LMM-Searcher 已有 100-turn 设定),上下文会被重复裁剪观察与低价值图像撑爆。改进:给 $V$ 加学习式保留/驱逐策略,按子任务分桶并设信度阈值,对长程轨迹做证据索引化检索而非全量塞进上下文。第二,目标条件摘要依赖辅助 VLM,是关键路径上的单点延迟,作者提到但没量化,延迟敏感部署里会成为瓶颈。改进:摘要做成自适应(短或已结构化页面直接旁路)、缓存页面表示、可异步并行执行。第三,数据合成严重依赖 Wikipedia + 多领域新闻这类结构化、可溯源语料,覆盖的是「事件/人物/组织」类实体密集问题,对科学图像、医学影像、长文档图表等「非事件型」视觉在环场景可能不适用。改进:把事件图泛化为更通用的「实体-关系-证据」图,或针对科学/医学域专门造子图与 inference program 模板。第四,纯 SFT 路线虽省事,但模型能力上限被教师轨迹(doubao-seed-2-0-pro-260215)锁死,对教师做不出的难题无法突破。改进:SFT 冷启动后叠加轻量 RL(如 GRPO)做难样本攻坚,注意 Pixel Reasoner 警告的工具绕过陷阱。第五,反事实必要性检查 $|Y(q, I_s, \emptyset, K)| > 1$ 本身靠生成器,存在「生成器够强就把题判成不需要图」而被错误丢弃的风险,会系统性偏向难度适中的题。改进:用多档位生成器集成判断,边界题保留人工抽检。

未来方向

作者提出三个方向。其一是「从多模态搜索到多模态研究」:把简洁答搜索升级为完整研究——把开放式目标转成研究问题层级、随证据修订计划、跨来源调和一致与冲突、产出带可追溯引用的结构化报告,评测也从答案正确性扩展到来源覆盖、引用完整、证据忠实、冲突处理与长文综合质量。其二是「更高效的证据处理」:通过自适应调用、缓存、批处理、异步执行和蒸馏小摘要器降开销,对短/已结构化响应旁路摘要、重访页面复用缓存、仅在图像证据可能影响下游决策时才调强摘要器,并把它和其他检索动作并行。其三是「模块化研究智能体 harness」:在策略外层加执行层,含分层多模态记忆、证据索引、溯源图、学习式保留/驱逐策略、子任务调度、并行工具执行、检查点与失败恢复。基于本文成果还可延伸:把事件图换成更通用知识图谱以扩展到非事件型视觉在环场景;用 VIL 轨迹做 RL 冷启动探索 SFT+RL 两阶段路线;把「视觉在环」形式化定义推广到音频/视频等多模态,构造多模态在环搜索基准。本文的 vision-in-the-loop 形式化本身就是一个可被社区复用的贡献框架。

复现评估

复现门槛中等偏上,部分可复现。代码与数据在 preprint 阶段未给明确链接,但训练超参与工具接口披露得很详细:SFT 用 Qwen3-VL-8B/30B-A3B-Instruct、ms-swift 4.0.3 + Megatron-Core 0.15.3 + PyTorch 2.10.0 + FlashAttention,序列长 131,072、bfloat16、Adam($\beta_1=0.9, \beta_2=0.95, \epsilon=10^{-8}$)、权重衰减 0.1、梯度裁剪 1.0、学习率 5% 预热到 $2 \times 10^{-5}$ 后余弦衰减到 $5 \times 10^{-7}$、4 epoch、199 步、全局 batch 64、种子 42,最终 step 199 的 checkpoint 直接评测,不另设验证集。算力是主要门槛:64 张 NVIDIA H20、8 节点、张量并行 4 + 上下文并行 2 + 序列并行(30B 还加专家并行 8),对小团队不友好。推理侧依赖外部服务:Serper 做网页/图像检索、Jina 访问页面、Cloudflare 托管要物化的图像,评测上限 50 轮,判答用 Qwen3.6-35B-A3B。数据合成侧披露了规模(378 万原子事件 → 30,337 宏事件 → 约 7K 任务)、事件图 schema(Table 5)与工具 schema(Table 6)及完整 QA realization 校验流程,理论可重造,但教师轨迹用 doubao-seed-2-0-pro-260215(闭源 API)、摘要用 Qwen3-VL-Plus、判答用 Qwen-3.6-Flash,替换成开源模型会带来不可忽略的分布差异。综合:基准评测可较好复现,数据/轨迹合成的完全一致复现需等代码与种子数据开源,且算力要求较高。