Video-DeepResearch:面向下一代多模态深度研究智能体 Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent
首个视频深度研究框架,解耦感知与探索,35B以64.0%刷新SOTA
前置知识
深度研究智能体 (Deep Research Agent)
能自主执行多步网络检索、工具调用与信息综合的AI智能体。区别于单轮问答,它通过迭代式的“搜索-阅读-推理”循环,从开放网络中收集证据并给出综合答案,代表工作有WebGPT、AutoGPT、Tongyi DeepResearch。
本文正是把这一范式从文本/图像扩展到连续视频流,理解Video-DR必须先理解DR智能体的工具调用与轨迹决策机制,否则无法理解为何要“分阶段解锁工具”。
视觉语言模型 (Vision-Language Model, VLM) 与 MoE 架构
同时处理图像/视频与文本的多模态大模型。本文基座采用Qwen3-VL系列的混合专家(MoE)架构,命名如30B-A3B表示总参数约30B、每token仅激活约3B参数,能在保持大容量时降低推理成本,训练时需负载均衡辅助损失。
本文的基础模型、训练目标与评测都建立在VLM的能力与局限之上;不懂MoE的稀疏激活就无法理解“A3B”的含义和训练为何需要EP=8专家并行。
组相对策略优化 (Group Relative Policy Optimization, GRPO)
DeepSeekMath提出的强化学习算法,通过组内相对奖励计算优势函数 $\hat{A}$,省去独立的价值网络、降低显存开销。本文用它做稀疏二元奖励($r=1$正确、$r=0$错误)的RL微调,并对格式错误/重复循环的负梯度以20%概率下采样。
GRPO是本文突破SFT模仿学习上限、让模型“自主探索”的关键阶段,理解它才能理解模型为何能从53%→59.3%再进一步。
参数化知识泄露 (Parametric Knowledge Leakage)
指模型仅凭预训练阶段记忆的内部知识就能答对题,而不真正调用工具或理解视频。本文发现GPT-5以近乎零的视觉工具调用(0.00次/任务)就拿到57%准确率,说明现有评测题被模型“背答案”攻破。
这是本文动机的核心,也是构建新基准VIDEODR-BENCH时重点用“四次零工具rollout过滤”要消除的对象,不理解它就读不懂为什么要重做评测。
Agentic 工具调用与 ReAct 轨迹
智能体在每个决策步 $i$ 根据历史轨迹 $H_i=[Q,V,a_1,o_1,...,a_{i-1},o_{i-1}]$ 从动作空间 $\mathcal{A}$ 中采样动作 $a_i\sim\pi_\theta(a|H_i)$,执行后获得观测 $o_i$,如此循环直到给出最终答案。
本文把Video-DR形式化为这样的序列决策过程,动作空间 $\mathcal{A}=\{\text{Select\_Keyframe}, \text{Crop\_Search}, \text{Text\_Search},...\}$,理解这一范式才能读懂“分阶段解锁动作空间”的设计。
研究动机
现有深度研究智能体在直接迁移到视频场景时暴露两大致命问题,作者用Table 1的预实验量化。其一是严重的模态偏置(modality bias):即便最强的开源模型Qwen3.5-397B-A17B,平均每任务仅调用0.10次视觉工具却调用1.27次文本工具,几乎完全绕开主动视觉探索,等于“不看视频也能搜”。其二是参数化知识泄露(parametric knowledge leakage):GPT-5以近乎零的视觉工具调用(0.00次)和极少文本调用(0.12次)就拿到57%准确率,说明现有评测题模型靠预训练记忆“背”答案就能答对,根本没做真正的视频理解与多步推理。这两点意味着:既没有能驱动视觉探索的训练数据,也没有能“逼真测量”视频DR能力的评测基准,数据与评测双重缺失共同阻碍了Video-DR这一新范式的发展。
本文的目标是本文目标是构建首个端到端的Video-DR统一框架,同时攻克数据、训练、评测三道难关。具体而言:①设计可放大的数据合成引擎,产出真正需要视觉grounding+外部知识的训练数据(目标30K VQA+7K轨迹);②设计训练范式,让小模型(30B/35B)学会“先视觉感知后网络检索”的主动探索策略,并用GRPO突破SFT模仿天花板;③构建严格的高保真评测基准,每道题都能证明必须同时依赖视觉搜索与外部知识推理,从根上堵住参数知识泄露。最终用开源小模型在准确率上超越Claude-4.5-Sonnet等闭源巨头,证明“训练方法学>裸参数规模”。
与已有工作不同的是,独特切入角度在于“解耦”与“强制”两个动作。之前的图像DR工作(Vision-DeepResearch、WebWatcher)虽引入了视觉工具,但把视觉与文本工具同时开放,模型天然倾向走文本捷径。本文反其道而行:用“分阶段工具解锁(stage-wise tool unlocking)”强制模型先穷尽视觉感知——轨迹生成阶段只允许Select_Keyframe和Crop_Search,把模态偏置从“架构限制”重新定义为“训练数据分布的产物”,并用实验证明30B的工具多样性反超397B。同时,前人评测基准要么靠费时难放大的人工标注,要么无法排除参数泄露;本文用人机协同+递归种子扩展+零工具rollout过滤,第一次给出既可放大又严格依赖外部工具的Video-DR基准。
核心方法
直觉上,作者把视频深度研究拆解为一个“先看清楚、再查明白”的顺序决策过程:视频本质上是关键实体随时间运动的一系列关键帧,智能体要先用视觉工具锁定关键帧、裁剪出显著实体(演员、logo、比分牌等),把它转成可检索的视觉query,再做文本网络搜索完成多跳推理。技术路线上,整个框架分三个Phase:Phase I用规则+智能体两级过滤筛出信息量高的视频;Phase II用CLIP选关键帧、用VLM检测bounding box并做视觉搜索验证,合成3万条带中间证据的VQA对;Phase III通过解耦的感知-探索流水线生成7K条训练轨迹。模型训练采用“SFT冷启动+GRPO强化”的两阶段配方,最后用200条人机协同标注的实例构成评测基准VIDEODR-BENCH。整套设计把数据合成、模型训练、严格评测闭环地串在一起。
核心创新是“分阶段工具解锁”+解耦的感知-探索流水线。已有图像/视频问答智能体把视觉工具与文本工具同时开放,模型出于训练分布偏差会偷懒走文本捷径、几乎不调用视觉工具(Qwen3.5-397B每任务仅0.10次视觉调用)。本文强制:在轨迹生成阶段先“冻结”文本工具、只允许Select_Keyframe和Crop_Search,迫使模型在多帧、多实体间反复做视觉grounding;直到视觉证据充分或达到感知上限,才“解锁”Search和Visit文本工具。这把“看视频”从可选项变成必选项,从根上扭转模态偏置。再配合对参数知识泄露的“四次零工具rollout过滤”,确保训练信号只来自真正需要外部检索的难题,而非被“背答”的简单题。这一思想是全文最本质的区别点。
方法步骤详情
方法分四步。①VQA生成:用CLIP算帧间相似度去冗余(>0.8或单色帧丢弃),每视频关键帧≤20帧;397B-A17B选关键帧并预测bbox,35B-A3B验证裁剪区与检索结果语义对齐,形成 $\langle v_t,B,\text{实体名},\text{摘要}\rangle$;分单/多实体两种模式生成问答,每题做4次无工具rollout,任一答对即丢弃,得30K VQA。②轨迹生成:用397B在解耦流水线下rollout并拒绝采样,视觉阶段仅用视觉工具,达上限后才扩展为Search+Visit,仅保留正确轨迹,得7K。③SFT:7K视觉轨迹+7K纯文本QA(来自VDR)混合训练,目标为 $\mathcal{L}_{SFT}=-\sum_i\log\pi_\theta(y_i\mid x,y_{<i})$。④GRPO:在2K中等难度集(Pass@4落在(0,1))上做稀疏二元奖励,目标用PPO裁剪 $\frac{1}{G}\sum_i\min(r_i,1\pm\epsilon)\hat A_i-\beta D_{KL}$,对格式错误/重复循环的负梯度以20%概率下采样。判分用Qwen3-VL-30B-A3B-Instruct做judge。
技术新颖性
技术新颖性体现在三点。第一,任务定义层面:首次系统提出Video-DR这一“视频流密集时空grounding+开放网络探索”耦合的新范式,明确其与纯文本DR、图像DR的本质区别(视频是连续时序、噪声大、冗余高、需要跨帧跨实体推理)。第二,数据层面:提出可放大的生成式数据引擎,用“分阶段工具解锁+拒绝采样”产出30K VQA和7K轨迹,并首创“四次零工具rollout过滤”来消除参数知识泄露,这是保证训练信号质量的关键trick。第三,评测层面:VIDEODR-BENCH用可放大的“人机协同标注”替代纯人工——多智能体(Drafting Agent→QA Generation Agent→Ranking Agent)把种子VQA递归地扩展为更高跳数难题,而ranker只保留最高分实例。这套组合使一个30B/35B的小模型能超越397B基线和Claude-4.5等闭源巨头。
实验结果
Table 3是核心战绩。Video-DeepResearch-35B-A3B平均64.0%刷新SOTA:超Claude-4.5-Sonnet(59.0%)5.0点,超GPT-5(52.5%)11.5点,超Gemini 2.5 Pro(57.5%)6.5点;VideoDR 68.0%、VIDEODR-BENCH整体60.0%;相对基座Qwen3.5-35B-A3B(42.8%)+21.2%。30B平均59.3%,持平Claude-4.5且比基座(40.5%)高+18.8%,证明紧凑规模同样有效。细分看KNL知识66.1%(+20.3)、ENT娱乐65.9%(+15.9)、DLY日常56.8%(+16.3)增长最猛;但NWS新闻35B仅41.7%(+8.4)而30B达58.3%,存在规模-领域不一致。Table 4最关键:Ours在VideoDR视觉调用2.33次、文本4.24次,Qwen3.5-397B仅0.10/1.27——训练把工具使用从“逃避”扭转为“穷尽”;GPT-5在新基准视觉调用也从0升到0.31,证明基准逼出真工具使用。Table 5消融:Base 40.5%→4K-SFT 46.0%→7K-SFT 53.0%→+7K文本 56.8%→+2K-RL 59.3%,视觉轨迹、文本DR技能、RL缺一不可。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| VideoDR基准(整体准确率) | Acc.(%) | 68.0 (Video-DeepResearch-35B-A3B) | Claude-4.5-Sonnet 63.0, GPT-5 57.0, Gemini 2.5 Pro 62.0, Kimi K2.5 61.0 | 比最强闭源Claude-4.5高+5.0;相对自家基座Qwen3.5-35B-A3B(42.0)提升+26.0 |
| VIDEODR-BENCH 平均准确率(含VideoDR与6个细分类别) | Avg Acc.(%) | 64.0 (Video-DeepResearch-35B-A3B) | Claude-4.5-Sonnet 59.0, Gemini 2.5 Pro 57.5, Kimi K2.5 57.0, GPT-5 52.5 | 超Claude-4.5 +5.0、超Gemini +6.5,开源35B小模型登顶全部受评模型 |
| VIDEODR-BENCH 细分类别(知识/娱乐/日常/游戏体育/新闻/其他) | Overall Acc.(%) | 60.0 (KNL 66.1, ENT 65.9, DLY 56.8, G&S 62.1, NWS 41.7, OTH 42.9) | Claude-4.5 Overall 55.0 | Overall +5.0;知识+20.3、娱乐+15.9、日常+16.3提升最显著,但新闻类+8.4偏弱 |
| 工具调用多样性(VideoDR视觉工具平均次数) | avg vision tool calls/task | 2.33 (Ours) | Qwen3.5-397B-A17B 0.10, GPT-5 0.00, Gemini 2.5 Pro 0.31 | 相对397B提升约23倍,直接证明训练方法学纠正了模态偏置;30B(2.33)甚至超过397B |
| 消融:强化学习(RL)阶段增益 | Avg Acc.(%) | 59.3 (14K-SFT+2K-RL, 30B) | 56.8 (7K视觉SFT+7K文本SFT, 无RL) | +2.5,证明GRPO能把模型从静态模仿推向自主探索 |
局限与改进
作者在Limitation小节承认三点。①计算开销大:4节点×8卡=32张H800 80GB,数据合成要并发部署397B大模型+动态网络搜索,训练需Megatron-LM的TP=4/CP=2/EP=8混合并行才能支撑8万token超长上下文。②基准标注成本高:8名专业标注员、约3周时间,质检分“标注”与“审查”两阶段,限制了数据集快速扩张。③作者表示未来才解决高效pipeline、轻量架构、自动化LLM评估以减少人工依赖。我额外观察到两点:论文存在命名/数字不一致——摘要与Table 2都说基准是200实例,但4.1节却写“100 human-annotated VQA pairs”,且方法在仓库叫Vision-DeepResearch而正文叫Video-DeepResearch;另外35B在新闻类(41.7%)远弱于30B(58.3%),暗示训练对时序强动态、文字密集的新闻视频可能过拟合或泛化不稳,值得追问其根因。
独立分析的弱点
独立审视后,以下弱点值得改进。第一,评测规模偏小:VIDEODR-BENCH仅200实例、6类,单类样本最少仅14个(OTH),统计噪声大、长尾覆盖不足,改进方向是扩展到数千实例并分层抽样,对每类做bootstrap置信区间报告。第二,视觉检索依赖反向图搜的命中率,对模糊/遮挡/小目标裁剪容易检索到噪声;可改进为多候选crop+置信度加权融合,或引入OCR、人脸、ASR字幕等专用子工具。第三,35B在NWS(41.7%)反而劣于30B(58.3%),说明RL奖励或数据配比对“时序强动态、文字密集”的新闻视频不够鲁棒;应针对该域做领域自适应RL或课程学习。第四,评测judge用Qwen3-VL-30B-A3B-Instruct自评,存在同源偏差(尤其30B变体与judge同源),建议引入人工或多个异构judge交叉验证。第五,论文未报告推理时延/成本,select_crop_search需要并行调外部图搜API,真实部署的端到端延迟未量化。
未来方向
作者明确:探索计算高效的pipeline、轻量架构、自动化LLM评估以减少人工依赖。基于成果可延伸:①把递归种子扩展循环推到更高跳数,自动生成k-hop递增的课程数据;②将解耦感知-探索范式迁移到长视频(目前≥10min仅占20%),解决长程时序推理;③引入多模态奖励(除正确性外奖励“视觉证据充分性”“检索效率”)替代纯二元稀疏奖励,缓解RL探索稀疏;④把select_crop_search扩展为更细粒度工具集(OCR、人脸、ASR),研究工具粒度与性能的权衡;⑤研究参数知识泄露的在线检测,动态剔除被“背答”的训练样本,保证训练信号持续纯净。
复现评估
代码已开源(https://github.com/Osilly/Vision-DeepResearch,仓库名Vision-DeepResearch与正文Video-DeepResearch不一致)。训练细节充分:32×H800 80GB、Megatron-LM、TP=4/CP=2/EP=8+序列并行、8万token上下文不做数据打包、3 epoch、micro-batch 1、global batch 64、学习率warmup到 $1\times10^{-5}$ 再衰减到 $5\times10^{-7}$、MoE辅助损失 $1\times10^{-6}$、容量因子2.0、FlashAttention+逐层激活检查点、每500步存Safetensors。数据合成依赖大模型(397B做轨迹、35B做验证),复现30K+7K需可观API/GPU成本。基准的200条人工标注需8名标注员3周+严格质检,难以快速复刻。Prompt模板(Fig.4-8)与工具接口(Table 6)完整公开。整体算力门槛高但方法学可复现,对中小团队属中等偏难。
论文图表
上下两幅对比图。(A)旧范式:文本only或图像only研究,query(如“这个演员叫什么”)直接走文本搜索捷径、只看单帧输入;本文(B)范式:沿时间轴t1..t4选关键帧→裁剪显著实体→视觉搜索→访问网页(如Forbes列出Girls5Eva演员表)→给出最终答案。一图说清从“单帧/单模态”到“跨帧视觉grounding+网络探索”的范式转变。
用最直观的方式交代本文相对旧范式的根本差异,是理解整个工作定位与动机的入口图。
六个视频领域分布饼图+每类真实问答示例:知识29.5%(如问免费试用期天数答14天)、娱乐22.0%、日常18.5%(如问拖鞋品牌答Adidas Adilette Aqua Slides)、游戏体育14.5%、新闻12.0%(如问制服军官名字答Greg Bovino)、其他3.5%。强调每个实例都需要视觉grounding+多跳外部知识推理。
展示基准的领域多样性与每题“视觉+知识”双重依赖的设计,是评测有效性、覆盖广度的核心证据。