← 返回 2026-08-05

Video-DeepResearch:面向下一代多模态深度研究智能体 Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

Zhen Fang, Yu Zeng, Wenxuan Huang, Yiming Zhao, Shiting Huang, Tianfei Ren, Qi Lu, Qingnan Ren, Qisheng Su, Lionel Z. Wang, Qingyu Yin, Shuang Chen, Zehui Chen, Lin Chen, Zhenfei Yin, Yao Hu, Shaohui Lin, Wanli Ouyang, Shaosheng Cao, Feng Zhao 📅 2026-08-04 👍 50 2026-08-10 18:30
GRPO强化学习 多模态智能体 工具调用 模态偏置 视觉问答 视频深度研究

首个视频深度研究框架,解耦感知与探索,35B以64.0%刷新SOTA

前置知识

深度研究智能体 (Deep Research Agent)

能自主执行多步网络检索、工具调用与信息综合的AI智能体。区别于单轮问答,它通过迭代式的“搜索-阅读-推理”循环,从开放网络中收集证据并给出综合答案,代表工作有WebGPT、AutoGPT、Tongyi DeepResearch。

本文正是把这一范式从文本/图像扩展到连续视频流,理解Video-DR必须先理解DR智能体的工具调用与轨迹决策机制,否则无法理解为何要“分阶段解锁工具”。

视觉语言模型 (Vision-Language Model, VLM) 与 MoE 架构

同时处理图像/视频与文本的多模态大模型。本文基座采用Qwen3-VL系列的混合专家(MoE)架构,命名如30B-A3B表示总参数约30B、每token仅激活约3B参数,能在保持大容量时降低推理成本,训练时需负载均衡辅助损失。

本文的基础模型、训练目标与评测都建立在VLM的能力与局限之上;不懂MoE的稀疏激活就无法理解“A3B”的含义和训练为何需要EP=8专家并行。

组相对策略优化 (Group Relative Policy Optimization, GRPO)

DeepSeekMath提出的强化学习算法,通过组内相对奖励计算优势函数 $\hat{A}$,省去独立的价值网络、降低显存开销。本文用它做稀疏二元奖励($r=1$正确、$r=0$错误)的RL微调,并对格式错误/重复循环的负梯度以20%概率下采样。

GRPO是本文突破SFT模仿学习上限、让模型“自主探索”的关键阶段,理解它才能理解模型为何能从53%→59.3%再进一步。

参数化知识泄露 (Parametric Knowledge Leakage)

指模型仅凭预训练阶段记忆的内部知识就能答对题,而不真正调用工具或理解视频。本文发现GPT-5以近乎零的视觉工具调用(0.00次/任务)就拿到57%准确率,说明现有评测题被模型“背答案”攻破。

这是本文动机的核心,也是构建新基准VIDEODR-BENCH时重点用“四次零工具rollout过滤”要消除的对象,不理解它就读不懂为什么要重做评测。

Agentic 工具调用与 ReAct 轨迹

智能体在每个决策步 $i$ 根据历史轨迹 $H_i=[Q,V,a_1,o_1,...,a_{i-1},o_{i-1}]$ 从动作空间 $\mathcal{A}$ 中采样动作 $a_i\sim\pi_\theta(a|H_i)$,执行后获得观测 $o_i$,如此循环直到给出最终答案。

本文把Video-DR形式化为这样的序列决策过程,动作空间 $\mathcal{A}=\{\text{Select\_Keyframe}, \text{Crop\_Search}, \text{Text\_Search},...\}$,理解这一范式才能读懂“分阶段解锁动作空间”的设计。

研究动机

现有深度研究智能体在直接迁移到视频场景时暴露两大致命问题,作者用Table 1的预实验量化。其一是严重的模态偏置(modality bias):即便最强的开源模型Qwen3.5-397B-A17B,平均每任务仅调用0.10次视觉工具却调用1.27次文本工具,几乎完全绕开主动视觉探索,等于“不看视频也能搜”。其二是参数化知识泄露(parametric knowledge leakage):GPT-5以近乎零的视觉工具调用(0.00次)和极少文本调用(0.12次)就拿到57%准确率,说明现有评测题模型靠预训练记忆“背”答案就能答对,根本没做真正的视频理解与多步推理。这两点意味着:既没有能驱动视觉探索的训练数据,也没有能“逼真测量”视频DR能力的评测基准,数据与评测双重缺失共同阻碍了Video-DR这一新范式的发展。

本文的目标是本文目标是构建首个端到端的Video-DR统一框架,同时攻克数据、训练、评测三道难关。具体而言:①设计可放大的数据合成引擎,产出真正需要视觉grounding+外部知识的训练数据(目标30K VQA+7K轨迹);②设计训练范式,让小模型(30B/35B)学会“先视觉感知后网络检索”的主动探索策略,并用GRPO突破SFT模仿天花板;③构建严格的高保真评测基准,每道题都能证明必须同时依赖视觉搜索与外部知识推理,从根上堵住参数知识泄露。最终用开源小模型在准确率上超越Claude-4.5-Sonnet等闭源巨头,证明“训练方法学>裸参数规模”。

与已有工作不同的是,独特切入角度在于“解耦”与“强制”两个动作。之前的图像DR工作(Vision-DeepResearch、WebWatcher)虽引入了视觉工具,但把视觉与文本工具同时开放,模型天然倾向走文本捷径。本文反其道而行:用“分阶段工具解锁(stage-wise tool unlocking)”强制模型先穷尽视觉感知——轨迹生成阶段只允许Select_Keyframe和Crop_Search,把模态偏置从“架构限制”重新定义为“训练数据分布的产物”,并用实验证明30B的工具多样性反超397B。同时,前人评测基准要么靠费时难放大的人工标注,要么无法排除参数泄露;本文用人机协同+递归种子扩展+零工具rollout过滤,第一次给出既可放大又严格依赖外部工具的Video-DR基准。

核心方法

直觉上,作者把视频深度研究拆解为一个“先看清楚、再查明白”的顺序决策过程:视频本质上是关键实体随时间运动的一系列关键帧,智能体要先用视觉工具锁定关键帧、裁剪出显著实体(演员、logo、比分牌等),把它转成可检索的视觉query,再做文本网络搜索完成多跳推理。技术路线上,整个框架分三个Phase:Phase I用规则+智能体两级过滤筛出信息量高的视频;Phase II用CLIP选关键帧、用VLM检测bounding box并做视觉搜索验证,合成3万条带中间证据的VQA对;Phase III通过解耦的感知-探索流水线生成7K条训练轨迹。模型训练采用“SFT冷启动+GRPO强化”的两阶段配方,最后用200条人机协同标注的实例构成评测基准VIDEODR-BENCH。整套设计把数据合成、模型训练、严格评测闭环地串在一起。

核心创新是“分阶段工具解锁”+解耦的感知-探索流水线。已有图像/视频问答智能体把视觉工具与文本工具同时开放,模型出于训练分布偏差会偷懒走文本捷径、几乎不调用视觉工具(Qwen3.5-397B每任务仅0.10次视觉调用)。本文强制:在轨迹生成阶段先“冻结”文本工具、只允许Select_Keyframe和Crop_Search,迫使模型在多帧、多实体间反复做视觉grounding;直到视觉证据充分或达到感知上限,才“解锁”Search和Visit文本工具。这把“看视频”从可选项变成必选项,从根上扭转模态偏置。再配合对参数知识泄露的“四次零工具rollout过滤”,确保训练信号只来自真正需要外部检索的难题,而非被“背答”的简单题。这一思想是全文最本质的区别点。

方法步骤详情

方法分四步。①VQA生成:用CLIP算帧间相似度去冗余(>0.8或单色帧丢弃),每视频关键帧≤20帧;397B-A17B选关键帧并预测bbox,35B-A3B验证裁剪区与检索结果语义对齐,形成 $\langle v_t,B,\text{实体名},\text{摘要}\rangle$;分单/多实体两种模式生成问答,每题做4次无工具rollout,任一答对即丢弃,得30K VQA。②轨迹生成:用397B在解耦流水线下rollout并拒绝采样,视觉阶段仅用视觉工具,达上限后才扩展为Search+Visit,仅保留正确轨迹,得7K。③SFT:7K视觉轨迹+7K纯文本QA(来自VDR)混合训练,目标为 $\mathcal{L}_{SFT}=-\sum_i\log\pi_\theta(y_i\mid x,y_{<i})$。④GRPO:在2K中等难度集(Pass@4落在(0,1))上做稀疏二元奖励,目标用PPO裁剪 $\frac{1}{G}\sum_i\min(r_i,1\pm\epsilon)\hat A_i-\beta D_{KL}$,对格式错误/重复循环的负梯度以20%概率下采样。判分用Qwen3-VL-30B-A3B-Instruct做judge。

技术新颖性

技术新颖性体现在三点。第一,任务定义层面:首次系统提出Video-DR这一“视频流密集时空grounding+开放网络探索”耦合的新范式,明确其与纯文本DR、图像DR的本质区别(视频是连续时序、噪声大、冗余高、需要跨帧跨实体推理)。第二,数据层面:提出可放大的生成式数据引擎,用“分阶段工具解锁+拒绝采样”产出30K VQA和7K轨迹,并首创“四次零工具rollout过滤”来消除参数知识泄露,这是保证训练信号质量的关键trick。第三,评测层面:VIDEODR-BENCH用可放大的“人机协同标注”替代纯人工——多智能体(Drafting Agent→QA Generation Agent→Ranking Agent)把种子VQA递归地扩展为更高跳数难题,而ranker只保留最高分实例。这套组合使一个30B/35B的小模型能超越397B基线和Claude-4.5等闭源巨头。

Overview of VIDEO-DEEPRESEARCH.
Figure 3: Overview of VIDEO-DEEPRESEARCH.

实验结果

Table 3是核心战绩。Video-DeepResearch-35B-A3B平均64.0%刷新SOTA:超Claude-4.5-Sonnet(59.0%)5.0点,超GPT-5(52.5%)11.5点,超Gemini 2.5 Pro(57.5%)6.5点;VideoDR 68.0%、VIDEODR-BENCH整体60.0%;相对基座Qwen3.5-35B-A3B(42.8%)+21.2%。30B平均59.3%,持平Claude-4.5且比基座(40.5%)高+18.8%,证明紧凑规模同样有效。细分看KNL知识66.1%(+20.3)、ENT娱乐65.9%(+15.9)、DLY日常56.8%(+16.3)增长最猛;但NWS新闻35B仅41.7%(+8.4)而30B达58.3%,存在规模-领域不一致。Table 4最关键:Ours在VideoDR视觉调用2.33次、文本4.24次,Qwen3.5-397B仅0.10/1.27——训练把工具使用从“逃避”扭转为“穷尽”;GPT-5在新基准视觉调用也从0升到0.31,证明基准逼出真工具使用。Table 5消融:Base 40.5%→4K-SFT 46.0%→7K-SFT 53.0%→+7K文本 56.8%→+2K-RL 59.3%,视觉轨迹、文本DR技能、RL缺一不可。

Comparison of Accuracy and Average Tool Invocation Counts between Models on VideoDR.
Table 1: Comparison of Accuracy and Average Tool Invocation Counts between Models on VideoDR.
Video Length Distribution of VIDEODR-BENCH.
Table 2: Video Length Distribution of VIDEODR-BENCH.
Main Results on Video Deep-Research Agent Benchmarks.
Table 3: Main Results on Video Deep-Research Agent Benchmarks.
Average number of visual and text tool usages on VideoDR and our benchmarks.
Table 4: Average number of visual and text tool usages on VideoDR and our benchmarks.
Performance comparison of different models on VideoDR and our benchmarks (Ablation).
Table 5: Performance comparison of different models on VideoDR and our benchmarks (Ablation).
Tools available to the agent.
Table 6: Tools available to the agent.
查看结构化数据
任务指标本文基线提升
VideoDR基准(整体准确率) Acc.(%) 68.0 (Video-DeepResearch-35B-A3B) Claude-4.5-Sonnet 63.0, GPT-5 57.0, Gemini 2.5 Pro 62.0, Kimi K2.5 61.0 比最强闭源Claude-4.5高+5.0;相对自家基座Qwen3.5-35B-A3B(42.0)提升+26.0
VIDEODR-BENCH 平均准确率(含VideoDR与6个细分类别) Avg Acc.(%) 64.0 (Video-DeepResearch-35B-A3B) Claude-4.5-Sonnet 59.0, Gemini 2.5 Pro 57.5, Kimi K2.5 57.0, GPT-5 52.5 超Claude-4.5 +5.0、超Gemini +6.5,开源35B小模型登顶全部受评模型
VIDEODR-BENCH 细分类别(知识/娱乐/日常/游戏体育/新闻/其他) Overall Acc.(%) 60.0 (KNL 66.1, ENT 65.9, DLY 56.8, G&S 62.1, NWS 41.7, OTH 42.9) Claude-4.5 Overall 55.0 Overall +5.0;知识+20.3、娱乐+15.9、日常+16.3提升最显著,但新闻类+8.4偏弱
工具调用多样性(VideoDR视觉工具平均次数) avg vision tool calls/task 2.33 (Ours) Qwen3.5-397B-A17B 0.10, GPT-5 0.00, Gemini 2.5 Pro 0.31 相对397B提升约23倍,直接证明训练方法学纠正了模态偏置;30B(2.33)甚至超过397B
消融:强化学习(RL)阶段增益 Avg Acc.(%) 59.3 (14K-SFT+2K-RL, 30B) 56.8 (7K视觉SFT+7K文本SFT, 无RL) +2.5,证明GRPO能把模型从静态模仿推向自主探索

局限与改进

作者在Limitation小节承认三点。①计算开销大:4节点×8卡=32张H800 80GB,数据合成要并发部署397B大模型+动态网络搜索,训练需Megatron-LM的TP=4/CP=2/EP=8混合并行才能支撑8万token超长上下文。②基准标注成本高:8名专业标注员、约3周时间,质检分“标注”与“审查”两阶段,限制了数据集快速扩张。③作者表示未来才解决高效pipeline、轻量架构、自动化LLM评估以减少人工依赖。我额外观察到两点:论文存在命名/数字不一致——摘要与Table 2都说基准是200实例,但4.1节却写“100 human-annotated VQA pairs”,且方法在仓库叫Vision-DeepResearch而正文叫Video-DeepResearch;另外35B在新闻类(41.7%)远弱于30B(58.3%),暗示训练对时序强动态、文字密集的新闻视频可能过拟合或泛化不稳,值得追问其根因。

独立分析的弱点

独立审视后,以下弱点值得改进。第一,评测规模偏小:VIDEODR-BENCH仅200实例、6类,单类样本最少仅14个(OTH),统计噪声大、长尾覆盖不足,改进方向是扩展到数千实例并分层抽样,对每类做bootstrap置信区间报告。第二,视觉检索依赖反向图搜的命中率,对模糊/遮挡/小目标裁剪容易检索到噪声;可改进为多候选crop+置信度加权融合,或引入OCR、人脸、ASR字幕等专用子工具。第三,35B在NWS(41.7%)反而劣于30B(58.3%),说明RL奖励或数据配比对“时序强动态、文字密集”的新闻视频不够鲁棒;应针对该域做领域自适应RL或课程学习。第四,评测judge用Qwen3-VL-30B-A3B-Instruct自评,存在同源偏差(尤其30B变体与judge同源),建议引入人工或多个异构judge交叉验证。第五,论文未报告推理时延/成本,select_crop_search需要并行调外部图搜API,真实部署的端到端延迟未量化。

未来方向

作者明确:探索计算高效的pipeline、轻量架构、自动化LLM评估以减少人工依赖。基于成果可延伸:①把递归种子扩展循环推到更高跳数,自动生成k-hop递增的课程数据;②将解耦感知-探索范式迁移到长视频(目前≥10min仅占20%),解决长程时序推理;③引入多模态奖励(除正确性外奖励“视觉证据充分性”“检索效率”)替代纯二元稀疏奖励,缓解RL探索稀疏;④把select_crop_search扩展为更细粒度工具集(OCR、人脸、ASR),研究工具粒度与性能的权衡;⑤研究参数知识泄露的在线检测,动态剔除被“背答”的训练样本,保证训练信号持续纯净。

复现评估

代码已开源(https://github.com/Osilly/Vision-DeepResearch,仓库名Vision-DeepResearch与正文Video-DeepResearch不一致)。训练细节充分:32×H800 80GB、Megatron-LM、TP=4/CP=2/EP=8+序列并行、8万token上下文不做数据打包、3 epoch、micro-batch 1、global batch 64、学习率warmup到 $1\times10^{-5}$ 再衰减到 $5\times10^{-7}$、MoE辅助损失 $1\times10^{-6}$、容量因子2.0、FlashAttention+逐层激活检查点、每500步存Safetensors。数据合成依赖大模型(397B做轨迹、35B做验证),复现30K+7K需可观API/GPU成本。基准的200条人工标注需8名标注员3周+严格质检,难以快速复刻。Prompt模板(Fig.4-8)与工具接口(Table 6)完整公开。整体算力门槛高但方法学可复现,对中小团队属中等偏难。