← 返回 2026-08-18

超越视觉思维链:面向主动视频推理的内化视觉思考 Beyond Visual CoT: Internalized Visual Thinking for Proactive Video Reasoning

Xiaoyu Zhu, Xinke Deng, Suresh Taddewadikar, Arnab Kumar Mondal, Zhongyu Jiang, Ian Fasel, Joerg Liebelt 📅 2026-08-16 👍 7 2026-08-23 18:30
世界模型 后训练 多模态大模型 视频理解 高效推理

训练时预测未来视觉嵌入、推理时直接作答,精度持平或超越Visual CoT且延迟降5倍以上

前置知识

视觉思维链

Chain-of-Thought 在多模态领域的扩展:模型在给出最终答案前,先生成中间视觉产物(裁剪区域、草图、标注或完整的合成图像),再把它们作为条件参与后续推理。预测型 Visual CoT(如 Zebra-CoT、CoT-VLA)会先画出可能发生的未来帧再作答,直观地把模型的视觉想象外化到像素空间。

本文的核心动机就是质疑这种推理时显式生成图像的范式,理解其成本与收益结构是读懂全文的前提。

主动视频推理

区别于离线视频问答,模型只能观察部分视频就需及时预测:早期事件预测(EEP)要求在动作进行中(观测比例 0.1/0.3/0.5/0.7)就识别它,下一事件预测(NEP)要求在事件开始前约 1 秒预测即将发生什么。预测一旦迟到就失去价值,因此任务对推理延迟极其敏感。

论文全部实验(Ego-Exo4D、Ego4D、EPIC-KITCHENS-100 上的 EEP 与 NEP 共 6 个设置)都在这两个任务上展开,不理解任务设定就无法解读结果表格。

下一嵌入预测与JEPA

Joint-Embedding Predictive Architecture 一类自监督方法:不重建像素,而是让模型从可见上下文预测被遮挡内容在表征空间中的嵌入向量,如 I-JEPA 预测图像块表征、V-JEPA 预测视频时空表征。预测目标由编码器产生,通常施加 stop-gradient 阻止梯度回流到目标分支。

IVT 的核心辅助目标 $\mathcal{L}_{\text{pred}}$ 正是把 JEPA 思想搬进 MLLM 后训练,论文的方法设计、公式与相关工作讨论都围绕它展开。

Mixture-of-Transformers与专家路由

BAGEL-7B(约 14B 参数)采用的架构:同一 Transformer 层内为不同 token 类型配备独立的前馈网络专家,其余组件共享。本文的 MoE 变体按 token 类型确定性路由——理解 token 走理解专家、预测 token 走预测专家,不使用可学习 router;Dense 变体则让两类 token 完全共享解码器参数。

论文的关键消融之一是比较 Dense 与 MoE 两种架构下预测监督向语言推理的迁移效率,这决定了未来预测该不该直接改写语言参数。

流匹配

一类生成式建模目标:学习一个速度场,把噪声样本沿近似直线的路径输运到目标分布。修正流匹配在噪声 $Z^{(0)}$ 与目标 $Z^{(1)}$ 之间取插值点 $Z^{(\tau)}=(1-\tau)Z^{(0)}+\tau Z^{(1)}$,让模型预测目标速度 $V^\star=Z^{(1)}-Z^{(0)}$。BAGEL 的图像生成分支就是用它训练的。

论文对比直接特征回归与流匹配两种方式预测未来表征,发现最优目标取决于表征自身性质而非沿用生成分支的既有训练方式,这是方法设计层面最有意思的结论之一。

SFT后训练

监督微调:在预训练模型上用(输入,目标回答)对做极大似然训练,损失为答案 token 的负对数似然 $\mathcal{L}_{\text{text}}=-\frac{1}{T}\sum_j \log p_\theta(y_j\mid y_{<j},X_{\leq t},q)$。Answer-Only SFT 指只用文本目标、不加任何视觉预测监督的对照配置。

IVT 的推理路径与 Answer-Only SFT 完全相同,5 倍以上的延迟优势正来源于此;它同时也是所有消融实验的参照基线。

研究动机

多模态大模型普遍依赖视觉思维链(Visual CoT)做视觉前瞻:先在像素空间显式生成一张未来帧或中间图像,再把它重新编码后用于回答。这在主动视频推理场景中代价极高——作者在单块 NVIDIA B200 上实测,Answer-Only SFT 平均延迟仅 1.07 秒,Visual CoT 在早期事件预测上升至 6.56 秒(6.2 倍)、P95 达 8.72 秒;下一事件预测也达 6.55 秒(5.0 倍)。更糟的是收益不稳定:自生成未来帧在早期事件预测上只带来 +5.9% ROUGE-L、+17.9% CIDEr,在下一事件预测上 ROUGE-L 反而下降 0.8%;而把生成帧换成真实未来帧(oracle)可分别提升 +21.6% 和 +6.8%,说明瓶颈不在未来视觉信息没用,而在生成成本与保真度。纯文本思维链同样不行:用 Qwen3-VL-30B-A3B-Thinking 做教师蒸馏的 Text-CoT 反而让 Ego-Exo4D 上 ROUGE-L 从 28.8 掉到 24.6。文本推理还依赖语言先验、易幻觉视觉细节,与时空证据存在模态错配。

本文的目标是论文的核心问题是:多模态大模型能否在训练时学会视觉地思考,而在推理时无需显式生成视觉思维、直接高效作答?具体目标是设计后训练框架 IVT(Internalized Visual Thinking):利用无标注视频,让模型在训练中同时完成两件事——从已观察的视频前缀 $X_{\leq t}$ 预测未来帧的潜在嵌入(下一嵌入预测),以及生成对应的文本预测。未来嵌入提供稠密监督,迫使模型捕捉运动、物体状态转移、交互与潜在意图;推理时则完全复用 Answer-Only SFT 的计算路径,直接自回归产出答案,不合成、不重编码任何未来帧。作者要求该框架在 6 个数据集-任务设置上全部超越纯文本后训练,并在与 Visual CoT 相同底座、相同数据、相同评测协议下取得可比或更好的精度,同时把端到端延迟降低 5 倍以上。

与已有工作不同的是,已有工作的切入角度各有不同:JEPA 系列(I-JEPA、V-JEPA、V-JEPA 2)用下一嵌入预测做视觉表征学习,但不与语言推理耦合;统一理解-生成模型(Emu、Chameleon、Transfusion、BAGEL)把生成通路用于产出可见图像;Visual CoT(Zebra-CoT、CoT-VLA 等)把中间视觉当作推理时的显式产物,成本高。近期研究还发现给 MLLM 添加生成能力并不总能提升、甚至损害视觉问答性能。IVT 的独特之处在于重新定位了生成能力的价值:它的价值不在合成高质量图像,而在学习预测性表征——把预测性世界建模从推理时的显式操作内化为训练时的监督信号,相当于把 Visual CoT 的想象未来搬进模型内部表征。配合对目标表征、架构、视野、数据配比、课程、预测目标六个维度的控制变量研究,论文把一个模型改进上升为一套关于何时以及如何内化视觉推理的实用原则。

核心方法

直觉上,IVT 把画出未来变成想着未来:训练时强迫模型从已见视频预测未来帧的潜在表征,推理时这种能力已内化为表征,无需外化成像素。技术上,设观察视频前缀 $X_{\leq t}=(I_1,\dots,I_t)$、提示 $q$、目标回答 $y$,标准 SFT 优化 $\mathcal{L}_{\text{text}}=-\frac{1}{T}\sum_{j}\log p_\theta(y_j\mid y_{<j},X_{\leq t},q)$。IVT 增加辅助目标:目标编码器 $E_{\text{tar}}$ 把未来帧 $I_{t+h}$ 映射为 $M$ 个潜在 token $Z_h\in\mathbb{R}^{M\times d}$,模型在预测位置产生隐状态,经投影头 $P_\phi$ 得到 $\hat{Z}_h$。总损失 $\mathcal{L}_{\text{IVT}}=\mathcal{L}_{\text{text}}+\lambda_{\text{pred}}\mathcal{L}_{\text{pred}}$($\lambda_{\text{pred}}=1$),目标经 stop-gradient 截断梯度。推理时只走与 Answer-Only SFT 相同的自回归文本路径,无任何图像生成与重编码开销。

核心创新是把未来视觉状态从推理时生成的中间产物变成训练时的监督信号。关键洞察来自对照实验(Table 1):真实未来帧能大幅提升两个任务(早期事件预测 ROUGE-L +21.6%、CIDEr +43.4%),证明未来视觉信息本身极有价值;但自生成帧只恢复一小部分收益、在下一事件预测上完全无效,还带来 5-6 倍延迟。IVT 因此保留预测未来的监督需求,去掉渲染未来的推理成本。与 JEPA 的本质区别在耦合方式:理解 token 与预测 token 在同一 MLLM 内联合训练,视觉动力学监督直接塑造用于语言推理的表征;与统一生成模型的区别是生成通路从不产出可见图像。与显式 Visual CoT 的区别则被主实验直接证明:在 4/6 个基准上 IVT 反超 Visual CoT,说明内化不只是更便宜的近似,而是可能更优的形态。论文还把方法沉淀为六维设计准则(目标表征、架构、视野、数据配比、课程、预测目标),每一条都有控制变量实验支撑。

方法步骤详情

流程分五步。第一步选目标表征:对比 Flux-VAE 潜变量、DINOv2、SigLIP2(自适应/冻结),Flux-VAE 在两任务全部指标上最一致最优,故采用。第二步搭架构:Dense 让理解与预测 token 共享解码器参数,MoE 按 token 类型确定性路由到独立专家前馈网络。第三步定预测视野:1fps 采样,偏移集合 $\mathcal{H}_H=\{1,\dots,H\}$ 秒。第四步配数据:理解与预测样本按 1:1 打包进 batch(3:1、5:1 会后期停滞)。第五步选目标与课程:直接回归 $\mathcal{L}_{\text{reg}}=\frac{1}{KMd}\sum_{h}\|\hat{Z}_h-\mathrm{sg}(Z_h)\|_F^2$ 或流匹配,且必须与文本目标联合优化。最终主配置基于 BAGEL-7B:MoE 配 $H=3$、Dense 配 $H=1$,Flux-VAE 目标加流匹配、1:1 配比;AdamW $\beta_1=0.9,\beta_2=0.95$、学习率 $2\times10^{-5}$ 预热 2000 步、梯度裁剪 1.0、bfloat16、224-448 像素、共 2 万步,固定用于全部 6 个数据集-任务设置。

技术新颖性

技术新颖性体现在三点。其一,范式级:首次把下一嵌入预测作为 MLLM 后训练的联合目标并直接服务于前瞻性语言推理,弥合了 JEPA 式表征学习与指令微调两条独立路线,并证明这种联合必须贯穿整个后训练——联合训练比 Answer-Only SFT 高 12.6% ROUGE-L、26.3% CIDEr,而先预测后微调的两阶段课程每项指标都低于 SFT(ROUGE-L -6.5%),这是对先自监督再微调这一传统直觉的反例。其二,架构洞察:发现参数共享强度与预测不确定性存在交互——目标短而确定时 Dense 共享解码器最优($H=2$ 时 ROUGE-L 37.4 对 MoE 的 33.8),视野变长、预测变模糊时 MoE 分离更稳健(峰值在 $H=3$),为生成式监督该不该触碰语言参数给出了量化答案。其三,表征-目标联合设计:直接回归对 DINOv2 明显优于流匹配,而 VAE 潜变量两者皆可(终点 BERTScore 36.5 对 34.7),说明预测目标应由表征的尺度、维度与可预测性决定,而非沿用视觉生成分支原有的训练配方。

Three post-training paradigms for proactive video reasoning.
Figure 1: Three post-training paradigms for proactive video reasoning.

实验结果

七组发现。动机实验(Table 1):Visual CoT 均值延迟从 1.07 秒升至 6.56 秒(6.2 倍),EEP 指标 +5.9%~+40.6%,NEP ROUGE-L 反降 0.8%;oracle 真实未来帧两项任务全面提升(+21.6%/+6.8%)。目标表征(Figure 2):Flux-VAE 四指标最优,DINOv2 次之。数据配比(Figure 3):3:1、5:1 早期领先但 12-18k 步后停滞,1:1 持续上升,20k 步 ROUGE-L 34.5、METEOR 27.4、CIDEr 2.02 全面最佳。预测目标(Figure 4):直接回归对 DINOv2 占优,VAE 上接近。课程(Table 2):联合训练较 SFT 提升 12.6% ROUGE-L、26.3% CIDEr,两阶段反而低于 SFT。架构与视野(Figure 5):Dense 峰值 $H=2$(37.4 ROUGE-L),MoE 在 $H=3$。主结果(Tables 3-5):IVT 在全部 6 个设置 4 项指标超 SFT,4/6 设置超 Visual CoT 并包揽 3 个 NEP 冠军(Ego-Exo4D NEP 48.5 对 42.6,EPIC NEP 49.1 对 42.8),NEP 平均 ROUGE-L 从 45.9 提至 49.7,延迟降 5 倍以上;Ego4D 与 EPIC 的 EEP 仍落后 Visual CoT 1.3、1.2 点,整体不及 Qwen3-VL-8B(37.0 对 33.3)。

Accuracy-efficiency trade-off of Visual CoT.
Table 1: Accuracy-efficiency trade-off of Visual CoT.
Joint optimization is more effective than sequential training.
Table 2: Joint optimization is more effective than sequential training.
Results on the full Ego-Exo4D validation set.
Table 3: Results on the full Ego-Exo4D validation set.
Results on the full Ego4D validation set.
Table 4: Results on the full Ego4D validation set.
Results on the full EPIC-KITCHENS-100 validation set.
Table 5: Results on the full EPIC-KITCHENS-100 validation set.
Comparison of different target representations.
Figure 2: Comparison of different target representations.
Effect of the understanding-to-prediction data-mixture ratio on Ego-Exo4D early-event prediction.
Figure 3: Effect of the understanding-to-prediction data-mixture ratio on Ego-Exo4D early-event prediction.
Comparison of predictive objectives on Ego-Exo4D early-event prediction.
Figure 4: Comparison of predictive objectives on Ego-Exo4D early-event prediction.
Interaction between decoder architecture and prediction horizon on Ego-Exo4D early-event prediction.
Figure 5: Interaction between decoder architecture and prediction horizon on Ego-Exo4D early-event prediction.
查看结构化数据
任务指标本文基线提升
早期事件预测(Ego-Exo4D 验证集,top-1) ROUGE-L / CIDEr IVT (MoE):33.3 / 1.74 Answer-Only SFT:28.8 / 1.40;Visual CoT:32.7 / 1.69 较 SFT +15.6% ROUGE-L,较 Visual CoT +0.6 ROUGE-L
下一事件预测(Ego-Exo4D 验证集,top-5) ROUGE-L / CIDEr IVT (MoE):48.5 / 2.75 Answer-Only SFT:46.3 / 2.59;Visual CoT:42.6 / 2.22 较 SFT +4.8%,较 Visual CoT +13.8% ROUGE-L
早期事件预测(Ego4D 验证集,top-1) ROUGE-L IVT (Dense):34.8 Answer-Only SFT:33.3;Visual CoT:36.1 较 SFT +4.5%,落后 Visual CoT 1.3 点
下一事件预测(Ego4D 验证集,top-5) ROUGE-L IVT (Dense):52.7 Answer-Only SFT:51.9;Visual CoT:52.2 较 SFT +1.5%,为该设置最佳
早期事件预测(EPIC-KITCHENS-100 验证集,top-1) ROUGE-L IVT (MoE/Dense):39.0 Answer-Only SFT:36.5;Visual CoT:40.2 较 SFT +6.8%,落后 Visual CoT 1.2 点
下一事件预测(EPIC-KITCHENS-100 验证集,top-5) ROUGE-L IVT (MoE):49.1 Answer-Only SFT:45.5;Visual CoT:42.8 较 SFT +7.9%,较 Visual CoT +14.7%
推理效率(B200 单卡,每样本端到端延迟) 平均/P95 延迟 IVT 与 Answer-Only SFT 同路径(均值约 1.1-1.3 秒量级) Visual CoT:6.56 秒均值 / 8.72 秒 P95(EEP) 端到端延迟降低超过 5 倍

局限与改进

作者承认的局限:外部基线(LLaVA-NeXT-Video、VideoLLaMA3、Qwen2.5-VL/Qwen3-VL)底座与训练配方不同,只能作参考而非严格对照,IVT 整体仍落后 Qwen3-VL-8B;预测视野限于短程($\tau_a=1$ 秒),长程预测留作未来工作;下一事件预测需用 Top-5 召回,未来多解性未真正解决;两个 EEP 基准上仍输 Visual CoT。我的观察:其一,评测全靠 ROUGE-L/METEOR/CIDEr/BERTScore 文本重叠指标,无法衡量预测的物理合理性与因果正确性,押中动词-名词组合不等于推对了世界演化;其二,延迟只在单块 B200 上测,边缘设备表现未知,且 1:1 数据配比使每步训练成本约为纯文本 SFT 的两倍,论文未报告训练侧算力对比;其三,Flux-VAE 最优的结论依赖所选编码器集合,换底座是否成立未验证;其四,Text-CoT 全面退化(Ego-Exo4D EEP 从 28.8 跌至 24.6)只用单一教师观察过,缺乏对失败机制的分析。

独立分析的弱点

独立分析四个弱点。第一,文本重叠指标可能系统性误判推理质量:ROUGE-L 对同义改写不敏感,也无法区分恰好押中动词-名词组合与真正理解场景动态,改进方向是引入 LLM-as-judge 或针对物理合理性的人工评估,以及报告动词/名词分别的准确率。第二,短程视野限制应用价值:1 秒预测窗口对机器人抓取、自动驾驶等需要多秒预判的场景不够,改进方向是分层预测——先用语义类目标(DINOv2)做长视野意图表征、再用动力学类目标(VAE)做短视野细化,或对不确定场景自适应调整 $H$。第三,结论外部效度依赖 BAGEL-7B:该底座的 Mixture-of-Transformers 结构本身就带理解/生成分离倾向,Dense 与 MoE 的优劣结论可能不可迁移到 LLaVA、Qwen-VL 等单一解码器架构,改进方向是在异构底座上复验架构-视野交互。第四,预测性监督可能放大多模态幻觉——模型学会生成合理的未来而非正确的未来,而流匹配这类生成式目标天然偏好多样性,改进方向是加入困难负样本做对比式预测监督,或对预测嵌入做置信度校准后再与语言目标耦合。

未来方向

作者提出的方向:把 IVT 扩展到长程预测,处理依赖语义目标与程序性知识的多秒级预期;与流式视频的何时响应问题(如 ProactiveVideoQA 一类基准)结合,让模型同时决定预测内容与响应时机;继续压缩推理路径以满足主动推理对延迟的苛刻要求。基于成果可延伸的方向:其一,与强化学习结合,用预测嵌入与实际未来表征的一致性作为过程奖励,可能同时修复 Text-CoT 退化问题;其二,做动作条件化预测,接入机器人操作闭环,与 CoT-VLA 的显式视觉子目标形成对照实验;其三,预测视野与预测 token 数 $M$ 的自适应化,根据场景不确定性动态分配预测预算;其四,检索式或生成式负样本训练,缓解合理但不真实的未来幻觉;其五,把视觉预测监督蒸馏进 2B 级小模型,验证该范式在边缘设备上的可部署性;其六,从理论上解释为何重建导向的 VAE 潜变量优于语义特征(信息密度、尺度归一化还是维度冗余),指导目标编码器的系统设计。

复现评估

复现难度中等偏高,主要障碍是 Apple 未开源代码与训练数据管线。有利条件:三个数据集全部公开(Ego-Exo4D、Ego4D、EPIC-KITCHENS-100 官方划分;预处理后 EEP 训练集分别约 22.4 万、8.4 万、26.9 万条);底座 BAGEL-7B 与目标编码器 Flux-VAE、DINOv2、SigLIP2 均可公开获取;超参数披露完整——AdamW $\beta_1=0.9$、$\beta_2=0.95$、零权重衰减,学习率 $2\times10^{-5}$ 预热 2000 步,梯度裁剪 1.0,bfloat16,1fps 采样、224-448 像素,共 2 万步,消融基于 200 条 Ego-Exo4D 验证子集。不利条件:未说明训练总算力,14B 级模型加双目标联合训练估计需 8 张 A100/H100 级多卡数天;视频预处理(EEP 观测比例 0.1/0.3/0.5/0.7、NEP 1 秒切分、标签对齐)需自行复刻;延迟测量需 B200。建议先在小规模 Ego-Exo4D 子集上复现 Figure 3 的数据配比实验,验证管线后再扩展到全部设置。