← 返回 2026-07-17

UniVR:在视觉空间中思考的统一视觉推理框架 UniVR: Thinking in Visual Space for Unified Visual Reasoning

Zhongwei Ren, Yunchao Wei, Yao Zhao, Weibo Gong, Xiao Liu, Anran Wang, Xiangtai Li, Xiaojie Jin 📅 2026-07-14 👍 32 2026-07-22 18:54
GRPO 世界模型 多模态理解 强化学习 统一生成模型 视觉推理

首个无需语言监督、直接在视觉空间学习异构推理任务并配套 VR-X 基准的框架

前置知识

视觉空间推理(Visual Space Reasoning)

指模型直接以图像/视频的视觉信号作为推理和规划的载体,不去先把场景翻译成自然语言再做链式推理。给定一段图像序列 $x_{1:t}$ 和一条指令,模型直接建模下一帧的分布 $p(x_{t+1}|x_{1:t})$,从而预测任务执行过程中的状态转移,而不依赖密集的文本思维链或图像-文本配对。

本文的核心命题就是摆脱语言中介、在视觉空间原生地进行推理,理解这一概念才能看懂为什么作者要挑战文本推理范式并设计专门的奖励机制。

GRPO(Group Relative Policy Optimization)

DeepSeek-R1 提出并推广的强化学习方法。它对同一提示采样一组(group)候选输出,通过组内相对优劣(如两两比较的胜率)来估计基线,从而省去 PPO 中显式的价值网络。VR-GRPO 在此基础上改造奖励,使其适配多步视觉推理场景。

VR-GRPO 是 UniVR 的训练范式根基,只有先理解 GRPO 的组内相对优化机制,才能看懂 step-focal reward 为什么用方差定位关键子步骤、为什么用 pairwise 协议。

统一生成模型(Unified Generation Model, 如 Emu3.5)

采用 VQ-VAE 风格的自编码器,把图像、文本、视频统一编码到一个离散词表中,再用 next-token prediction 统一处理跨模态生成与理解。Emu3.5 是 UniVR 选用的 34B 基线,可生成变长图像序列,便于把所有异构任务压缩为同一格式。

UniVR 完全构建在统一生成架构之上,理解它如何把推理/规划/编辑任务统一成『指令+查询图+视觉轨迹』格式,是理解整体方法的前提。

JEPA 相似度(V-JEPA Similarity)

借助 V-JEPA 编码器把图像序列压缩到 1280 维潜在空间,再用带多项式核的最大均值差异(MMD)衡量生成序列与真值分布在潜在物理动力学上的距离,数值越低表示越贴近真实物理。它弥补了 VLM 评分依赖文本知识、难以察觉细粒度物理违反的缺陷。

VR-X 用 VLM 评分+JEPA 双指标评估,JEPA 是论文证明『物理一致性』的关键度量,理解它才能解读 Table 1 中不同方法的真实差距。

研究动机

当前主流 AI 模型主要从文本中获取世界知识并完成推理与规划,但文本作为抽象表示无法覆盖真实视觉世界中复杂的动力学、空间关系和物理规律。现有两条视觉推理路线都有硬伤:其一是 MLLM(如 Gemini-3、GPT-5)先生成文本思维链,再用生成模型(Nano Banana、GPT-Image)逐帧渲染,但文本抽象在精细的长时序任务里会出现逻辑断层和物理不一致——作者实测即便有 SOTA 文本推理+高保真渲染,模型在打结、叠衣服等分钟级任务里仍频繁失败(见 Fig.1、Fig.7);其二是视频生成或统一生成模型(如 Emu3.5、Bagel、Janus-pro),训练与推理仍严重依赖密集图像-文本配对,限制了视觉推理的规模化。Table 1 显示,统一生成模型在 VR-X 上的整体成功率仅徘徊在 15%~40% 区间,JEPA 分数比文本驱动方案差 2~4.5 倍,说明视觉空间推理仍是关键瓶颈。

本文的目标是作者希望构建一个能在统一视觉空间中、直接从纯视觉演示学习异构知识的框架,同时覆盖长时程复杂规划(分钟级精细操作,如打结、折衣、烹饪、机器人控制、导航)与一般视觉推理(视觉搜索、谜题、空间感知、图像编辑),全程不依赖密集文本推理链、不依赖任务特定启发式或图像-文本配对。更进一步,作者希望证明:强化视觉推理不仅提升 VR-X 上的任务表现,还能『反向增强』多模态理解能力,为更高效的世界模型奠定基础。配套目标还包括构建首个用于评估异构视觉推理的大规模基准 VR-X。

与已有工作不同的是,本文的独特切入点是『奖励设计层面』而非模型架构层面:之前 RL 工作(DDPO、ReFL、HPSv3、CLIP 类)主要优化视觉保真度、审美或图文一致性,针对单步正确性;而 UniVR 抓住『长程多步序列中局部物理违反会被全局评分掩盖』这一被忽视的痛点,提出 step-focal reward,主动用 CLIP 特征方差定位分歧最大、最易出错的关键子步骤,再对该窗口做精细评分。这与以往『全局打分』或『逐帧密度监督』截然不同,使模型无需文本配对也能学到逻辑连贯、物理一致的多步轨迹。

核心方法

整体直觉是:既然视觉是动物与人获取信息最直接的通道,那就让模型像人一样在脑中直接模拟任务执行和场景演化,而非借助语言转译。技术路线基于 Emu3.5-34B 统一生成模型,把所有任务统一成『查询图 + 文本指令 + 视觉推理轨迹』格式,用自回归 next-token prediction 直接建模下一帧分布 $p(x_{t+1}|x_{1:t})$。训练分两阶段:冷启动 SFT 用 310k 高质量样本让模型获得视觉推理先验;再用 VR-GRPO 做强化学习自主探索最优策略。关键在于奖励——VR-GRPO 同时使用全局奖励 $R_g$(评估整体任务完成度与视觉质量)和 step-focal 奖励 $R_s$(聚焦最易错的子步骤),用 $R_{reason}=R_g-\lambda|R_g-R_s|$($\lambda=2.0$)融合,迫使模型不能走推理捷径。

核心创新是 VR-GRPO 中的 step-focal reward:作者先观察到在线 VLM 评分器(Qwen3-VL-30B)虽能正确评估终端成功和像素清晰度,却常常漏掉长时序中段的物理违反和逻辑断层(Fig.6 给出衣架穿透衣物、倒酒动力学错误、纸巾盒抖动等反例)。为精准定位这些『高危子步骤』,对 K 条 rollout 轨迹用 CLIP 提取每帧特征 $z_k(t)\in\mathbb{R}^d$,计算各时刻的轨迹间方差 $\sigma(t)=\sqrt{\frac{1}{K}\sum_{k=1}^{K}\|z_k(t)-\bar z(t)\|_2^2}$,方差峰值 $t^*=\arg\max_t\sigma(t)$ 表示模型推理路径分歧最大处,于是取 $[t^*-W/2, t^*+W/2]$(默认 $W=4$)窗口做两两比较评分。这与现有 RLHF/DDPO 只关心最终奖励或单步密度的本质区别在于:它显式建模『不确定性最大处即最易错处』,无需任务规则即能保持中段连贯。

方法步骤详情

完整流程四步:(1) 冷启动数据构造——从 16 个来源(AgiBot、Action100M、EgoDex、VisualCoT 等)采样 1.5M 原始样本,用 PySceneDetect 在 0.27 FPS 做场景感知采样,经 SigLIP2 去重和 VLM 过滤,再用 Qwen3.5-397B 合成问答并标注查询图与关键帧,筛出 310k 冷启动样本,过滤率近 80%;SFT 在 32 GPU 上训练 10k 步、学习率 $5\times10^{-4}$、序列上限 15000。(2) RL 数据筛选——用冷启动模型挑出约 3k 高难度样本(2k 长程规划+1k 通用推理)。(3) VR-GRPO 训练——verl 框架、rollout 8、在线 Qwen3-VL-30B 评分器部署在额外 8 GPU、序列上限 20k token、学习率 $1\times10^{-5}$、共 250 步。(4) 奖励计算——按 $R_{reason}=R_g-\lambda|R_g-R_s|$($\lambda=2.0$)融合,并用 pairwise 协议替代绝对标量以缓解 VLM 评分偏置。

技术新颖性

新颖性体现在三方面:其一,首次证明无需语言监督即可在统一视觉空间学习从长程规划到一般认知推理的异构任务,打破了统一生成模型对密集图文配对的依赖;其二,step-focal reward 把『不确定性定位』这一思想首次引入多步视觉推理的 RL 训练,方差峰值自动锁定错误高发区,与既有的全局/单步奖励形成本质差异,并通过 $R_g-\lambda|R_g-R_s|$ 这种惩罚式融合直接抑制 reward hacking;其三,VR-X 是首个覆盖六类异构任务、用 VLM 评分(Spearman 相关约 0.85)+JEPA 双指标、且评估纯视觉协议的综合基准,填补了既有 benchmark 偏重视觉质量或文本匹配的空白。

Overview of UniVR architecture.
Figure 2: Overview of UniVR architecture.
The proposed Visual Reasoning GRPO (VR-GRPO).
Figure 3: The proposed Visual Reasoning GRPO (VR-GRPO).
Overview of VR-X benchmark.
Figure 4: Overview of VR-X benchmark.

实验结果

核心发现:(1) VR-X 主对比(Table 1):UniVR 整体 58.2,比 Emu3.5 的 39.8 提升 +18.4,Robot 达 68.0,以 34B 超越 Gemini-3 Pro(67.1)并接近 Gemini-3 Pro+Nano Banana 2(66.1);JEPA 仅 13.01,仅次于 Gemini-3 Pro 的 11.07。(2) 消融(Table 2b):单独全局奖励在长程规划上反从 48.2 跌到 45.7、JEPA 恶化到 22.30,证明 reward hacking;加 step-focal 后协同提升到 63.8/55.4/13.01,pairwise 再升至最佳。(3) 多模态反哺(Table 2a):MMMU 0.337(+0.045)、MME(P) 799.3(+18.2)、MM-Vet 35.6(+7.6),全面优于 Emu3.5。(4) 外推:WorldArena/Uni-MMMU/RBench 分别 +9.2/+25.7/+16.5。(5) 时序(Table 5):>60s 序列达 45.6,比 Emu3.5 +23.9。

Comparison on VR-X.
Table 1: Comparison on VR-X.
Ablation studies.
Table 2: Ablation studies.
Data composition.
Table 4: Data composition.
Performance across different time span.
Table 5: Performance across different time span.
Analysis of the Visual Reasoning Reward.
Figure 6: Analysis of the Visual Reasoning Reward.
Comparison with Gemini and Emu3.5.
Figure 7: Comparison with Gemini and Emu3.5.
More visualization of UniVR.
Figure 8: More visualization of UniVR.
查看结构化数据
任务指标本文基线提升
VR-X 整体(Overall) VLM 评分(0-100) 58.2 Emu3.5: 39.8 +18.4
VR-X JEPA 物理一致性 JEPA 相似度(↓越好) 13.01 Emu3.5: 33.62;Gemini-3 Pro: 11.07 相对 Emu3.5 改善 20.61,逼近最强 LMM+T2I 管线
VR-X 机器人操作(Robot) VLM 评分 68.0 Gemini-3 Pro: 67.1 +0.9,34B 超越顶级闭源管线
MMMU 多模态理解 准确率 0.337 Emu3.5: 0.292 +0.045
Uni-MMMU 外推测试 VLM 评分 54.4 Emu3.5: 28.7 +25.7
>60s 长时序任务 VLM 评分 45.6 Emu3.5: 21.7 +23.9

局限与改进

作者明确承认三方面局限:(1) 在 34B 规模上训练长视觉序列消耗大量算力(32 GPU SFT + RL + 额外 8 GPU 跑在线评分器),可及性受限;(2) VR-GRPO 虽用 step-focal 改善评估质量,但奖励仍依赖通用 VLM(Qwen3-VL-30B),其细粒度物理世界知识不足,Fig.6 也佐证仍存在漏判;(3) 视觉、文本、听觉推理如何最优协同仍是开放问题。我观察到的额外问题:JEPA 指标在通用推理子集上不适用,意味着对单步任务的物理评估尚无可靠自动度量;RL 数据仅 3k 样本、训练仅 250 步,规模化的鲁棒性尚未验证;评分器仍以 Qwen3.5-397B 为金标准,存在自评风险(虽用 pairwise 缓解);VR-X 的 1.8k 评估集相对仍偏小,可能对特定领域样本敏感。

独立分析的弱点

独立分析存在四个弱点及对应改进方向:(1) 奖励器仍偏文本中心——通用 VLM 难以察觉细粒度物理违反,改进方向是把 JEPA 这类潜在动力学度量或视频物理模拟器直接接入奖励回路,形成『物理原生』奖励。(2) 长时序性能仍弱——尽管 >60s 任务 +23.9,但绝对分 45.6 仍偏低,改进方向是把窗口 $W$ 与 $\lambda$ 自适应化、引入层级化 step-focal(多尺度不确定性),并探索 tree-search 式 rollout 替代固定 8 路采样。(3) 评估规模有限——VR-X 1.8k、RL 3k 样本,改进方向是引入更多具身场景(真实机器人、第一人称视频)并扩展 JEPA 到单步任务。(4) 计算成本高——32+8 GPU 全参数训练对社区不友好,改进方向是 LoRA/QLoRA、蒸馏到更小模型,或把评分器蒸馏成轻量专用网络。

未来方向

作者提出的方向包括:(1) 构建更强大、原生植根于视觉世界动力学的奖励系统,摆脱对通用 VLM 的依赖;(2) 探索视觉、文本、听觉推理的原生协同,迈向更通用、高效的世界模型。基于本文成果可延伸的研究有:把 step-focal reward 思想迁移到其他 RL+生成范式(如机器人策略学习、自动驾驶世界模型);用 JEPA 类潜在度量统一单步与多步评估,构建更全面的物理一致性 benchmark;研究统一生成模型中『视觉 CoT』与『文本 CoT』的最优融合配比;探索推理时扩展(test-time scaling)——如在视觉空间做 beam search/分支推理,把 step-focal 的不确定性信号用于推理期纠错。

复现评估

复现友好度中等偏上:代码、数据、模型将全部开源(论文末尾明确声明 all code, data, and models are open-sourced),训练超参数在 Table 3 完整列出(SFT:LR $5\times10^{-4}$、10k 步、序列 15000、batch 128;RL:LR $1\times10^{-5}$、250 步、$\lambda=2.0$、$W=4$);数据来源(Table 4)公开可追溯。主要障碍是算力——需 32 GPU 全参数训练 Emu3.5-34B,外加 8 GPU 部署 Qwen3-VL-30B 在线评分器,单组实验成本不菲;此外 PySceneDetect、SigLIP2、Qwen3.5 合成问答、VLM 过滤等数据管线流程长(Fig.5),完整复现冷启动数据需较高工程投入。冷启动过滤掉近 80% 样本,意味着需要从 1.5M 规模起步,社区复现门槛偏高。