并行管解码:面向视频的高效生成式时空定位 Locate Anything in Videos: Rethinking Efficient Generative Spatio-Temporal Video Grounding
把时空管解码深度压到固定1+1轮,延迟降79倍、吞吐升92倍且精度更优。
前置知识
时空视频定位(STVG)
给定一段视频和一条指代表达(如「递三明治的摊主」),模型需同时输出事件发生的时间区间 $[t_s, t_e]$ 和该区间内每个时刻目标实体的边界框,二者合成时空管。它比图像定位难在需要跨帧一致定位,比纯时序定位难在每帧都要给出空间位置。
这是本文要解决的任务本身,论文讨论的四种解码范式的串行深度 $4+7T$、$1+T$、$1+1$ 全部以管长 $T$(框数)为变量定义。
自回归解码与串行解码深度
自回归解码逐 token 生成,后续 token 条件在已生成内容上;串行解码深度指产出完整输出所需的依赖生成轮数。深度越大延迟越高,且早期错误会沿条件链传播。量化 token 与块解码都是在压缩这个深度。
论文的核心效率指标 TCL(管完成延迟)和 BPS(每秒框数)直接由解码深度决定,理解深度从 $4+7T$ 到 $1+1$ 的推导才能读懂效率实验。
多 token 预测与块解码(MTP)
MTP 让模型一次前向并行预测多个 token 而非逐个生成。块解码把一个语义单元(如一个框的 7 个 token)作为原子块,块内用 占位并施加双向注意力联合预测。LocateAnything 首次将其用于框坐标,但块与块之间仍保持因果顺序。
PTD 建立在块解码之上,其双形式训练(NTP+MTP 单次前向联合优化)与块内双向注意力都继承自这条技术路线,本文的差异点在块与块之间的关系。
GRPO(组相对策略优化)
一种 RL 后训练方法:对同一输入采样一组候选响应,用组内相对奖励作为优势信号做策略梯度,无需价值网络。本文用它做定位感知优化,奖励为时间 $tIoU$ 与空间 $GIoU - L1$ 之和,并按组内奖励方差筛选训练样本。
主结果中 GRPO(PTD) 相对 SFT(PTD) 的提升(如 VidSTG declarative mtIoU 从 50.0 到 53.7)全部来自这一阶段,Table 8 的奖励消融也围绕它展开。
IoU 家族评估指标
交并比衡量预测与真值的重叠程度。本文用到:$tIoU$(时间区间 IoU)、$vIoU$(整条时空管的视频 IoU,要求时间与空间同时对才高)、$mvIoU$(其均值)、$GIoU$(广义 IoU,对不重叠情形也给梯度)。@0.3/@0.5 表示达标阈值。
论文所有精度指标(mtIoU、mvIoU、vIoU@0.3/@0.5)和两个 GRPO 奖励分量都由这些量构成,不理解它们无法解读实验表格。
研究动机
时空视频定位(STVG)要求模型同时回答事件何时发生与目标实体在每个时刻位于何处。现有 MLLM 方法把这条时空管序列化成自回归坐标流:未量化文本坐标可能被 tokenizer 拆成多个 token(例如坐标 512),量化后每个框仍需逐个生成 7 个 token,一段含 $T$ 个框的管需要 $4+7T$ 轮串行解码,解码深度和延迟随管长线性增长,论文实测未量化解码完成一条管需 31.6 秒。更隐蔽的代价是精度:把每个框条件在已生成坐标历史上,早期错误会沿轨迹传播,注意力逐渐从视频证据漂移向模型自身输出。为绕开这一开销,SpaceVLLM、Bridge-STG、DEViL、STVG-R1 等竞争方法把密集空间定位外包给专用空间解码器、开放词表检测器或检测-跟踪管线,牺牲了统一的生成接口;而保留原生 token 接口的 LLaVA-ST、STVG-o1 则继承了解码扩展成本。这一「要么慢、要么不统一」的困境是本文的出发点。
本文的目标是本文的目标是设计一种保持 MLLM 原生生成接口的高效 STVG 范式:把管生成分解为一次时间块解码加一次全空间块并行解码,使串行解码深度固定为 $1+1$ 轮、与管长 $T$ 无关——更长的轨迹只增加并行解码宽度而不增加解码轮数。同时要求效率提升不以精度为代价:以紧凑的 4B 骨干(Qwen3-VL-4B)在 VidSTG、HC-STVG 上达到或超过 7B 竞品,在管完成延迟降低 79 倍、空间解码吞吐提升 92 倍的同时定位精度同步提高;此外让学到的定位能力零样本迁移到时序定位、证据型 VideoQA 和指代视频目标跟踪,验证范式本身的通用性。
与已有工作不同的是,已有高效解码工作只走了一半:量化 token 把每个值压成一个 token($4+7T$ 轮),LocateAnything 等块解码把单个框作为原子预测块($1+T$ 轮),但块与块之间仍是因果依赖,长轨迹仍需逐块生成。本文的独特切入是指出轨迹级依赖并非 STVG 任务的内在需求——一旦时间区间确定,时刻 $t_i$ 的正确框由查询和该时刻的视觉内容决定,与此前生成了什么框无关。基于这一结构性观察,作者提出 Parallel Tube Decoding,并配套设计 Decoupled Block Attention,在注意力层面显式删除跨框依赖、保留共享多模态证据,从而首次实现真正与管长无关的并行管生成,并把删除依赖这件事本身转化为精度收益,而非效率与精度的权衡。
核心方法
直觉上,管生成可以两段化:先全局判断事件何时发生,再让每个时刻独立回答目标在哪——两者之间不需要互相参照。技术上,模型基于 Qwen3-VL-4B,词表扩充 1,001 个空间坐标 token(归一化坐标 $[0,1000]$)和 100 个离散时间 token,时间 token 与视频 patch 交错以提供时间锚点。输出分解为一个时间块(4 token)和每时刻一个空间块(7 token)。训练采用双形式策略:每个样本同时监督 NTP 序列(保持因果生成)和 MTP 序列(结构化块预测),在共享上下文后单次前向联合优化 $\mathcal{L}_{SFT} = \mathcal{L}_{NTP} + \mathcal{L}_{MTP}$。推理时第一轮解码时间块,随后按预测区间直接实例化时间锚点,所有空间块一轮并行解码。最后用定位感知 GRPO 继续优化:时间奖励取区间级 $tIoU$,空间奖励在时间交集上取 $GIoU$ 减 $L1$ 惩罚。全程 LoRA rank 32,SFT 约 90K 样本,GRPO 用组内方差筛选的 16K 样本,视频 2 FPS、最多 64 帧。
核心创新是 Decoupled Block Attention。形式化地,设 $P$ 为共享多模态前缀(视频、指代表达、已预测的时间块),管预测分解为 $p(B_{s:e} \mid P) = \prod_{i=s}^{e} p(B_i \mid P, \langle t_i \rangle)$,其中时间锚点 $\langle t_i \rangle$ 在时间区间确定后直接实例化而非自回归生成。注意力设计组合三种机制:NTP 序列用标准因果注意力保留自回归能力;每个 MTP 块内部用双向注意力使定位单元被联合预测;时间条件空间块之间则完全无注意力连接——每个块只能看到共享前缀而看不到其他空间块。这与 Sequential Block Decoding(含 LocateAnything)的块间因果注意力有本质区别:后者生成越长序列仍需越多依赖轮次,且注意力随生成进程从视频漂移向自身历史。删除跨块依赖既解锁单轮并行,又阻断错误传播,是效率与精度同时提升的根源。
方法步骤详情
第一步,输入表示:视频按 2 FPS 采样、最多 64 帧,每个时间 patch 前缀时间 token $\langle t_i \rangle$;空间坐标量化到 1,001 个 bin,新 token 从语义相近词嵌入初始化。第二步,SFT 双形式训练:同一序列构造成 NTP 与 MTP 两种目标,MTP 中时间块补 到块大小 7,各块以 提示并行预测,两目标单次前向联合优化,学习率 $2 \times 10^{-5}$,主模型训 2 个 epoch。第三步,PTD 推理:第一轮自回归解码出时间块;第二轮对 $[t_s, t_e]$ 内每个时刻直接实例化锚点加 5 个 ,一轮并行解码出全部空间块,串行深度恒为 $1+1$。第四步,定位感知 GRPO:SFT 模型每样本采 8 个候选,按 $tIoU$/$vIoU$ 组内方差筛出 16K 样本;时间奖励 $R_{temp} = tIoU([\hat{t}_s, \hat{t}_e], [t_s, t_e])$,空间奖励 $R_{spat} = \frac{1}{|I|}\sum_{t_i \in I}\left[ GIoU(\hat{b}_i, b_i) - \|\hat{b}_i - b_i\|_1 \right]$($I$ 为时间交集),总奖励 $R = R_{temp} + R_{spat}$;学习率 $5 \times 10^{-6}$、$\beta = 0.04$、温度 0.9。
技术新颖性
新颖性体现在三个层面。解码形式学层面:论文首次系统对比 STVG 的四种解码范式——未量化 token、量化 token($4+7T$ 轮)、序列块解码($1+T$ 轮)、并行管解码($1+1$ 轮)——把解码深度作为独立于模型规模的效率维度来研究,并给出 TCL/BPS 两个 Wall-clock 指标。注意力机制层面:Decoupled Block Attention 是首个在结构化块生成中显式移除跨块因果依赖的设计,与多 token 预测和 LocateAnything 的因果块序形成清晰对照,并以 history-correction 干预实验证明删除依赖本身就是精度收益来源。优化层面:定位感知 GRPO 将时间 $tIoU$ 与空间 $GIoU{-}L1$ 组合成互补奖励,且空间奖励只在时间交集上评估,避免与时间奖励重复监督同一区域;相比 STVG-o1/STVG-R1 的同类强化学习做法,它服务于并行形式而非序列形式。此外,双形式联合训练让同一 checkpoint 同时支持自回归与并行两种推理模式,这是后续零样本迁移能力的基础。
实验结果
解码范式对比(Table 1):逐步删除串行依赖单调改善效率与精度——TCL 从 31.6s 降至 9.1s(量化)、1.0s(块解码)、0.4s(PTD,79 倍),BPS 从 0.5 升至 45.9(92 倍),declarative mtIoU 同步从 42.8 升至 47.5。延迟随管长变化(Figure 4a):框数 8 到 64 时 PTD 仅从 0.33s 增至 0.40s,块解码从 0.72s 涨到 6.18s。错误传播分析(Figure 4b,c):块解码注意力从视频漂向历史文本而 PTD 保持视频注意力;把错误框 $B_i$ 替换为真值后,邻近后续框提升最大并随解码距离衰减。主结果:VidSTG 上 GRPO(PTD) 达 declarative mtIoU 53.7 / mvIoU 38.3、interrogative 52.2 / 32.4,8 项指标 7 项领先,以 4B 超过 7B 的 Bridge-STG(52.6/37.2);HC-STVG v1/v2 mvIoU 45.6/43.6(+1.5/+1.1),vIoU@0.3 均最佳。零样本迁移:Charades-STA mIoU 52.4(+4.7)、R@0.3 78.9;ActivityNet mIoU 44.6(+9.1);ReXTime mIoU 47.8(+15.6,超微调 VideoChat-R1.5 +2.0);配 SAM2/SAM3 在 Ref-DAVIS 达 81.9/82.9,超微调过的 Molmo2-4B +8.4。奖励消融(Table 8):时间奖励把 mvIoU 从 34.9 提至 37.4,双奖励达 38.3。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 时空定位(VidSTG,declarative) | mtIoU / mvIoU | 53.7 / 38.3(Qwen3-VL-4B,GRPO+PTD) | Bridge-STG(Qwen3-VL-7B)52.6 / 37.2 | +1.1 / +1.1,且 8 项指标中 7 项领先,4B 胜 7B |
| 时空定位(HC-STVG v1) | mvIoU / vIoU@0.3 | 45.6 / 73.8 | STVG-o1(Qwen2.5-VL-7B)44.1 / 73.3 | +1.5 / +0.5,v2 上 mvIoU 43.6(+1.1) |
| 解码效率(VidSTG 管生成) | TCL(管完成延迟)/ BPS(每秒框数) | 0.4s / 45.9 | 未量化自回归解码 31.6s / 0.5 | 延迟降低 79 倍,吞吐提升 92 倍 |
| 零样本时序定位(Charades-STA) | mIoU / R@0.3 | 52.4 / 78.9 | STVG-R1-7B mIoU 47.7 / R@0.3 73.2 | mIoU +4.7 |
| 零样本时序定位(ActivityNet Captions) | mIoU | 44.6 | VideoChatR1.5-7B 35.5 | +9.1 |
| 零样本证据型 VideoQA(ReXTime) | IoU 均值 | 47.8(答案准确率 73.1) | 最强零样本 GraphThinker 32.2 | +15.6,另超微调 VideoChat-R1.5(45.8)+2.0 |
| 零样本指代视频目标分割(Ref-DAVIS,配 SAM2) | J&F | 81.9(配 SAM3 达 82.9) | Molmo2-4B(在该数据集微调过)73.5 | +8.4;Ref-YT-VOS +2.6、ReasonVOS +0.2 |
局限与改进
作者承认的局限:空间上,目标被遮挡后需要恢复身份、或目标小且快速移动时框会不精确;时间上,视觉边界模糊的短暂状态转换会导致区间外扩或提前结束。更结构性的约束是现有 STVG 基准都假设单一连续区间和单一空间管,多段离散事件、相机运动导致的暂时出视野、同一查询的多个实例均未覆盖,训练数据也局限于 VidSTG 与 HC-STVG 约 90K 样本。我的补充观察:其一,时间块是单点故障,区间预测错误则所有并行空间块整体失效,而空间奖励只在时间交集上计算,对错误区间的样本几乎无法提供修复信号;其二,并行解码假设各帧框条件独立,放弃了自回归可用的时间一致性先验,遮挡重现场景恰是其软肋(ReasonVOS 仅 64.7);其三,1,001 bin 量化的坐标分辨率约为图像宽度的千分之一,极小目标受限;其四,64 帧上限与单实例假设限制了长视频与多目标扩展;其五,79 倍延迟数字排除了 prefill 时间,端到端体感收益会小一些。
独立分析的弱点
独立分析四点弱点。一是时间-空间级联的结构性风险:$1+1$ 两段式中时间块不可撤销,错误区间下所有并行空间框一起错,且 GRPO 空间奖励只在交集上评估,对错误区间的样本几乎无梯度。改进方向:预测多个候选区间并按置信度加权,或在奖励中加入区间外惩罚项。二是删除跨帧依赖是一把双刃剑:对需要运动连续性与遮挡后重识别的目标,相邻帧框不再互相约束,ReasonVOS 上 64.7 的成绩与专用跟踪系统仍有差距。改进方向:以极低成本引入跨块运动先验,例如把前一帧框作为可选上下文而非硬依赖,或对块间施加轻量一致性正则。三是量化坐标分辨率受限,1,001 bins 对细粒度小目标不足,可考虑混合离散-连续回归头。四是训练管线复杂:GRPO 每样本 8 次 rollout 加组内方差筛选,工程与算力成本高,小团队难以复现,可探索用更廉价的 DPO 式偏好对替代。五是评测集中于框级指标,缺乏对轨迹时间平滑度等用户可感知质量的度量。
未来方向
作者明确提出两个方向:把 PTD 扩展到多时间段、多实例的更通用定位设定,并把训练数据扩展到更广的视频域、实体、事件与交互类型,以摆脱当前仅靠 VidSTG 与 HC-STVG 的数据瓶颈。在此基础上可以延伸:把「先全局时间块、再并行空间块」的骨架推广到其他需要结构化输出的任务,如文档版面解析、多目标全景分割、医学影像时序标注;研究流式场景下时间区间的增量更新与空间块的滚动并行解码;用轻量跨块注意力在保持并行度的前提下恢复时间一致性;把框输出升级为端到端掩码生成,省去 SAM2/SAM3 级联;以及在更大骨干和全参数微调下检验 $1+1$ 解码深度的收益是否随模型规模放大,并与投机解码、KV 缓存优化等系统级手段叠加。
复现评估
复现条件较好。代码在 GitHub(mbzuai-oryx/ParallelTubeDecoding)开源并有项目页;骨干为公开的 Qwen3-VL-4B,训练用 LoRA rank 32 而非全参数,显著降低算力门槛;SFT 数据全部公开(VidSTG、HC-STVG-v1/v2 训练集约 90K 样本);GRPO 的 16K 样本构造准则写得具体——SFT 模型每样本采 8 个候选,按 $tIoU$/$vIoU$ 组内方差筛选,可照做。效率实验环境明确:单张 64GB AMD Instinct MI210、BF16、PyTorch 2.7 + ROCm 6.3、batch size 1,解码时间从首 token 起算并同步 GPU。复现精度结果估计需要单张 64GB 级 GPU(A100/H100 可替代),主要工程难点在 GRPO 阶段的 rollout 采样与奖励评估管线;评测协议沿用标准 tIoU/vIoU 阈值,对照公平。总体难度中等,研究生级别的工程投入即可尝试复现主结果。
论文图表
以「递三明治的摊主」为例对比四种解码范式:未量化 token 解码(31.6s、0.5 BPS)、量化 token 解码($4+7T$ 轮、9.1s、1.5 BPS)、序列块解码($1+T$ 轮、1.0s、8.8 BPS)与 PTD($1+1$ 轮、0.4s、45.9 BPS),并图示时间块加并行空间块的输出结构。
一图概括全文核心论点:串行依赖逐级删除如何同时转化为 79 倍延迟下降、92 倍吞吐提升和精度提升,是理解论文动机与贡献的入口。
两组失败案例:上例中短暂状态转换(谁牵着穿黑衣成年人的手)边界视觉模糊导致预测区间偏移;下例中红色冲浪板等小目标加上快速运动导致空间框不精确。绿色为真值、蓝色为 PTD 预测。
界定方法的失效边界:时间上模糊的状态转换、空间上遮挡后身份恢复与小而快目标,与 Limitations 章节的自我分析直接对应。
对比骨干零样本基线(Qwen3-VL-4B/8B)、Gemini-2.5-Pro、LLaVA-ST、SpaceVLLM、DEViL、STVG-o1、Bridge-STG 等,以及本文 SFT(NTP)/SFT(PTD)/GRPO(PTD) 三个阶段:GRPO(PTD) 达 declarative mtIoU 53.7、mvIoU 38.3。
主结果表:展示 4B 模型在 8 项指标中 7 项领先、超过全部 7B 竞品,并区分收益来自 PTD 解码形式与 GRPO 优化两部分。
配 SAM2 后零样本 J&F:Ref-DAVIS 81.9、Ref-YT-VOS 72.8、ReasonVOS 62.1;换 SAM3 提升到 82.9/74.9/64.7。对照微调过的 Molmo2-4B(73.5/70.2/61.9)分别 +8.4/+2.6/+0.2,Qwen3-VL-4B 裸模型仅 44.4/32.1/26.5。
展示空间定位能力可即插即用地驱动分割传播器;提升幅度随任务推理难度递减,也侧面暴露跨帧一致性不足的弱点。