← 返回 2026-08-27

StreamPI:面向视觉-语言-动作模型的流式多模态时序建模 StreamPI: Streaming Multimodal Temporal Modeling for Vision-Language-Action Models

Zhe Liu, Jinghua Hou, Yuxiang Lu, Zhenya Yang, Xianzhe Fan, Junwei Luo, Junyi Li, Ruihua Han, Zhi Hou, Hengshuang Zhao 📅 2026-08-26 👍 19 2026-09-01 18:30
π0.5 时序建模 机器人操作 流式推理 视觉-语言-动作

指令锚定的流式时序建模让单帧VLA获得时序记忆,零新增参数全面超越π0.5

前置知识

VLA(Vision-Language-Action)模型

VLA 模型将视觉感知、语言理解和动作生成统一在一个端到端框架中,输入是图像观测和语言指令,直接输出机器人动作。代表作 RT-2、OpenVLA、π0、π0.5。π0 引入与 VLM 主干解耦的流匹配(flow-matching)动作头实现高频灵巧控制,π0.5 通过扩充数据多样性进一步提升泛化能力。

本文的全部工作都是围绕给 π0.5 这类单帧 VLA 添加时序建模展开的,不理解 VLA 的基本范式(单帧输入 → 动作输出)就无法理解论文要解决的核心矛盾。

KV Cache 与流式推理

Transformer 自回归推理时,每步只需编码新 token,历史 token 的 Key/Value 表示可缓存复用,避免重复计算。StreamingLLM 发现了 attention sink 现象,证明 LLM 可借助少量初始 token 加滑窗处理无限长序列;LongLoRA 证明 transformer 可外推到远超训练长度的序列。

StreamPI 的核心效率来源正是把 KV cache 从 NLP 借到机器人领域:每帧只编码一次,历史帧表示被缓存后通过交叉注意力被后续帧复用,推理成本不随时序跨度增长。

双向注意力 vs 因果注意力

双向注意力允许序列内所有 token 互相看见,适合编码器式的跨模态融合;因果注意力(下三角掩码)只允许每个位置看到自身及之前的位置,是自回归生成的标准结构,也是训练时防止未来信息泄漏的关键。块状因果掩码可以把两者组合:块内双向、块间因果。

StreamPI 的指令锚定时序建模本质上就是一个块状因果注意力掩码:每个(图像, 指令)对内部双向,时序单元之间因果,理解掩码设计是理解方法实现的前提。

动作分块

VLA 模型通常一次预测一段未来动作序列(action chunk,如 $a_1, a_2, \ldots, a_n$)而非单步动作,机器人执行完一段再观测推理下一段。这带来推理频率与执行频率解耦的问题:推理间隔越大,对时序建模的容错要求越高。

论文提出随机间隔训练正是为了适配动作分块的执行节奏:间隔 $\delta=5$ 意味着每 5 帧才推理一次,剩余时间留给动作执行,理解这一机制才能明白为何大间隔下的鲁棒性如此重要。

LIBERO 与 CALVIN 基准

LIBERO 是广泛使用的机器人操作仿真基准,含 LIBERO-Spatial/Object/Goal/Long 四个套件,各 10 个任务、每任务 50 次试验,以成功率计分,其中 LIBERO-Long 需要连续执行多个子任务、最考验长时程记忆。CALVIN 要求连续完成多达 5 个任务的长序列,以平均序列长度衡量。

论文除真机实验外的主要定量结果都在这两个基准上报告,需要知道各套件的难度定位才能解读 98.3% 对 96.9% 这类在高饱和区间内依然有意义的提升。

研究动机

以 π0 和 π0.5 为代表的最先进 VLA 模型都运行在单帧范式下:每个动作仅从当前一张图像预测,完全看不到历史观测。这带来两个硬伤。其一是没有时序记忆,像贝壳游戏(物体藏到杯子下后杯子被shuffle,机器人必须记住哪个杯子藏了东西)或抓取滚动中的物体这类任务,单帧观测在原理上就无法解决;其二是缺乏精确空间感知,例如把笔插入窄口瓶需要亚厘米级精度,单帧缺少运动视差和多帧结构一致性提供的深度线索。已有的补救方案是窗口式多帧输入,但把 K 帧拼进序列会让长度线性增长,推理延迟对实时控制不可接受,要么被迫换小骨干要么压缩 token,且视觉 token 越积越多会稀释指令 token 的影响,长时程下模型逐渐忘记任务目标。此外训练用规则采样帧序列,真机部署却是时间间隔不定的异步观测流,训练与部署存在系统性错配。

本文的目标是本文目标是给 π0.5 这样的强单帧 VLA 基础模型注入流式时序推理能力,同时满足四个约束:推理延迟不随时序跨度增长,即流式推理保持恒定开销;语言指令在整个任务执行期间作为持久语义锚不被视觉 token 稀释;训练阶段引入随机帧间隔扰动(区间 [3,7])以匹配真机异步部署中帧时刻不定的现实;完全不引入任何新参数,通过重构注意力掩码继承 π0.5 全部预训练权重,避免引入视频编码器带来的特征分布错位与视觉-语言表征污染,并天然支持单帧与多帧推理的灵活切换。

与已有工作不同的是,此前时序建模方案的共同缺陷是:要么对全部历史 token 做全注意力导致计算爆炸,要么在时序聚合时把视觉观测和语言指令解耦处理,造成长时程下的指令遗忘。StreamPI 的独特切入是把(视觉观测, 语言指令)对整体视为一个不可分割的原子时序单元 $u_t = (V_t, l_t)$:指令不是开头注入一次的静态前缀,而是每个时间步都与观测重新配对、重新融合的语义锚。配合随机间隔采样训练,论文同时攻克了计算开销、指令遗忘、训练-部署错配、表征污染四大挑战,而代价是零参数。

核心方法

直觉上,StreamPI 认为'看什么'和'记什么'应该绑定:每帧观测连同任务指令一起构成一个时间单元,单元内部双向注意力做充分的图文跨模态融合,单元之间因果注意力保持自回归的流式结构。这样历史帧的融合表示 $h_{t_0}$ 编码进 KV cache 后,每个新帧只需编码自身并与缓存历史做交叉注意力,推理成本恒定。技术实现极其克制:不引入视频编码器、不加可学习模块,仅通过在 π0.5 既有骨干上重构注意力掩码(块内双向、块间因果)并扩展位置嵌入来组织 T 个流式帧的输入序列,完全依赖 LLM 主干的长度外推能力消化变长的输入,因此可以无修改地继承全部预训练权重,并在测试时灵活切换单帧或多帧推理。训练侧再用随机间隔采样($\delta = \bar{\delta} + \epsilon$,$\epsilon \sim U(-\Delta, +\Delta)$,裁剪到 $[\delta_{\min}, \delta_{\max}]=[3,7]$)和时序掩码(随机遮住最早 $k$ 帧)模拟真实部署中帧到达时刻不定的情形。

核心创新是指令锚定的原子时序单元设计。与已有方法的本质区别有两点。第一,时间建模的基本单位不是'一帧图像'而是'一帧图像+完整语言指令'的对:帧内双向注意力保证视觉 token 始终能 attend 到指令 token,语义耦合在每个时间步都被重建,无论时程多长指令都不会被累积的视觉 token 淹没——这直接针对以往多帧 VLA 把观测与指令解耦聚合导致的指令遗忘缺陷。第二,整个时序扩展是零参数的:只用一个分块因果掩码重新组织 π0.5 原有自注意力,历史帧以 KV cache 形式被因果复用而非每步重新编码,既保留了预训练表征的完整性(无新模块带来的分布错位),又把推理开销压到与单帧推理同级的常数水平。消融显示帧内双向注意力在 T=5 时比因果版本高 2.8 个百分点(98.3 对 95.5),验证了锚定设计的必要性。

方法步骤详情

第一步,构造原子时序单元:在时间 $t$ 接收多视角观测 $V_t = \{v_t^f, v_t^l, v_t^r\}$(前视、左腕、右腕相机)和语言指令 $l_t$,组成 $u_t = (V_t, l_t)$。第二步,拼接流式帧序列:取最近 $T$ 个采样观测(含当前帧),输入序列 $U = [u_{t-T+1}, \ldots, u_t]$,训练时 $T=3/5$。第三步,单元内融合:每个 $u_\tau$ 内视觉与文本 token 做双向注意力 $h_\tau = \mathrm{Attn}_{bi}(V_\tau, l_\tau)$,产出语义接地的表示。第四步,单元间聚合:融合表示经因果注意力 $o_t = \mathrm{Attn}_{causal}(h_{t-T+1}, \ldots, h_t)$ 汇聚时序上下文,动作头据此采样 $a_t \sim \pi_\theta(\cdot \mid o_t)$。第五步,随机间隔采样训练:每个采样步在基准间隔上叠加均匀扰动得到 $\delta = \bar{\delta} + \epsilon$,裁剪到 $[3,7]$,再配合时序掩码随机隐藏最早 $k \in \{0,1,\ldots,T-1\}$ 帧,模拟流式推理的增量观测模式。第六步,流式推理:初始时刻 $t_0$ 编码 $u_{t_0}$ 存入 KV cache,此后每个时刻 $t_n$ 只编码新帧 $u_{t_n}$,其表示 $h_{t_n}$ 对缓存 $\{h_{t_0}, \ldots, h_{t_{n-1}}\}$ 做交叉注意力,cache 逐步追加,杜绝历史帧的重复计算。真机部署时 $\delta \sim U[3,7]$,仿真推理固定 $\delta=5$。

技术新颖性

技术新颖性体现在三个层面。架构层面:已有多帧 VLA(如 CronusVLA、4D-VLA)普遍引入专门的时序聚合模块或视频编码器,带来新参数与特征分布错位风险;StreamPI 证明仅靠注意力掩码重组+LLM 长度外推即可完成时序扩展,属于'结构性免费午餐',且天然支持训练 T=5、推理 T=1/3/5 的跨流泛化(表5 显示 T=5 训练的模型在 T=1 推理时仍有 97.1%,高于单帧基线 96.5%)。训练层面:随机间隔流式训练直指机器人社区长期存在的异步执行痛点,让策略对帧时刻扰动鲁棒,同时大间隔本身减少推理频率($\delta=5$ 即每 5 帧推理一次),为动作执行留出更多时间;表4 显示随机间隔训练使 T=3 平均成功率从 96.4 升至 97.5、T=5 从 97.0 升至 98.3。系统层面:KV cache 式流式推理从 NLP 的 StreamingLLM 移植到具身控制,与指令锚定单元结合后,时序记忆、空间精度、推理效率三者首次在零参数代价下同时达成。

The pipeline of StreamPI
Figure 2: The pipeline of StreamPI

实验结果

真机实验覆盖记忆依赖与精确感知两类共四个任务,StreamPI 全面碾压单帧 π0.5:贝壳游戏 80.0% 对 46.7%(+33.3%),滚动目标抓取 63.3% 对 26.7%(+36.6%),笔插入窄口瓶 66.7% 对 40.0%(+26.7%),杯插入杯套 92.0% 对 60.0%(+32.0%)。LIBERO 上基准已高度饱和(π0.5 平均 96.9%),StreamPI(T=5)仍达 98.3%,其中 LIBERO-Long +2.6%(95.0 对 92.4)、LIBERO-Goal +2.8%(99.6 对 96.8)、LIBERO-Object +1.6%(99.8 对 98.2),而 LIBERO-Spatial 持平(98.8 对 98.8),符合'静态空间关系单帧已足够'的分析。CALVIN 上平均序列长度 4.547 对 π0.5 的 4.313 和 MemoryVLA 的 4.090,且第 5 个任务成功率 85.0% 显著高于 π0.5 的 79.5% 和 MemoryVLA 的 69.4%,说明其记忆机制在长序列下不累积误差。消融方面:帧内注意力必须双向(T=5 时双向 98.3 对因果 95.5);随机间隔训练稳定优于固定 $\delta=1$(T=5:98.3 对 97.0);跨流泛化显示 T=5 训练的模型退化到 T=3 推理仅损失 0.9 个百分点(97.4)。训练在 8 块 H100 上进行,LIBERO 用 batch 256 训 30k 步,真机任务用 batch 128 训 50k 步。

Performance comparison on LIBERO
Table 1: Performance comparison on LIBERO
Performance comparison on CALVIN
Table 2: Performance comparison on CALVIN
Ablation on attention direction
Table 3: Ablation on attention direction
Effect of random-interval streaming training
Table 4: Effect of random-interval streaming training
Cross-stream generalization
Table 5: Cross-stream generalization
Visualization of real-world tasks and comparison of real-world performance
Figure 3: Visualization of real-world tasks and comparison of real-world performance
查看结构化数据
任务指标本文基线提升
LIBERO 平均(四套件) 成功率 (%) 98.3 (T=5) 96.5 (π0.5 单帧复现) / 96.9 (π0.5 原文) +1.4~1.8
LIBERO-Long(长时程) 成功率 (%) 95.0 92.4 (π0.5) +2.6
LIBERO-Goal 成功率 (%) 99.6 96.8 (π0.5) +2.8
CALVIN(5 连续任务) 平均序列长度 4.547 4.313 (π0.5) / 4.090 (MemoryVLA) +0.234
真机:贝壳游戏(记忆依赖) 成功率 (%) 80.0 46.7 (π0.5) +33.3
真机:滚动目标抓取(记忆依赖) 成功率 (%) 63.3 26.7 (π0.5) +36.6
真机:笔插入窄口瓶(精确感知) 成功率 (%) 66.7 40.0 (π0.5) +26.7
真机:杯插入杯套(精确感知) 成功率 (%) 92.0 60.0 (π0.5) +32.0

局限与改进

作者坦承 LIBERO-Spatial 上没有任何提升(98.8% 持平基线),因为该套件的成功由静态空间关系决定,额外的时序上下文反而可能引入与最终几何构型无关的运动干扰;LIBERO 整体已饱和,+1.4% 的平均增益边际意义有限。我自己的观察:其一,流式推理的 KV cache 会随时间步持续追加,论文虽称开销恒定但并未讨论 cache 淘汰或 attention sink 处理,超长任务(数千步)下显存与外推退化风险未验证;其二,真机实验每个任务仅报告单一成功率,试验次数与统计显著性未说明,且真机基线只有 π0.5 一个对照,未与 CronusVLA、MemoryVLA 等时序方法直接比(CALVIN 表中虽有 MemoryVLA 但非同 backbone);其三,指令在每个时间步重复注入拉长了序列,指令很长或多语言场景下的 token 预算代价未被讨论;其四,T=1 推理退化到 97.0-97.1% 说明时序收益部分依赖历史帧存在性,对帧率骤降的极端异步场景鲁棒性有限。

独立分析的弱点

第一,KV cache 无界增长问题:流式推理每步追加当前帧的 K/V 表示,数小时级长时程任务中 cache 体积线性膨胀,且 LLM 长度外推在远超训练长度时通常伴随注意力退化,论文应引入 StreamingLLM 式的滑窗+初始 token 保留机制或周期性 cache 压缩。第二,指令重复的序列膨胀:每个时序单元都携带完整指令,若指令为长段落(如多步任务描述),$T=5$ 时序列中指令 token 占比可达一半,实际部署应探索指令 token 的增量编码或共享前缀 cache。第三,真机评估单薄:四个任务、单一基线、未报告试验数与置信区间,+33% 这类大增益虽可信但小任务方差可能很大,建议扩充任务库并加入 CronusVLA、TriVLA 等时序基线。第四,历史帧依赖与记忆窗口的矛盾:随机遮蔽训练提升了鲁棒性,但 T=1 推理仍损失约 1 个百分点,面对相机掉帧、网络抖动等极端情况可引入显式的记忆压缩模块(如可学习的摘要 token)替代原始帧缓存。第五,空间感知增益的解释停留在定性层面(运动视差、结构一致性),缺乏深度估计精度等中间指标来直接验证时序聚合确实改善了 3D 感知。

未来方向

作者方向上希望 StreamPI 成为'给未来 VLA 注入持久时序推理的简单配方',可延伸的方向包括:把随机间隔训练与真机异步执行系统(变频率控制回路)联合优化,探索帧到达时刻的自适应推理触发;将流式时序建模推广到 π0.5 之外的骨干(OpenVLA、GR00T-N1)验证通用性;结合世界模型让 KV cache 中的历史表示支持未来状态预测而不仅是记忆回放。基于成果可延伸的研究:一是层次化记忆——用注意力汇/摘要 token 把远期历史压缩成固定长度表示,突破 T 帧滑窗的记忆上限,处理跨分钟的长期任务;二是主动感知——利用多帧几何线索输出不确定性估计,触发主动视角调整以强化深度感知;三是跨具身迁移——检验时序表征是否可跨机器人本体(不同臂展、相机位姿)复用;四是在线适应——流式框架天然支持测试时持续接收新帧,可探索少样本在线微调或上下文学习式任务适应。

复现评估

复现条件较为友好但门槛不低。有利因素:方法基于开源的 π0.5 权重,核心改动只是注意力掩码与采样策略,代码逻辑简单;LIBERO 与 CALVIN 均为公开仿真基准,协议标准(每任务 50 次试验);论文给出了关键超参($T=3/5$,$\delta \sim U[3,7]$,LIBERO 30k 步 batch 256、真机 50k 步 batch 128,优化器与学习率日程同 π0.5),并有项目主页。不利因素:真机实验需要多相机(前视+双腕)机器人平台与 ACE Robotics 参与的真机数据,外部实验室难以完全复现真机结果;训练需要 8 块 NVIDIA H100,对普通学术实验室是显著成本;论文正文未提及开源代码仓库链接(仅项目主页),实际代码可用性需确认。综合评估:仿真部分(LIBERO/CALVIN)复现难度中等,核心思想一周内可在单节点多卡上验证小规模版本;真机部分复现难度高,依赖专用硬件。