记忆即计划:面向记忆依赖机器人操作的记忆引导世界-动作建模 Memory as Plans: World-Action Modeling with Memory-Grounded Planning
把长期情景记忆编译成语言-视觉计划,用固定上下文执行长时程记忆依赖操作
前置知识
马尔可夫假设
假设当前观测(或固定短窗口)已包含决策所需的全部信息,历史可以忽略。多数主流机器人策略(如 $\pi_0$、Diffusion Policy)在此近似下直接从当前观测生成动作,形式化为 $\pi(a_{t+1:t+h} \mid f_{\le t}, s_t, l)$ 的简化版。
论文的核心动机正是该假设在非马尔可夫任务上的失效:关键信息可能只存在于历史观测中。理解它才能理解'长时程记忆'问题的本质与现有记忆机制的分类逻辑。
VLA 模型
视觉-语言-动作(Vision-Language-Action)模型,以预训练视觉语言模型为骨干,直接从图像加语言指令输出机器人动作,通过大规模机器人数据集(如 DROID、Open X-Embodiment)模仿学习训练,代表工作有 $\pi_0$、$\pi_{0.5}$、OpenVLA 等。
本文的规划器(微调 Qwen3.5-4B)和执行器生态都建立在 VLA/世界模型之上,理解其'当前观测+短历史'的输入范式是读懂论文动机和对比实验的基础。
因果世界模型(CWM)
按时间因果顺序建模视觉动态与动作的生成模型:给定历史观测前缀和动作,自回归地预测未来观测(或其潜状态)。块因果注意力保证第 $i$ 块只能看到 $j \le i$ 的块,使已完成的历史成为可缓存的前缀。
论文的视觉规划器 $\pi^v_P$ 就是一个块因果世界模型,它把长期稀疏视觉上下文编译成视觉计划 $\hat{G}_k$,是'记忆即计划'分解中的关键一环。
条件流匹配(Flow Matching)
一种生成模型训练范式:在流时间 $\rho \in (0,1)$ 把数据 $y$ 与噪声 $\epsilon$ 插值为 $y_\rho = (1-\rho)y + \rho\epsilon$,学习速度场 $v_\theta$,损失为 $\mathcal{L}_{\mathrm{FM}} = \mathbb{E}\|v_\theta(y_\rho, c, \rho) - (\epsilon - y)\|_2^2$,推理时少量去噪步即可采样。
WAP 与 CWM 的三个分支(未来视觉、动作块、进度序列)都用条件流匹配训练,动作与进度由去噪过程联合生成,公式细节贯穿方法与附录。
KV 缓存
Transformer 推理优化技术:自回归生成时缓存先前 token 的 Key/Value 状态,后续每步只计算新 token 的注意力,避免重复前缀计算。前提是前缀的隐状态不随后续输入改变,否则缓存失效。
论文通过精心设计的注意力掩码让 CWM 与 WAP 的计划前缀都满足缓存条件,这是执行延迟稳定在约 827ms、规划延迟随片段数缓慢增长的根本原因,是理解 Figure 5 的钥匙。
Mixture-of-Transformers(MoT)
稀疏多模态架构:不同模态使用完全独立的 Transformer 权重(专家),仅在注意力层交互,从而可为每种模态配置不同容量。本文在预训练视频 DiT 基础上新增动作专家与进度专家。
WAP 用 MoT 架构把视觉动态、动作、进度三种模态联合建模,其中进度专家(207M 参数)是本文首创的'进度作为一等模态'思想的载体。
研究动机
主流机器人策略普遍采用马尔可夫公式化,只用当前观测或固定短历史生成动作,但许多真实操作任务本质是非马尔可夫的:例如 Swap T 需要记住两个 T 形积木在被遮挡前的初始位置,Press Button 需要区分视觉相似但语义不同的按压/释放阶段。现有记忆机制分三类且各有硬伤:(1) 语言记忆(MemER、Mem-0、MEM)把历史压缩为语言摘要,紧凑但丢失细粒度视觉与空间证据;(2) 持续更新的潜状态/记忆库(MemoryVLA 等)在长时程后早期证据被压缩或覆盖;(3) 增长式视觉窗口(如因果 WAM 代表 LingBot-VA)保留全部历史帧,但推理延迟与显存随历史线性膨胀——论文实测 1500 帧历史时执行延迟约为零历史的 4 倍,1700 帧时显存超过 80GB 直接 OOM。历史覆盖与执行效率之间存在根本性权衡,这是本文要打破的困境。
本文的目标是本文目标是让机器人策略既能利用长时程细粒度视觉记忆完成记忆依赖任务,又保持执行器上下文长度固定、推理延迟近似常数。具体拆解为三点:其一,把记忆依赖的世界-动作建模分解为记忆接地规划与计划条件执行两个阶段,长时程历史只在每个片段开始时被消费一次,用于推断下一片段的语言计划和期望的视觉演化,执行模型只消费固定长度的计划前缀;其二,引入进度(progress)作为与动作联合生成的模态,使执行器能在片段时长未知的情况下自适应判断完成时机并触发重规划;其三,通过结构化注意力让规划与执行两级 KV 缓存成为可能。最终指标是在 RMBench 与真实机器人上刷新记忆依赖任务的成功率,同时执行延迟不随历史增长。
与已有工作不同的是,本文的独特切入是一个观察:长时程视觉历史未必需要作为每一步控制的直接输入——历史的主要用途是决定'下一个片段级计划'与'期望的视觉演化',执行只需跟随这个记忆接地的计划。由此把密集历史处理与短时程动作生成分离。与目标/计划条件策略(CoT-VLA、RT-Trajectory 等)不同,其计划通常只条件于当前观测或外部示例,而 MaP-WAM 的计划从累积的情景记忆生成且带视觉通道;与 LingBot-VA 等因果 WAM 不同,本文不把逐帧历史塞进执行上下文,而是把证据稀疏化(每段 8 帧)、块因果化为可缓存前缀;与把进度做事后验证器或奖励信号的工作(ReWiND、TapSampling)不同,本文让进度成为与动作联合生成的第一等模态,并通过计划-观测对齐做免训练闭环校准,形成'规划-执行-记忆更新'的完整闭环。
核心方法
先给直觉:像教练看完整比赛录像制定下一节战术,球员只带一张战术卡上场,而不必背着全部录像跑动。MaP-WAM 维护结构化多模态情景上下文 $C_{<k}$:每个已完成片段 $i$ 贡献一条记录 $C_i = \{l_i, G_i\}$,即该段语言指令加均匀重采样的 $N=8$ 帧稀疏视觉上下文,初始观测单独存为 $G_0 = f_0$。规划阶段:VLM 规划器 $\pi^l_P$ 根据全局指令、已完成片段指令与关键帧集合预测下一片段语言计划 $l_k$;因果世界模型(CWM)以 $(G_{<k}, l_k, l)$ 为条件,用流匹配生成视觉计划 $\hat{G}_k$ 作为细粒度执行引导。执行阶段:World-Action-Progress(WAP)模型以 MoT 架构联合预测未来视觉潜变量、动作块 $a_{t+1:t+h}$ 与进度序列 $p_{t+1:t+h}$,视觉计划编码为静态干净前缀。当预测进度均值超过阈值 $\tau = 0.95$ 时判定片段完成,把真实观测重采样为 $G_k$ 追加进记忆并触发下一轮规划。执行器输入与历史长度无关,上下文始终保持固定。
核心创新是'记忆即计划'的分解加进度作为一等模态,与已有方法的本质区别有三。第一,坚持视觉接地的记忆:消融显示换用当前观测条件的世界模型后,Swap T 成功率从 96% 跌到 13-14%,Observe and Pick Up 从 19% 跌到 1-2%,证明语言计划无法保留精确空间证据。第二,历史证据被编译为静态可缓存前缀而非增长上下文:CWM 的块因果掩码使已完成片段成为一次计算、跨片段复用的 KV 前缀;WAP 每片段只 prefill 一次计划前缀并在整段执行期复用,执行延迟稳定在约 827ms,而全上下文方案 1700 帧时 OOM。第三,进度 $p_t = (t-i)/(j-i)$ 作为连续时间坐标与动作联合生成而非事后验证:它为视觉相似但语义不同的阶段提供显式锚点(去进度条件后 Press Button 从 96% 跌到 18%),配合计划-观测对齐(当前帧与计划帧做 RGB 像素差匹配)校准递归预测漂移(平均 423.10 步的超长任务去校准后从 94% 跌到 38%)。
方法步骤详情
轨迹按语义分段(训练用 RMBench 标注),每段均分 8 个时间桶各取末帧组成 $G_i$,与指令配对成记录。步骤 2 语言规划:VLM(Qwen3.5-4B,LoRA 微调)输入全局指令、已完成片段指令与关键帧,按固定 prompt 模板输出下一子任务 $\hat{l}_k$。步骤 3 视觉规划:CWM(WAN-2.2-5B 初始化,块因果掩码,WAN-VAE 每段压成 2 个潜时间步)用流匹配生成 $\hat{G}_k$,证据前缀 KV 跨片段复用。步骤 4 计划条件执行:WAP(动作专家 1.02B、进度专家 207M 参数)以 $(\hat{G}_k, \hat{l}_k, f_t, s_t, p_t)$ 为共享条件,对视觉、动作、进度三分支施加流匹配损失(权重均 1.0),推理 10 步去噪,动作视野 $h=32$ 只执行前 8 个动作。步骤 5 进度校准:每个 chunk 前用观测与计划帧像素差匹配更新进度条件。步骤 6 片段转换:进度均值超 $\tau=0.95$ 即结束本段,真实观测重采样为 $G_k$ 追加进上下文,触发重规划。
技术新颖性
技术新颖性体现在四个层面。(1) 问题重构层面:把'如何让执行器访问长历史'重构为'如何把历史编译成计划',这是架构级洞察而非模块堆叠,从根上消解历史-效率权衡。(2) 注意力结构层面:CWM 用块因果掩码防止片段间未来泄漏,交叉注意力中已完成证据块只看全局指令、目标块只看本段计划,从而证据前缀可缓存;WAP 中计划块自注意力封闭,未来视觉与动作/进度 token 双向隔离(视觉预测仅作训练期辅助世界建模目标,推理可省略,沿用 FastWAM),使两级 KV 缓存同时成立。(3) 架构层面:在 MoT 中首创进度专家(207M 参数),动作与进度分支共享流匹配时间步、视频分支独立时间步,把进度从辅助信号升级为联合生成的模态。(4) 训练-推理一致性层面:训练用真值 $G_k, l_k$,进度条件加 $[-0.1, 0.1]$ 均匀偏移并裁剪到 $[0,1]$ 做鲁棒性增强;部署时的计划-观测对齐是免训练的轻量匹配,无需额外模块。每个组件都服务于'固定上下文+长记忆'这一统一目标。
实验结果
仿真:RMBench(50 条演示/任务、100 次评估)上总平均成功率 83.3%,超过最强基线 LingBot-VA 的 77.1%。Swap T、Press Button 均 96%(次优 88%/84%);Put Back Block、Cover Blocks 达 100%,Battery Try 82%;Observe and Pick Up 从基线 9% 提到 19%;但 Rearrange Blocks(66%)与 Blocks Ranking Try(94%)输给 LingBot-VA 的 100%。真机(Franka Research 3,50 轨迹/任务、50 次试验):Find Button 88%(π0.5 约 26%),Press Buttons 68%(基线全 0%)。消融:去视觉计划/视觉记忆后两任务跌到 1-2%/13-14%(Figure 4);分类式完成预测、去进度条件、去校准平均 37.0%/54.0%/73.7%,完整方法 96.7%(Table 2)。效率:延迟稳定约 827ms/chunk,全上下文 1500 帧约 4 倍、1700 帧 OOM。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| RMBench 全部 9 个记忆依赖任务 | 平均成功率 | 83.3% | LingBot-VA 77.1%(次优);WLA-0 42.0%;X-VLA 10.4%;Mem-0 9.8%;π0.5 5.8% | 较最强基线 +6.2 个百分点 |
| RMBench Press Button(M(n),需区分视觉相似阶段) | 成功率(100 次评估) | 96% | LingBot-VA 84%;WLA-0 74%;Mem-0/π0.5/X-VLA 均 0% | +12 个百分点 |
| RMBench Swap T(M(1),需记忆 T 形积木初始位置) | 成功率(100 次评估) | 96% | LingBot-VA 88%;DP 20%;π0.5 15% | +8 个百分点 |
| RMBench Observe and Pick Up(M(1),最难任务) | 成功率(100 次评估) | 19% | π0.5 9%;X-VLA 9%;Mem-0 4%;LingBot-VA 3% | +10 个百分点(相对翻倍以上) |
| 真机 Press Buttons(Franka Research 3) | 成功率(50 次独立试验) | 68% | π0.5 与 FastWAM 均 0%(基线仅能靠随机选择在 Find Button 上得非零分) | +68 个百分点 |
| 执行效率(历史增长时的动作 chunk 延迟) | 每 chunk 推理延迟 | 约 827ms,近似恒定 | 全上下文执行器 1500 帧历史时约 4 倍零历史延迟,1700 帧时显存超 80GB OOM | 延迟不随历史增长且可用历史范围无 OOM 上限 |
局限与改进
作者承认两点局限:其一,MaP-WAM 目前依赖现有基准提供的片段结构来组织记忆与进度,向未分段演示扩展需要自动片段发现;其二,计划-观测对齐采用免训练的 RGB 像素差匹配,视觉复杂场景下鲁棒性有限,学习型相似度是自然改进。我的补充观察:(1) 每个片段开始都要跑 5B 级 CWM 生成视觉计划,片段频繁切换的任务中规划开销不可忽略;(2) 进度标注 $p_t = (t-i)/(j-i)$ 隐含段内线性进展假设,对存在长等待或非线性节奏的片段可能失真;(3) 评估限定每任务 50 演示的小数据协议,对开放指令、新物体的泛化未验证;(4) Rearrange Blocks 上 66% 显著低于 LingBot-VA 的 100%,暗示多物体重排等需要密集帧级状态追踪的场景下,8 帧稀疏记忆可能覆盖不足;(5) 稀疏记忆每段只保留 8 帧,若关键事件恰好落在两帧之间会永久丢失;(6) 像素差对齐对光照变化、相机位姿漂移敏感,真机长时间运行下的稳定性有待更多验证。
独立分析的弱点
独立分析出五个弱点并各给改进方向。第一,分段依赖:整条流水线建立在'任务可分解为语言可描述片段序列'之上,真实家庭/工业任务的分段边界模糊且标注有成本;改进方向是训练无监督片段发现模块,或让 VLM 规划器同时输出片段边界与置信度。第二,像素级对齐脆弱:RGB 平均绝对像素差对遮挡、光照、相机抖动极其敏感,且只在当前进度估计附近的 2 个参考帧里选;改进方向是改用 DINOv2 等语义特征相似度,或端到端训练一个进度校准头。第三,段内响应性缺失:片段内执行只跟随静态计划,若环境突发变化(物体被碰倒)而进度未达阈值,策略缺乏段内重规划机制;改进方向是加入世界模型预测误差监控,异常时提前触发重规划。第四,多对象组合记忆短板:Rearrange Blocks 的失败暴露 8 帧稀疏化对多物体状态组合覆盖不足;改进方向是按物体状态变化事件自适应选帧而非均匀时间采样。第五,进度线性假设:对段内节奏不均的任务(长等待后短爆发)进度语义失真;改进方向是学习分段长度感知的进度参数化,或用剩余时间/剩余动作数替代线性比例。
未来方向
作者明确提出的方向有两个:向未分段演示扩展,通过自动片段发现摆脱对基准标注的依赖;用学习型相似度度量替换免训练像素匹配以提升校准鲁棒性。基于本文成果还可延伸:(1) 把片段级线性计划升级为层次化计划树,支持子目标间的回溯与条件分支,处理需要中途改变策略的任务;(2) 把计划-观测对齐推广为通用的'计划状态估计',类比世界模型中的粒子滤波,维护多个进度假设并按观测似然重加权;(3) 结合主动感知,让 WAP 在进度估计置信度低时主动请求新视角或近距离观测;(4) 跨具身迁移:CWM 与 WAP 共享 WAN-2.2 视频骨干,理论上可在不同机器人本体数据上复用该训练配方;(5) 在线记忆管理:当情景上下文增长到上百片段时做重要性采样压缩或层级摘要,处理小时级长任务;(6) 与强化学习结合,把进度门控转换信号转为奖励塑形,在稀疏奖励任务上做微调。
复现评估
复现评估:论文未声明开源代码或权重,仅给出项目页链接(MaP-WAM),复现需自行实现。算力需求高:训练在 8 张 NVIDIA A800 80GB 上进行(VLM 用 LoRA rank 32,CWM 训 100 epoch,WAP 每任务 40-100 epoch,均为 AdamW、学习率 1e-4)。依赖条件:Qwen3.5-4B 与 WAN-2.2-5B 基础权重、RMBench 基准及官方每任务 50 条专家演示、真机平台(Franka Research 3 加两个 RealSense D435i)。超参数披露较完整:τ=0.95、N=8 稀疏帧、h=32 执行前 8 动作、10 步去噪、损失权重均 1.0、进度偏移增强 [-0.1,0.1]、噪声调度 shift 5.0、prompt 模板全文给出、注意力掩码见附录 C 与 Figure 6。主要难点:MoT 专家初始化需复刻'从视频专家权重插值到目标隐维并重缩放方差'的细节;分段标注与进度注释依赖基准协议;训练用真值计划而推理用生成计划的差异需小心处理。总体属高成本、中高难度复现,仿真部分可行,真机门槛高。
论文图表
四联图:(a) 语言记忆把历史压缩为语言摘要但丢失细粒度视觉证据;(b) 增长窗口记忆保留近期观测但随窗口扩大推理延迟与显存上升(3279ms 量级,500/1000/1500 帧递增);(c) MaP-WAM 从每个完成片段保留少量帧构成长期稀疏视觉上下文,VLM 与因果世界模型将其转化为语言-视觉计划,WAP 模型联合预测动作块与进度,执行上下文长度固定;(d) 显示语言计划-only 在需要精确视觉记忆的任务上掉 14%;(e) 显示本方法执行延迟约 827ms 且不随帧数增长,而因果 WAM 在 1700 帧 OOM。
这张图一页讲清了论文的动机(两类现有记忆机制的缺陷与量化代价)和核心方案(记忆即计划的架构草图),并预先给出性能与效率两个关键卖点,是理解全文逻辑的入口。