← 返回 2026-08-31

重访局部上下文:面向超长时程流式3D重建的ABot-Recon Revisiting Local Context for Long-Horizon Streaming 3D Reconstruction

Jiarong Han, Jincheng Xiong, Yuzhou Liu, Linzhe Shi, Changjie Wu, Ning Guo, Mu Xu, Hang Zhang, Ming Qian 📅 2026-08-27 👍 30 2026-09-01 18:30
SLAM 因果Transformer 流式3D重建 视觉里程计 长视频理解

仅用12帧局部上下文与可组合的局部预测,实现超长视频流式3D重建与低漂移位姿估计

前置知识

点图(Point Map)

把图像每个像素直接映射为 3D 空间坐标的稠密表示,由 DUSt3R 提出并被 π3、VGGT 等前馈重建模型沿用:网络一次前向即可回归逐像素 3D 点及其置信度,无需深度传感器、已知内参或传统多视图几何流程。

ABot-Recon 的几何输出就是当前相机坐标系下的点图与置信度图,理解这种表示是读懂其重建结果与损失设计的前提。

KV 缓存与因果注意力

流式 Transformer 推理时缓存历史 token 的键值对,使新帧只与过去帧做注意力、不接触未来信息。本文进一步把缓存截断为最近 $K-1=11$ 帧(窗口化因果注意力),滑出窗口的缓存即被丢弃。

这是'严格局部上下文'的实现载体,决定了内存 $O(K)$ 有界、每帧计算可流式化的核心性质。

相对位姿与链式组合

$T_{i-1\leftarrow i}$ 表示帧 $i$ 相对帧 $i-1$ 的刚体变换(旋转+平移)。任意两帧间的变换可由相邻变换连乘恢复:$T_{i\leftarrow j}=\prod_{k=i+1}^{j}T_{k-1\leftarrow k}$,全局轨迹即由这些局部测量逐步拼接而成。

本文的预测目标就是相邻帧相对位姿,连乘引入的误差累积与漂移正是全文要解决的核心问题。

ATE 与 RPE 指标

轨迹评估的标准指标:ATE 是预测轨迹经 Umeyama Sim(3) 对齐后绝对位置误差的 RMSE(米);RPE 为相对位姿误差,分旋转 RPE-R(度)与平移 RPE-t(米),反映局部运动估计质量。均为越低越好。

论文所有位姿实验的表格与图都用这三个指标比较方法优劣,不认识它们就无法解读实验结果。

SO(3) 指数映射与轴角

三维旋转可用轴角向量 $\omega\in\mathbb{R}^3$ 表示,经指数映射 $\mathrm{Exp}([\omega]_\times)$ 转为旋转矩阵。对旋转做增量修正时常预测小残差 $\delta\omega$ 再与原旋转复合,保证更新始终落在旋转群 SO(3) 上。

旋转精化器正是输出轴角残差 $\delta\omega_i$,按 $\hat R=R\,\mathrm{Exp}([\delta\omega_i]_\times)$ 与初始相对旋转复合。

回环检测与位姿图优化

SLAM 中识别'重访同一地点'的技术:检索历史上相似的帧、估计它们之间的相对位姿作为额外约束,与逐帧里程计约束一起构成位姿图,经图优化一次性消除累积漂移,得到全局一致的轨迹。

本文的可选后端用 DINOv2-SALAD 描述子加 FAISS 检索重访帧对做位姿图优化,理解它才能分清模型本体与后端各自的贡献。

门控 TCN(时序卷积网络)

用因果一维卷积聚合固定窗口内时序特征的网络,配合门控机制 $T_h(W)\odot\sigma(T_g(W))$ 自适应调节信息流;相比 RNN 可并行训练,窗口固定则推理成本有界。

旋转精化器用门控 TCN 聚合最近 K 帧的运动-视觉证据并预测旋转残差,是其轻量时序建模的关键组件。

研究动机

流式3D重建要求在内存与每帧计算都有界的约束下,对无限增长的视频因果地估计相机运动与场景几何。早期流式模型(CUT3R 的紧凑循环状态、StreamVGGT 的缓存时序 KV 等)虽实现了有界推理,但估计质量随序列增长持续退化:在 KITTI-02(4661 帧)上,CUT3R 与 TTT3R 不做状态重置的 ATE 高达 209.04 m 与 181.11 m,即使重置状态也仍有 98.40 m 与 68.44 m。最近的 LingBot-Map 与 HorizonStream 通过锚点上下文、轨迹记忆或持久线性注意力把流式重建推到 10000 帧以上,但历史状态的管理与融合成了架构的核心负担——LingBot-Map 在 Oxford Spires 上推理显存高达 18.87 GB,HorizonStream 多帧模式峰值 26.62 GB;更根本的问题是,当位姿与几何预测目标相对时间上遥远的参考帧定义时,回归范围随序列增长,预测问题本身越来越难。

本文的目标是本文的目标是构建一个不依赖任何持久学习型长程记忆、却能在超长流上保持精度的简单流式重建模型:让全部可学习组件工作在固定的 12 帧时间窗内(当前帧加上前 11 帧的 KV 特征缓存),把预测目标参数化为当前相机坐标系下的点图、置信度图与相邻帧相对位姿,使其估计范围不随序列长度增长,从而模型可以在短片段上训练、直接推理上万帧的视频流,内存保持 $O(K)$ 恒定、每帧计算与序列总长无关。同时用轻量旋转精化器与组合感知位姿损失抑制递归组合的误差累积,在 KITTI、VBR、Oxford Spires 等长序列基准上超越现有流式方法,并保持单卡 H100 上逐帧 24.45 FPS 的流式效率。

与已有工作不同的是,已有工作几乎全部沿'强化长程记忆'这一单一路线推进:LONG3R 的门控时空记忆、LongStream 的关键帧相对预测与周期性缓存刷新、STAC 的缓存压缩、TTT3R 的置信度自适应状态更新、Mem3R 的快权重记忆,直至 LingBot-Map 与 HorizonStream 的短-长程显式协同。本文的独特切入是时间参数化问题:作者指出,若预测目标相对时间上遥远的参考(首帧或全局锚点)定义,估计范围会随序列增长;若把学习到的时序上下文严格局部化、把目标定义在固定时间范围的局部参考系中,则同时消除了复杂缓存管理的需求,并让每步预测难度保持恒定。这把'长时程能力'从架构记忆工程问题转化为局部预测加可靠组合的问题,是视角上的本质反转。

核心方法

直觉上,只要每个局部测量足够准、且它们可以被可靠地连乘,长程轨迹和几何就能像搭积木一样从一串局部预测中拼出,无需模型'记住'全局。技术路线:ABot-Recon 以因果注意力 Transformer 为骨干(从公开的 π3 权重初始化),共享图像编码器产生帧特征 $F_i$,解码器交替执行帧内注意力与窗口化因果跨帧注意力——帧 $I_i$ 只关注最近 $K-1=11$ 帧的缓存键值;几何头回归当前相机坐标系下的点图 $P_i$ 与置信度 $S_i$,相机头由相邻帧相机 token 构造的成对描述子 $q_i$ 预测相对位姿 $T_{i-1\leftarrow i}$,全局轨迹经链式连乘恢复,局部点图随之变换拼接。为压制漂移,再叠加运动-视觉旋转精化器与多间隔组合位姿损失。训练分三步:32 帧片段 32K 步(48 卡 H20)、128 帧片段 38K 步(32 卡 MI308)、最后 4K 步只训置信度分支。

核心创新在于把长时程能力从长程记忆中彻底解耦:与 LingBot-Map(锚点上下文+轨迹记忆)、HorizonStream(局部注意力+持久线性注意力)不同,ABot-Recon 除最近 12 帧的 KV 缓存外没有任何持久或多级长程状态。其参数化天然满足参考系等变——点图定义在当前相机坐标系、位姿只相对前一帧,不存在随序列增长的绝对回归目标,短序列训练即可泛化到超长流。针对误差累积,论文在估计与监督两端同时发力:估计端是仅 4.75M 参数(约 0.48%)的运动-视觉旋转精化器,用门控 TCN 在因果窗口内聚合证据并输出残差 $\hat R_{i-1\leftarrow i}=R_{i-1\leftarrow i}\,\mathrm{Exp}([\delta\omega_i]_\times)$;监督端是组合感知位姿损失,对所有间隔 $j-i\le K-1$ 的组合变换按权重 $\alpha_{ij}\propto(j-i)^\gamma$ 施加损失,让多步累积误差在训练中直接暴露并被优化,这是对'只监督相邻帧'范式的实质改进。

方法步骤详情

流程分五步。(1)窗口化编码:帧 $I_i$ 经共享编码器得 $F_i$,解码器在 12 帧窗口内交替执行帧内/跨帧注意力,输出稠密帧 token $G_i$、相机 token $C_i$ 与缓存 $M_{i-1}$,窗外缓存即弃,内存 $O(K)$、计算 $O(NK)$。(2)局部预测:$P_i=\mathrm{Head}_{point}(G_i)$、$S_i=\mathrm{Head}_{conf}(G_i)$;相机 token 经 MLP 池化为 $z_i$,成对描述子 $q_i=R(z_{i-1},z_i)=[x,y,y-x,x\odot y]$,回归 $T_{i-1\leftarrow i}=\mathrm{Head}_{pose}(q_i)$。(3)旋转精化:运动证据 $f_m=\phi_m(q_i)$,视觉证据经交叉注意力提取 $f_v$,融合 $f_i=\phi_{fuse}([f_m;f_v])$,门控 TCN 处理窗口 $W_i$ 得 $\delta\omega_i=\phi_o(T_h(W_i)\odot\sigma(T_g(W_i)))$,只修旋转、保留平移。(4)训练:对 $j-i\le K-1$ 的组合位姿按权重 $\alpha_{ij}$ 施加平移/旋转损失,加正则 $\mathcal{L}_{smooth}$ 与点图/法向/置信度损失。(5)推理:504×280 输入逐帧因果处理(FlashInfer paged KV),增量拼出轨迹与点云;可选回环后端用 DINOv2-SALAD 加 FAISS 检索重访帧对,构成位姿图优化。

技术新颖性

技术新颖性体现在三点。第一,参数化层面的创新:预测目标全部定义在局部参考系且随参考系变换等变,这使得'训练短、推理长'成为可能,而现有流式方法大多把长程能力寄托在记忆结构上,本文证明这是不必要的。第二,旋转精化器的结构设计:它不引入任何长程状态,只用当前成对的运动描述子加交叉注意力提取的视觉证据,经门控 TCN 在因果窗口内聚合,以 4.75M 参数(0.48%)换取 KITTI/Oxford/VBR 上 18.2%/26.9%/18.0% 的 ATE 下降,性价比极高。第三,组合感知监督:直接对多步连乘后的变换施以随间隔 $\gamma$ 加权的损失,把推理时的误差累积模式搬进训练目标,消融显示仅此一项就把 KITTI ATE 从 56.60 降到 27.66(降幅过半),是全文最大的单项增益。三者共同支撑起'无长程记忆的超长流式重建'这一反直觉结论。

Overview of our method
Figure 3: Overview of our method
Motion–visual contextualized rotation refiner with composition-aware pose supervision
Figure 4: Motion–visual contextualized rotation refiner with composition-aware pose supervision

实验结果

核心发现有四点。其一,位姿精度:Oxford Spires 上平均 ATE 4.35 m、RPE-R 0.12°,相对此前流式最优的 LingBot-Map(7.32 m)与 HorizonStream(8.81 m)降低约 40%,加回环后 4.02 m;KITTI 11 条序列平均 ATE 18.25 m 为全场最低(次优 HorizonStream 22.51 m),加回环 13.49 m;VBR 无回环 30.14 m 与 HorizonStream(29.02 m)相当,加回环 9.99 m 为所有方法最低。其二,稳定性:KITTI-02 上的 running RPE 全程最低且不随处理帧数退化,multi-gap RPE 在所有评估间隔均最低。其三,效率:H100 逐帧流式 24.45 FPS、6.71 GB 显存,快于 LongStream(10.36 FPS)与 HorizonStream(8.02 FPS),显存约为 LingBot-Map(18.87 GB)的三分之一。其四,消融:KITTI ATE 从基线 56.60 → 组合损失 27.66 → 长序列训练 22.31(-19.3%)→ 旋转精化 18.25(-18.2%);Oxford 10.16 → 4.35,VBR 52.90 → 30.14。重建上 Oxford Spires CD 1.37 m、F1 91.81% 双第一。

Training-data composition
Table 1: Training-data composition
Evaluation datasets and statistics
Table 2: Evaluation datasets and statistics
Camera pose estimation results on KITTI
Table 3: Camera pose estimation results on KITTI
Camera pose estimation on Oxford Spires
Table 4: Camera pose estimation on Oxford Spires
Camera pose estimation on VBR
Table 5: Camera pose estimation on VBR
Streaming efficiency on KITTI-02 (input storage excluded)
Table 6: Streaming efficiency on KITTI-02 (input storage excluded)
Dense reconstruction on 7Scenes, TUM-Dynamic, and Oxford Spires
Table 7: Dense reconstruction on 7Scenes, TUM-Dynamic, and Oxford Spires
Ablation study on KITTI, Oxford, and VBR
Table 8: Ablation study on KITTI, Oxford, and VBR
Pose accuracy on Oxford Spires and streaming inference efficiency on KITTI-02
Figure 1: Pose accuracy on Oxford Spires and streaming inference efficiency on KITTI-02
Results with optional loop closure
Figure 2: Results with optional loop closure
Qualitative camera pose comparison on representative sequences from KITTI, Oxford Spires, and VBR
Figure 5: Qualitative camera pose comparison on representative sequences from KITTI, Oxford Spires, and VBR
Long-horizon pose stability on KITTI
Figure 6: Long-horizon pose stability on KITTI
Qualitative dense reconstruction comparison
Figure 7: Qualitative dense reconstruction comparison
查看结构化数据
任务指标本文基线提升
相机位姿估计(Oxford Spires) ATE (m) ↓ / RPE-R (°) ↓ 4.35 / 0.12(加回环 4.02 / 0.12) LingBot-Map 7.32 / 2.29;HorizonStream 8.81 / 0.20 ATE 降低约 40%,RPE-R 降低约 40%~95%
相机位姿估计(KITTI) 平均 ATE (m) ↓ 18.25(加回环 13.49),RPE-R 0.10° HorizonStream 22.51;LingBot-Map 29.13;TTT3R 181.11 比次优流式方法低 19%,加回环低 40%
相机位姿估计(VBR,最长 18846 帧) 平均 ATE (m) ↓ 30.14(加回环 9.99) HorizonStream 29.02(w/ LC 17.64);LingBot-Map 29.45 加回环后全场最低,比 HorizonStream w/ LC 低 43%
流式效率(KITTI-02,H100) FPS ↑ / 显存 (GB) ↓ 24.45 / 6.71 LingBot-Map 19.74 / 18.87;HorizonStream 8.02 / 13.04 最快逐帧流式,显存约为 LingBot-Map 的 1/3
稠密重建(Oxford Spires,τ=4m) CD (m) ↓ / F1 (%) ↑ 1.37 / 91.81 LingBot-Map 1.68 / 90.58;HorizonStream 2.00 / 84.69 CD 与 F1 均为第一
稠密重建(7Scenes / TUM-Dynamic) CD (m) ↓ / F1 (%) ↑ 0.06 / 94.88 与 0.11 / 92.19 7Scenes 最佳 HorizonStream 0.23 / 98.22;TUM 最佳 LingBot-Map 0.08 / 95.97 具竞争力但非最优,室内紧凑场景为弱项

局限与改进

作者坦承:在空间受限、频繁重访的室内场景(7Scenes、TUM-Dynamic)中,持久几何上下文长期有效,而本文不保留场景级状态,因此重建并非全面最优——7Scenes 上 F1 94.88% 低于 HorizonStream 的 98.22%,TUM-Dynamic 上 92.19% 低于 LingBot-Map 的 95.97%;旋转精化器只作用于旋转分量,未处理平移误差;可选回环后端只有在场景重访时才能发挥全局校正作用。我的补充观察:VBR 的 Colosseo-0 无回环 ATE 仍达 48.12 m,说明长距离无重访时纯里程计漂移依然显著;与需要相机内参的优化类方法相比仍有差距(Oxford 上 DPVO 1.56 m、Droid-W 2.27 m vs 本文 4.35 m),两者信息假设不同、对比不完全公平;输入固定为 504×280 分辨率,对远景细小结构可能受限;组合监督上限为 $j-i\le K-1$,更长位姿链的一致性只能靠短链隐式泛化覆盖。

独立分析的弱点

独立分析四个弱点。其一,平移无精化:旋转精化器刻意只修旋转(理由是平移估计更稳定),但在尺度模糊的单目流中平移漂移同样致命,VBR Colosseo-0 无回环 48.12 m 说明平移误差不可忽视,改进方向是引入对称的平移残差模块或显式尺度估计头。其二,回环是训练无关的外挂后端:高速公路、隧道等无重访场景完全没有全局校正手段,可探索把稀疏长程约束编码为可学习记忆 token 注入窗口注意力,让模型保留'有界但可寻址'的长程能力。其三,室内高重叠场景输给持久记忆方法:可增加一个固定大小的场景摘要向量作为额外上下文槽,在不破坏有界性的前提下补充场景级信息。其四,组合监督受限于 $K-1$ 间隔,更长位姿链一致性靠隐式泛化:可引入课程式增大的监督间隔或轨迹级损失;此外训练数据 62.05% 为合成数据,对夜间、雨雾、水下等真实域外场景的鲁棒性未经检验。

未来方向

作者提出的方向包括:更强的动态场景处理、外部记忆机制、更大规模预训练、在局部时序连续性变模糊时引入选择性长程约束,以及应用到长时程具身感知、3D-VLM、3D 生成与世界建模。基于本文成果还可自然延伸:把'局部预测+可靠组合'范式推广到流式 4D 动态重建与非刚体场景;将回环后端做成可微分层,实现定位-建图-优化端到端联合训练;系统研究窗口大小 $K$ 与精度/效率的 scaling law,寻找最小充分上下文;把 ABot-Recon 输出的局部几何测量流作为下游 SLAM、机器人导航与世界模型的基础表征,探索测量级预训练与下游微调之间的接口设计。

复现评估

代码与项目页已开源(github.com/amap-cvlab/ABot-Recon),评测协议透明:Umeyama Sim(3) 对齐计算 ATE/RPE,重建经重采样、配准、体素化与 ICP 后报告 CD 与 F1(室内阈值 0.25 m、Oxford 4 m);所有基线均用官方权重在统一管线复现,仅未开源的 SLAMFormer-∞ 引用原文数字。但完整复现训练门槛很高:Stage I 用 48 张 H20 训 32K 步,Stage II 用 32 张 MI308 训 38K 步,还需 30 个数据集,其中含无法获取的内部数据(Internal Synthetic 4.03%、Internal Real 3.68%)。推理复现容易得多:单卡 H100 即可以 24.45 FPS 流式运行,输入 504×280,依赖 FlashInfer paged KV cache;由于从 π3 公开权重初始化,复现 Stage I 是可行的降级路径。综合看:评测可复现性高,训练复现属高成本且部分数据不可得。