← 返回 2026-08-12

从静止状态观测重建铰接物体 Articulated Object Reconstruction from Rest-State Observation

Daeun Lee, Jaeah Lee, Woosung Kim, Haebeom Jung, Jaesik Park 📅 2026-07-30 👍 46 2026-08-17 18:30
3D重建 数字孪生 视觉语言模型 视频扩散模型 铰接物体 零样本分割

仅凭闭合状态单次观测,网格锚定交叉验证多模型输出,重建部件与关节参数

前置知识

铰接物体与关节参数

铰接物体指由多个刚体部件通过关节连接、可相对运动的物体,如带门和抽屉的柜子。常用关节模型有棱柱关节(平移,参数为方向 $\hat{v}$ 与位移 $d$)和旋转关节(参数为轴向 $\hat{\omega}$、轴上一点 $q$、角度 $\theta$),每个部件的运动可写成 SE(3) 变换。重建铰接物体即同时恢复部件几何 $\{M_k\}$ 与关节参数 $\{\Psi_k\}$。

本文的目标输出就是部件网格加关节参数(3.1 节),理解两类关节的参数化是读懂拟合公式 (5)(6) 与 Table 2/3 中轴角误差、轴位置误差、类型准确率指标的前提。

SE(3) 刚体变换与 Rodrigues 公式

SE(3) 是包含旋转与平移的三维刚体变换群。Rodrigues 公式把绕单位轴 $\hat{\omega}$ 旋转角 $\theta$ 写成矩阵 $R(\hat{\omega},\theta)$,点 $\mathbf{p}_0$ 绕过点 $q$ 的轴旋转后的位置为 $R(\hat{\omega},\theta_t)(\mathbf{p}_0-q)+q$,它是参数化旋转关节的标准正演模型。

3.3 节的关节拟合直接以该公式为运动模型,把预测 3D 点投影回 2D 与跟踪轨迹比对并最小化重投影误差,不理解它就看不懂优化的变量和损失是什么。

视觉语言模型与开放词汇分割

VLM 是视觉-语言对齐的模型,可接受图像加文本指令输出结构化语义(如部件层级树);SAM 类开放词汇分割模型接受文本或点提示,在图像上输出任意类别的实例掩码,两者均可零样本使用、无需任务训练。

本文用 GPT-5.2/Qwen3-VL 生成部件层级树、用 SAM3 生成分割掩码,两个模型的分歧正是协同精炼循环的纠错信号(3.2 节),也是 Table 4 消融研究的对象。

视频扩散模型与点轨迹跟踪

视频扩散模型(如 Wan2.2)根据条件图像与文本提示生成时序一致的视频;点轨迹跟踪器(如 CoTracker3)在视频中跟踪大量查询点的 2D 位置并输出逐帧轨迹。两者结合可以把一段'想象的运动'量化为可拟合的观测数据。

本文让视频扩散模型合成开合动画作为运动假设来源,再用 CoTracker3 提取稠密 2D 轨迹供关节拟合(3.3 节),Fig. 8 的消融也围绕生成质量与条件设计展开。

网格中间表示与 2DGS

显式网格 $\mathcal{M}=(V,F)$ 以顶点和面片编码表面连通性,天然支持遮挡推理、逐面标签与邻接图操作。2DGS 是把高斯泼溅约束为带法线二维圆盘的多视角重建方法,输出保尺度的几何且便于提取网格。

网格是全文的'锚':分割证据按面累积(公式 1-3)、图优化在网格邻接图上进行、穿透惩罚与轴精化都依赖网格几何,Table 5 还消融了 3DGS/SVRaster/2DGS 三种重建后端。

重投影误差

把 3D 模型预测的点用已知相机内参投影回图像平面,与实际观测(如跟踪到的 2D 点轨迹)之间的距离。最小化重投影误差是经典的参数估计思路,配合鲁棒损失与截断重拟合可以抑制离群对应的影响。

关节参数估计(3.3 节)就是最小化合成视频轨迹与刚体模型预测之间的重投影误差,运动类型判歧时也用两个模型的重投影误差孰小作为判据。

研究动机

构建可交互的数字孪生需要同时恢复三维几何和控制部件运动的运动学结构,但现有铰接物体重建方法都要求显式可观测的运动。Table 1 总结得很清楚:Ditto、PARIS、DTA、ArtGS、REArtGS/REArtGS++ 等重建方法需要在两个精心挑选的关节状态下采集多视角 RGB(-D) 图像,其中不少还要求预先指定可动部件数量(如 Ditto、PARIS 需 #Parts=2);LARM 用前馈预测但仍需两状态输入;Real2Code 虽只需单次观测却要求物体已处于展开状态、部件位移可见;Articulation in Motion 需要交互视频。而现实中家具最常见、最容易被规模化采集的恰恰是闭合状态——电商产品图、ScanNet、Replica 等数据集里几乎只有关着的柜子。可一旦没有运动线索,直接把基础模型用于闭合状态又各自失灵:VLM 预测的部件层级不完整,分割模型在部分视角漏检部件,视频扩散模型在开门时会幻觉出根本不存在的抽屉(Fig. 2)。

本文的目标是本文提出并形式化 rest-state(静止状态)重建问题:只给定物体单一闭合配置的网格观测(来源可以是多视角重建、单图 3D 生成或现成 3D 资产),自动输出 $K$ 个部件网格 $\{M_k\}_{k=1}^K$ 与 $K-1$ 组关节参数,部件数 $K$ 无需先验、自动确定。关节限定为覆盖绝大多数家具机构的棱柱关节 $\Psi_p=\{v\in\mathbb{R}^3, d\in\mathbb{R}\}$(平移方向与位移)与旋转关节 $\Psi_r=\{\omega\in\mathbb{R}^3, q\in\mathbb{R}^3, \theta\in\mathbb{R}\}$(轴向、轴上一点、角度)。定量目标是在合成基准 ACD(含 HSSD 与 ABO 资产)和真实 MultiScan 数据上,轴角度误差、轴位置误差、关节类型准确率与需要观测运动或依赖生成的基线相当甚至更优,同时保持度量尺度与几何保真,使输出可直接导出 URDF、供物理仿真与空间规划等下游应用使用。

与已有工作不同的是,本文的独特切入是把'缺乏运动观测'这一病态问题转化为'多模型证据在显式网格上交叉验证'的问题。两个关键观察支撑这一设计:其一,单个预训练模型输出噪声大且彼此矛盾,但分歧本身就是可利用的纠错信号——VLM 知道有哪些部件却数不准,分割模型能找到边界却不理解语义层级,把两者放进迭代循环互相修正,再用网格的表面连通性做遮挡推理与置信度加权融合,就能得到空间一致的部件结构;其二,视频扩散模型能'想象'闭合的抽屉如何打开,而生成的视频不必几何精确,只需运动类型与大致方向正确,因为最终关节参数是从 2D 轨迹对真实 3D 网格做重投影误差最小化拟合得到的,几何一致性而非视频保真度决定结果。相比之下,同处 rest-state 的 Articulate AnyMesh 等方法是顺序串联模型,噪声逐级传播,这正是本文要在结构上超越的对象。

核心方法

直觉上,Rest2Art 模仿人类'看着关上的柜子推断它如何打开':语义先验来自 VLM,运动想象来自视频扩散模型,但所有猜测都必须在真实的网格几何上通过验证才算数。技术路线分四个阶段。第一阶段获取静止状态网格:多视角输入用 2DGS 重建、单图输入用图像到 3D 生成模型、或直接采用扫描网格,规范化对齐后从 $N'$ 个最大化可动部件可见性的视角渲染。第二阶段做部件分割:GPT-5.2 提出部件层级树,SAM3 逐视角生成掩码,两者进入最多两轮的协同精炼循环,验证后的掩码经置信度加权提升到网格面上并做图优化。第三阶段估计关节:把部件掩码半透明叠加到质量最高的视角作为条件图,Wan2.2 加 VBVR LoRA 合成开合视频,CoTracker3 提取稠密 2D 轨迹,先分类运动类型,再最小化重投影误差拟合刚体关节模型。第四阶段网格补全:把壳状部件沿法线内推实体化,抽屉类部件再生成参数化内托盘,最终输出可供物理仿真的体积网格与关节参数。

核心创新一是 VLM 与分割模型的迭代协同精炼:从层级树 $T$ 提取语义提示集合 $S(T)=\{s_1,\dots,s_C\}$ 及期望实例数 $n(s,T)$,与每个视角实际检测的掩码数 $|M_{v,s}|$ 比对——完全一致则缓存为已验证证据;某类检测过多说明树不完整,把检测掩码以鲜艳颜色叠加回原图(让无纹理物体的边界可见)喂回 VLM 修订;检测不足则不急于砍树,先跨视角聚合证据再下结论。验证后的掩码经 z-buffer 渲染得到逐面支持集,按 $E(f,p)=\sum_{v\in V_p} w_p^v \cdot c_p^v \cdot \mathbb{1}[f\in\text{supp}(M_p^v)]$ 累积置信度加权证据,每面取证据最大的部件,再用网格邻接图做多源最短路径标签传播并回投 2D 验证。核心创新二是把视频扩散模型当'运动假设生成器'而非真值:用两个随机种子各合成一条视频独立拟合,类型一致才合并轨迹证据联合重拟合;旋转轴的单目深度歧义用'旋转导致子部件穿入父部件则惩罚'与部件边界主方向的软融合来解决。

方法步骤详情

第一步,网格获取:输入可为 2DGS 多视角重建(评测主用)、单图 3D 生成或扫描网格,规范化后从 $N'$ 个最大化可动部件可见性的视角渲染。第二步,层级-掩码协同精炼:GPT-5.2 预测层级树 $T$,SAM3 逐提示逐视角分割,按检测数与期望实例数一致/过多/过少三种情形处理,最多两轮;高置信掩码反投影为 3D 点再投影到其他视角作点提示,保证跨视角一致。第三步,证据提升与图精化:每部件选 top-K 视角,光栅化得面支持集,按置信度加权累积证据分配标签;再以各标签最大连通分量为种子,按最短路径 $\arg\min_p d_p(u)$ 传播标签,重标记顶点须回投落入对应 2D 掩码。第四步,运动分类:用位移变异系数(旋转高、棱柱低)与曲率分数判型,冲突时双模型拟合取误差小者。第五步,关节拟合:旋转按 Rodrigues 公式 $\mathbf{p}_t=R(\hat{\omega},\theta_t)(\mathbf{p}_0-q)+q$、棱柱按 $\mathbf{p}_t=\mathbf{p}_0+d_t\hat{v}$ 投影回 2D 鲁棒优化并截断重拟合。第六步,补全:沿法线内推实体化,抽屉生成参数化内托盘。

技术新颖性

与同处 rest-state 设定的 Articulate AnyMesh 相比,本质区别在模型组合方式:后者按模块顺序串联预训练模型,个体噪声直接传播,导致在部件边界不明显的物体上失败(ACD-ABO 类型准确率仅 38.94%);Rest2Art 让模型在网格锚定下迭代互校,同一指标达 73.38%。与生成式 URDFormer/Singapo 相比,本文是重建式表述,保留度量尺度与几何保真——生成式方法输出位于规范空间、关节轴对齐,评测前需事后尺度对齐,而本文直接从轨迹优化得到度量级参数。与两状态方法(ArtGS、REArtGS、REArtGS++)相比,本文证明预训练模型先验可以替代显式运动观测。方法论上,把 CoTracker 加刚体拟合这一原本用于真实运动观测的成熟技术迁移到'想象的运动'场景,并用轨迹截断、双种子一致性、网格穿透惩罚等机制系统性对抗生成伪影,是全文最有辨识度的贡献。此外全流程零训练、零部件标注,同一配置跨所有类别与数据集使用;消融还证明协同精炼本身可迁移——借给 Singapo 后 ABO 类型准确率从 41.47% 升至 67.94%。

Method overview. Rest2Art reconstructs articulated objects from rest-state inputs by co-refining part hierarchies and masks, lifting evidence onto the mesh, synthesizing videos for joint estimation, and completing interior geometry.
Fig. 3: Method overview. Rest2Art reconstructs articulated objects from rest-state inputs by co-refining part hierarchies and masks, lifting evidence onto the mesh, synthesizing videos for joint estimation, and completing interior geometry.
Co-refinement of hierarchy and part masks. Disagreements between the VLM hierarchy tree and SAM3 masks drive mutual correction. Validated masks are then back-projected onto the mesh to enforce cross-view consistency.
Fig. 4: Co-refinement of hierarchy and part masks. Disagreements between the VLM hierarchy tree and SAM3 masks drive mutual correction. Validated masks are then back-projected onto the mesh to enforce cross-view consistency.

实验结果

分割(Fig. 5):ACD-HSSD 上 Find3D、SAMesh、PartField 在颜色均匀、边界齐平的闭合家具上普遍失败,本文靠协同精炼避免该失败模式,甚至分割出真值都遗漏的旋钮。关节估计(Table 2):ACD-HSSD 上轴角 11.35°、轴位 0.85dm、类型准确率 74.49%,均为 rest-state 方法中最佳,超 Articulate AnyMesh(67.12%)约 7.4 个百分点;ACD-ABO 上 4.78°/0.20dm/73.38%,角误差较其 25.65° 大幅降低。两状态基线在合成多状态输入下崩溃:REArtGS++ 类型仅 59.38%;URDFormer 仅 16.23%/19.12%;Singapo 角误差 0.13° 但依赖尺度对齐。真实数据(Table 3):MultiScan 上类型 65.78%、角误差 17.23°、位置 0.26dm,全面优于 REArtGS++(48.74%)与 Articulate AnyMesh(12.63%)。消融:协同精炼使树准确率 62.3%→72.5%、52.2%→72.5%;2DGS 后端 IoU 0.97 最优;掩码叠加使幻觉率 23.1%→11.5%、准确开合率 69.2%→80.8%。泛化(Fig. 9):电商图、Replica、ScanNet++ 扫描均成功。

Comparison of articulated object reconstruction methods. If # Parts is given as a number, it indicates that methods require prior knowledge of the part count up to that value, while any denotes that methods discover parts without such priors.
Table 1: Comparison of articulated object reconstruction methods. If # Parts is given as a number, it indicates that methods require prior knowledge of the part count up to that value, while any denotes that methods discover parts without such priors.
Joint estimation comparison on the ACD dataset [15]. Ang., Pos., and Type denote axis angular error (°), position error (dm), and type accuracy (%), respectively.
Table 2: Joint estimation comparison on the ACD dataset [15]. Ang., Pos., and Type denote axis angular error (°), position error (dm), and type accuracy (%), respectively.
Ablation on model selection for co-refinement (⟳) on ACD dataset. T Acc. and # Parts Acc. denote hierarchy tree and per-part count accuracy(%).
Table 4: Ablation on model selection for co-refinement (⟳) on ACD dataset. T Acc. and # Parts Acc. denote hierarchy tree and per-part count accuracy(%).
Ablation on mesh reconstruction methods.
Table 5: Ablation on mesh reconstruction methods.
Qualitative comparison of part segmentation on ACD dataset [15]. PartField* uses a fixed 20-cluster setting, while PartField uses the ground-truth part count. Our method produces more accurate part boundaries and segments all interactable parts, including knobs (top row) missing from ground-truth annotations.
Fig. 5: Qualitative comparison of part segmentation on ACD dataset [15]. PartField* uses a fixed 20-cluster setting, while PartField uses the ground-truth part count. Our method produces more accurate part boundaries and segments all interactable parts, including knobs (top row) missing from ground-truth annotations.
Qualitative comparison of joint estimation on ACD dataset [15]. Each example shows the predicted rest and articulated states.
Fig. 6: Qualitative comparison of joint estimation on ACD dataset [15]. Each example shows the predicted rest and articulated states.
Qualitative ablation on mesh reconstruction methods.
Fig. 7: Qualitative ablation on mesh reconstruction methods.
Qualitative ablation on video generation. We compare Wan2.2 [46] with and without VBVR LoRA [47], conditioned on the original image (top) and our mask overlay (bottom). Yellow boxes highlight implausible motion.
Fig. 8: Qualitative ablation on video generation. We compare Wan2.2 [46] with and without VBVR LoRA [47], conditioned on the original image (top) and our mask overlay (bottom). Yellow boxes highlight implausible motion.
Generalization to Diverse Inputs. Our method applies to single-image inputs and scanned meshes, in addition to multi-view captures.
Fig. 9: Generalization to Diverse Inputs. Our method applies to single-image inputs and scanned meshes, in addition to multi-view captures.
查看结构化数据
任务指标本文基线提升
ACD-HSSD 关节估计(rest-state) 类型准确率 Type Acc (%) 74.49 Articulate AnyMesh 67.12;Singapo 59.42;REArtGS++ 59.38 +7.37(对最强 rest-state 基线 Articulate AnyMesh)
ACD-HSSD 关节估计 轴位置误差 Axis Pos. (dm) 0.85 Articulate AnyMesh 1.31;ArtGS 1.37;REArtGS++ 2.87 全场最佳,较最强基线降低约 35%
ACD-ABO 关节估计 轴角度误差 Axis Ang. (°) 4.78 Articulate AnyMesh 25.65;REArtGS++ 45.92 较最强 rest-state 基线降低 81%(25.65→4.78)
MultiScan 真实场景关节估计 类型准确率 Type Acc (%) 65.78(覆盖率 48.94%) REArtGS++ 48.74;Articulate AnyMesh 12.63;REArtGS 64.40 +17.04(对 REArtGS++),同时轴误差 17.23°/0.26dm 均为最优
部件层级协同精炼(消融) 层级树准确率 Tree Acc (%) 72.5(Qwen3-VL ⟳SAM3) Qwen3-VL 单独 52.2;GPT-5.2 单独 62.3 +20.3 / +10.3,部件数准确率同步提升 16.0

局限与改进

作者明确承认的局限:视频生成模型的物理合理性仍是瓶颈,会变形或幻觉部件,依赖 VBVR LoRA 与掩码叠加缓解但未根除(掩码叠加后幻觉率仍有 11.5%);生成视频误差随时间累积,只能截断使用可靠前段;旋转轴存在单目深度歧义,需借助网格穿透惩罚与部件边界主方向先验消解。我自己的观察:其一,Table 2 中两状态基线的输入是'从生成视频挑末帧 + Qwen-Image-Edit 多视角化'合成的,存在域偏移,其崩溃部分应归因于这种不太公平的对照;其二,关节模型仅限棱柱与旋转两类,未覆盖多自由度或连续关节;其三,MultiScan 覆盖率仅 48.94%,近半场景不可评估,真实世界结论的统计效力有限;其四,top-K 视角、两轮精炼上限、可见性阈值等超参的敏感性未系统分析;其五,管线串联 GPT-5.2、SAM3、Wan2.2、CoTracker3 等多个大模型,推理成本高且未量化端到端延迟;其六,网格补全对抽屉内部只是参数化近似,并非真实内部几何。

独立分析的弱点

第一,视频假设的质量上限:掩码叠加后幻觉率仍有 11.5%,意味着约十分之一部件的运动假设系统性错误,对翻板门、上滑门等罕见开合方式,视频扩散模型的训练分布覆盖可能不足;改进方向是用可微渲染直接在 3D 中优化运动假设,或用图像编辑模型合成'目标状态'再插值,绕开视频时序退化问题。第二,双种子一致性检查过于薄弱:仅两条视频,若两条碰巧同错则会被自信采纳;可采样多条视频做 RANSAC 式共识聚合,对分歧样本降低置信度并触发用户反馈。第三,误差沿管线传播:部件分割错误会同时破坏关节拟合与'相邻部件边界主方向'先验,文中未建模不确定性传播;可让证据提升输出软标签与方差,供下游拟合加权使用。第四,评估局限于容器类家具(门/抽屉/旋钮),对剪刀升降、多连杆等复杂机构无验证,可在 PartNet-Mobility 等更大规模资产库上补充评测。第五,双种子独立拟合再合并的策略计算上有冗余,可共享条件特征与跟踪结果以降低成本。

未来方向

作者在结论中提出两个方向:扩展到更复杂的运动学结构(多自由度、嵌套层级、连续关节),以及提升视频生成模型的物理合理性。基于本文成果还可自然延伸:其一,把 rest-state 管线接入场景级数字孪生,直接处理 ScanNet/Replica 整屋扫描,批量把其中的家具转为可交互 URDF,让用户在仿真中交互并以真实交互数据反哺关节精化,形成'想象—验证—交互—修正'的闭环;其二,协同精炼范式(多模型分歧驱动互校正 + 几何锚定验证)是通用思想,可推广到场景图估计、可供性识别等其他多基础模型融合任务;其三,让视频扩散模型在训练或推理时显式感知网格约束(如以深度图/法线图为条件),减少几何不一致的生成;其四,轻量化——用小型 VLM 与蒸馏分割模型替换 GPT-5.2+SAM3、用少步数扩散采样,使管线可在消费级 GPU 上准实时运行;其五,把部件补全从参数化近似升级为学习式形状先验(如大规模资产上训练的自编码器),提高抽屉内部等不可见结构的真实性。

复现评估

论文未声明开源代码,复现难度中高。积极方面:所有评测数据集公开——ACD 基于 HSSD 与 ABO 资产、MultiScan 公开下载;管线各组件均有公开权重或服务:GPT-5.2(可用开源 Qwen3-VL 替代,Table 4 显示协同精炼后两者树准确率同为 72.5%)、SAM3、Wan2.2 与 VBVR LoRA、CoTracker3、2DGS、MASt3R-SfM、Qwen-Image-Edit;附录 A.2/A.4/A.6 提供了视角选择、提示构造与网格补全的实现细节。挑战在于:端到端串联约七个子系统,工程量大;视频生成是主要算力开销(每个部件需两个随机种子的视频);网格来源、规范对齐、top-K 视角数、可见性截断阈值等实现细节可能存在未写明的工程决断;MultiScan 的预处理(场景级标注转实例)需自行实现。总体上,熟悉 3D 重建与扩散模型的团队预计需数周工程努力才能对齐 Table 2 的数字;建议先复现消融实验(Table 4/5)验证关键设计,再逐段拼装完整管线。