← 返回 2026-07-24

TableVerse:面向通用化操作的大规模桌面场景数据集(基于真实世界布局还原) TableVerse: A Large-scale Tabletop Dataset with Real-world Grounded Layouts for Generalizable Manipulation

Boyuan Wang, Yue Zhang, Xutao Xue, Xueyu Song, Yu Sun 📅 2026-07-23 👍 6 2026-07-29 18:30
Real2Sim 仿真数据集 场景重建 抓取与运动规划 机器人操作

真实图像自动重建十万个物理一致的桌面仿真场景与抓取轨迹

前置知识

Real2Sim

Real2Sim 指将真实世界观测(如单张图像、视频)转换为可在物理仿真器中加载和交互的数字化资产与场景的工作流。与'凭文本想象生成布局'的 procedural generation 不同,Real2Sim 强调从真实数据中确定性地恢复物体尺寸、位姿和接触关系,使生成的场景在物理上可信、可仿真、可用于训练机器人策略。

本文的核心贡献就是一条全自动的 Real2Sim 流水线,理解这个范式能解释作者为何宣称能消除传统方法高达 70%-90% 的场景碰撞率。

6-DoF 位姿与 ICP 配准

6-DoF(六自由度)位姿描述物体在三维空间中的位置 $(x,y,z)$ 与朝向(通常用旋转矩阵 $R \in SO(3)$ 表示)。ICP(Iterative Closest Point)是一种经典点云配准算法,通过迭代寻找最近点对并最小化它们之间的距离来对齐两组点云,从而回归出精确的刚体变换。

本文用 Depth Anything 3 估计单目深度得到场景点云,再通过 z 轴旋转粗搜索 + ICP 精配准来恢复每个物体的真实公制尺寸和 6-DoF 位姿,这是后续碰撞消解和物理仿真成立的前提。

MuJoCo 物理仿真与凸分解(CoACD)

MuJoCo 是一款面向接触动力学的快速物理仿真器,常用于机器人学习。原始三角网格不适合直接做碰撞检测,因此通常先用 CoACD(Approximate Convex Decomposition)等近似凸分解工具将物体拆分为若干凸块,再用这些凸块参与仿真,以兼顾精度与数值稳定性。

TableVerse 用 MuJoCo 做复合物体'自由落体装配'与最终的'重力稳定化',并用 CoACD 预处理网格以避免仿真伪影,理解这一点才能明白为何 0.0% 碰撞率的场景可直接加载进仿真器。

6-DoF 抓取合成与 cuRobo 运动规划

6-DoF 抓取合成指算法从点云预测一系列候选抓取位姿 $g_i = (R_i, t_i)$(旋转 $R_i$ 与平移 $t_i$),常用生成式扩散方法(如 GraspGen)。cuRobo 是 NVIDIA 的 GPU 加速运动规划库,能在关节空间快速优化出无碰撞轨迹。

本文用 GraspGen 生成候选抓取,再用'顶向优先'阈值 $\vec{a_i} \cdot \vec{z_w} \leq \gamma_{strict}$ 过滤,并用 cuRobo 规划出六阶段(预抓、抓、抓后、预放、放、放后)无碰撞轨迹,这是其自动生成专家演示的关键。

研究动机

通用化机器人操作策略的能力本质上受限于大规模、高保真场景数据的可获得性。现有自动化生成方法多采用文本到布局的 LLM 幻觉或简化过程化生成:它们生成的布局往往过度稀疏、过于整洁,且存在严重的几何穿透(mesh interpenetration),无法用于稳定的物理仿真。当面对真实人类环境中稠密、混乱、带垂直堆叠和容器嵌套的桌面场景时,这些范式几乎彻底失败。具体而言,作者测试发现 MIDI 在真实数据上场景碰撞率高达 90.0%、SAM3D 达 81.0%、SceneMaker 达 72.0%,意味着绝大多数生成结果根本无法加载到仿真器中训练策略。

本文的目标是本文的具体目标是构建一条全自动、无需人工干预的 Real2Sim 流水线,能直接把网络上未经脚本化的真实桌面图像转换为物理一致、仿真就绪的 3D 环境,要求做到:恢复准确公制尺寸、保留真实物体拓扑(含容器内嵌套物的独立可操作结构)、彻底消除网格穿透并保证机械稳定性;同时在此基础上自动合成任务条件的无碰撞抓放专家轨迹,最终规模化产出一个能支撑泛化操作策略学习的高保真数据集,并以 100 个真实样本上 Scene Collision Rate 与多维度 GPT-Score 等指标量化验证其相对 MIDI、SAM3D、SceneMaker 的优势。

与已有工作不同的是,本文的独特切入角度在于范式转换——从'基于想象的布局生成'转向'从真实图像确定性重建'。与依赖抽象符号先验、布局稀疏分散的 LLM 路线不同,TableVerse 用确定性感知到物理的工作流保留真实世界的尺寸、拓扑和接触力学;与只重建最外层容器、忽视嵌套内容的 MIDI/SAM3D/SceneMaker 等单视图方法不同,本文显式地解构复合资产(容器+内含物分别重建并自由落体装配),并引入 Layout-Consistent Collision Rectification(LCCR)模块在严格保留宏观布局的前提下去除穿透,从而填补了'可见却不可操作'的现实鸿沟。

核心方法

整体思路是:用单张真实图像作为唯一输入,串联'感知—重建—几何纠错—物理稳定—轨迹生成'五个阶段,把概率性的空间幻觉替换为确定性的感知到物理流程。技术路线上,先用 Seed-1.8 做开放词汇检测、SAM2 做分割、SAM3D 重建 3D 网格、Depth Anything 3 提取场景点云并重力对齐,再做粗到细的 ICP 配准得到每个物体的公制尺寸与 6-DoF 位姿;随后用 LCCR 模块沿布局保持方向消除横向穿透、调整 z 轴消除纵向穿透;最后用 MuJoCo 重力仿真让物体自然落定,并集成 GraspGen+cuRobo 自动合成抓放轨迹。整条流水线把成千上万张真实图片转换成了 10 万个物理一致、可直接加载的 MJCF 场景。

核心创新点是 Layout-Consistent Collision Rectification(LCCR)几何纠错模块。它的本质区别在于:直接把带穿透的布局塞进物理引擎会因深层几何相交产生爆炸性非物理约束力、瞬间炸飞或永久扭曲场景,而 LCCR 选择在交给仿真器之前先用三层流程显式消除宏观重叠——分层接触分组与接地、径向场景图横向纠错、纵向解缠与物理稳定。纠错严格保留原始方位角语义:对每个非根组 $G_{(k)}$,沿其径向单位向量 $\vec{v}_{(k)} = (c_{(k)} - c_{root})/\|c_{(k)} - c_{root}\|_2$ 向外平移,求解最小距离 $d^*_{(k)} = \min\{d \geq 0 \mid (G_{(k)} + d\vec{v}_{(k)}) \cap A_{k-1} = \emptyset\}$,从而在不打乱布局的前提下零碰撞地放置物体。

方法步骤详情

完整步骤分四阶段加一条轨迹支线。(1)实例提取:Seed-1.8 开放词汇检测区分规则与复合物体并给出包围盒与内含物计数,SAM2 提取精确掩码,液体/粉末退化为单实体。(2)复合物解构:SAM3D 把容器与内含物分别重建为独立网格,放入隔离 MuJoCo 环境做自由落体仿真,使内含物自然落入容器形成有效接触。(3)尺寸与位姿对齐:Depth Anything 3 提取单目点云并用桌面/地面掩码对齐重力,去噪后先沿 z 轴 Chamfer 距离最小化粗搜索再 ICP 精配准,回归 6-DoF 位姿与公制尺寸,用 CoACD 凸分解。(4)LCCR 与物理稳定:按 ≥50% 俯视面积重叠聚成层叠组、<50% 视为横向实体;以最中心组为根,按到根距离升序逐个沿径向向量 $\vec{v}_{(k)}$ 外推消除横向穿透;组内按 xy 投影面积把小底面物体上抬消除纵向穿透;最后导入 MuJoCo 重力仿真闭合微间隙。轨迹支线:GraspGen 预测抓取并用 $\vec{a_i}\cdot\vec{z_w}\leq\gamma_{strict}$ 筛选,按空间关系采样放置位姿并用 AABB 校验 $|\Delta x|\geq b_{src,x}+b_{adj,x}+\epsilon$,cuRobo 优化六阶段关节轨迹。

技术新颖性

技术新颖性体现在四点。其一,首次提出观察驱动的全自动 Real2Sim 框架,把未经脚本的网络媒体直接转为仿真就绪环境,区别于依赖 LLM 文本幻觉或程序化生成的范式。其二,提出 LCCR 几何纠错框架,通过分层场景图优雅地解缠相交网格,与基于物理的稳定化步骤紧耦合,能在严格保留宏观布局的同时彻底消除穿透,是 0.0% 碰撞率的直接来源。其三,复合资产解构解决了既往方法'可见却不可操作'的痛点——容器与其内含物分别重建并自由落体装配,使内含物保持独立可操作结构属性。其四,把 MLLM(Gemini 2.5 Pro)当作严格的数据裁判,对多视角拼接图执行七维评估(可用性门控、严重标签错误检查、置信度校准、物理属性预测、质量打分、物体重标注、抓放任务生成),并把任务指令闭环馈入轨迹合成,形成场景生成与任务生成的闭环耦合。

Figure 2: Overview of the TableVerse pipeline for automated tabletop scene synthesis.
Figure 2: Figure 2: Overview of the TableVerse pipeline for automated tabletop scene synthesis.
Figure 3: Physics-guided assembly workflow for composite object generation.
Figure 3: Figure 3: Physics-guided assembly workflow for composite object generation.
Figure 4: Detailed schematic of the Layout-Consistent Collision Rectification (LCCR) module.
Figure 4: Figure 4: Detailed schematic of the Layout-Consistent Collision Rectification (LCCR) module.
Figure 5: Detailed schematic of the MLLM-driven curation and annotation pipeline.
Figure 5: Figure 5: Detailed schematic of the MLLM-driven curation and annotation pipeline.
Figure 6: Visualization of diverse tabletop texture augmentations in TableVerse.
Figure 6: Figure 6: Visualization of diverse tabletop texture augmentations in TableVerse.

实验结果

核心发现分三组。第一,主对比(100 张真实样本):TableVerse 的 Scene Collision Rate 为 0.0%,而 MIDI 90.0%、SAM3D 81.0%、SceneMaker 72.0%,传统方法几乎完全不可仿真;GPT-Score 中本文 LF 7.14、VQ 7.08、GQ 7.03,平均排名 1.38,全面领先 SceneMaker(LF 4.90、Rank 3.22)、SAM3D(碰撞率 81%)、MIDI(几何分仅 4.83)。第二,消融(表 2):Direct 碰撞率 79.0%;加 LCCR 后 0.0%(消除碰撞但留悬浮与微间隙);再加 MuJoCo 仿真仍 0.0% 且闭合间隙,验证 LCCR 布局保持优化与物理稳定化各司其职。第三,数据集规模:TableVerse-100K 含 10 万唯一且物理一致的场景、近 100 万独立物体实例、超 3.5 万语义类别,配 1700+ 纹理做域随机化,是已知最大且物理可信的桌面操作数据集之一。

Table 1: Quantitative comparison against baseline single-view scene synthesis methods across 100 in-the-wild test samples.
Table 1: Table 1: Quantitative comparison against baseline single-view scene synthesis methods across 100 in-the-wild test samples.
Table 2: Ablation study of the LCCR module across 100 evaluation scenes.
Table 2: Table 2: Ablation study of the LCCR module across 100 evaluation scenes.
Figure 7: Comparisons with Alternative Methods.
Figure 7: Figure 7: Comparisons with Alternative Methods.
Figure 8: Qualitative ablation of the LCCR module.
Figure 8: Figure 8: Qualitative ablation of the LCCR module.
查看结构化数据
任务指标本文基线提升
单视图桌面场景重建 Scene Collision Rate (%) ↓ 0.0% MIDI 90.0% / SAM3D 81.0% / SceneMaker 72.0% 相对 MIDI 降低 90 个百分点,碰撞率从'几乎不可仿真'到'完全可仿真'
MLLM 多维场景质量评估 GPT-Score 平均排名 ↓ 1.38 MIDI 2.73 / SAM3D 2.67 / SceneMaker 3.22 平均排名最优,跨场景偏好第一
场景布局保真度 Layout Fidelity (LF) ↑ 7.14 MIDI 5.81 / SAM3D 5.73 / SceneMaker 4.90 较最强基线 SAM3D 高 1.41 分
场景视觉质量 Visual Quality (VQ) ↑ 7.08 MIDI 5.08 / SAM3D 5.44 / SceneMaker 5.48 较最强基线 SceneMaker 高 1.60 分
几何质量 Geometry Quality (GQ) ↑ 7.03 MIDI 4.83 / SAM3D 5.47 / SceneMaker 4.85 较最强基线 SAM3D 高 1.56 分
LCCR 模块消融 Scene Collision Rate (%) ↓ Direct+LCCR+Sim = 0.0% Direct = 79.0% 碰撞率下降 79 个百分点,LCCR 是关键

局限与改进

作者承认的局限主要来自 SAM3D 与数据输入:容器内物体常因分辨率低、占像素少而被 SAM3D 重建为完全错误的物体;对全场景所有物体逐个跑 SAM3D 极其耗时,难以高效批量处理,未来希望用一次场景级推理替代逐物体生成。笔者补充观察:(1)全部依赖 SAM3D 与 Depth Anything 3 的单目重建质量,意味着对反光、透明、薄壁物体的尺寸与位姿仍可能存在系统性偏差,文中未给出公制尺寸误差的量化指标;(2)主对比实验为保证公平仅给基线最外层容器掩码,这种'对基线不利'的设定虽合理但易被质疑;(3)GPT-Score 本质是 MLLM 打分,存在评判者偏差且未与真实几何误差对照;(4)轨迹'专家'质量缺乏真机成功率验证,物理仿真合格不等于真机可迁移。

独立分析的弱点

弱点一:重建质量受单目 3D 生成模型瓶颈制约,容器内低分辨率物体易被 SAM3D 重建为异形物,且逐物体重建耗时高——改进方向是引入场景级一次性 3D 生成或多视角融合,并对内含物做超分辨率增强。弱点二:缺乏公制尺寸与位姿的定量误差评估(如 Chamfer 距离、IoU、位姿误差),仅靠 MLLM GPT-Score 评判主观性强——改进方向是采集少量含深度真值的桌面场景建立几何评测基准。弱点三:抓放专家轨迹未在真机验证 Sim2Real 可迁移性,1700+ 纹理随机化虽缓解域差距但纹理之外的光照、相机噪声、动力学摩擦建模不足——改进方向是加入真机评测与更全面的域随机化。弱点四:LCCR 的 ≥50% 面积重叠阈值与径向外推策略在极端稠密、多层嵌套或环状布局下可能误判层叠关系,缺少对此的鲁棒性分析——改进方向是把阈值做成可学习或自适应,并引入更丰富的拓扑约束。

未来方向

作者明确提出的未来方向:让 3D 生成模型支持对整场景做一次性推理以加速批量处理,缓解 SAM3D 逐物体生成的速度瓶颈。基于本文成果可延伸的方向包括:(1)把 TableVerse-100K 用于大规模 visuomotor 策略训练并量化策略在真实桌面任务上的泛化与零样本迁移能力;(2)扩展到非桌面场景(地面、货架、冰箱内部)以构建家庭级操作数据基础;(3)把 LCCR 与物理稳定化封装为通用插件,服务于其他 Real2Sim 流水线;(4)引入可微物理与抓取成功率反馈,实现场景质量与可操作性的联合优化;(5)结合真实遥操作数据做 Sim2Real 校准,验证自动生成轨迹在真机上的有效性。

复现评估

复现评估中等偏上但存在明显门槛。有利因素:流水线由多个公开可组合模块构成(Seed-1.8 检测、SAM2 分割、SAM3D 重建、Depth Anything 3 深度、CoACD 凸分解、GraspGen 抓取、cuRobo 运动规划、MuJoCo 物理、Gemini 2.5 Pro 评测),并提供了项目主页 https://bytedance.github.io/TableVerse;LCCR 与物理稳定化算法描述详细到公式层面(径向向量、最小平移距离、AABB 间隙校验等)可独立复现;评测协议(100 张真实样本、Scene Collision Rate、GPT-Score 三子维)清晰。不利因素:数据采集与自动化视觉过滤的内部流程未完全公开,从'网络图像池'到 10 万场景的端到端计算成本未披露;1700+ 纹理来源虽标注但完整集合与许可证需自行整理;MLLM 七维评估依赖 Gemini 2.5 Pro 的私有 API,复现打分需相同模型且 prompt 完整披露;生成 10 万场景需要可观 GPU 资源(尤其 SAM3D 与 cuRobo),算力门槛不低。