Lucida:解析、生成与放置实现可组合的真实-仿真场景建模 Lucida: Parse, Generate, and Place for Composable Real-to-Sim Scene Modeling
保持解析-生成-放置顺序,把精度留给VLM闭环gizmo交互,实拍还原为可编辑仿真场景
前置知识
对象级场景图与证据束(Evidence Bundle)
场景图 $G=(V,E)$ 用节点表示物体实例、边表示支撑/包含/相邻等空间关系。Lucida 的核心数据结构是每个节点携带的证据束 $E_o=\{V_o, M_o, P_o, b_o, c_o\}$:$V_o$ 是该物体在多个视角下的观测图像,$M_o$ 是对应的掩码或框,$P_o$ 是部分点云,$b_o$ 是代表性 3D 框,$c_o$ 是类别名或指代描述。它把'这个物体在所有帧里长什么样、大概在哪'打包成一个可供后续模块消费的上下文。
解析阶段的输出就是场景图+证据束,生成阶段以它为条件合成完整资产,放置阶段从中取初始位姿与指代线索。不理解证据束就无法理解'每步只消耗可靠输入'这一设计原则如何落地。
Amodal 补全与图像转 3D(Image-to-3D)
Amodal 补全指推断物体被遮挡部分的完整形状与外观,输出一张'没有遮挡物'的理想图像。现代统一多模态模型使得通过图像编辑指令完成这件事变得可行:给定几个带标注的参考视角(Set-of-Mark 提示),编辑模型合成完整、孤立的对象图像。随后 image-to-3D 模型把这张单张完整图像升维成可用的 3D 资产网格。
Lucida 的 generate 阶段完全建立在这条'多视角证据→无遮挡图像→3D 资产'的路线上,是理解为什么生成不再需要干净分割点云的关键。
9-DoF 位姿与 ADD-S / 3D IoU 指标
9-DoF 位姿状态为 $x_t=(p_t, R_t, s_t)$:三维中心 $p_t$、旋转 $R_t\in SO(3)$、各向异性缩放 $s_t\in\mathbb{R}^3_+$。ADD-S 指标计算预测与真值有向表面之间的双向最近邻平均距离(本文记为 ADD-SB,单位米),ADD-SB@0.05 表示距离小于物体直径 5% 的样本百分比,是严格的对齐成功率;3D IoU 衡量预测与真值有向包围盒的重叠度,主要反映平移与尺度精度。
放置阶段的全部输出与论文的主实验表(Table 2/3/7)都用这些指标,不懂定义就无法读懂 92.0% 对 79.2% 这类数字的分量。
VLM 智能体与多轮 GUI 交互范式
视觉语言模型(VLM)把渲染图像当作输入、把文本当作输出,可以作为智能体在图形界面中操作:每轮读取当前界面截图(这里是把场景点云、物体资产叠加、gizmo 坐标轴渲染成图),发出一个可执行的动作(XML 标签包裹 JSON 载荷),环境执行后重新渲染给下一轮,形成多轮对话式闭环。动作序列构成一条 rollout,模型自己决定何时停止。
GizmoAct 把 9-DoF 位姿精化重新表述为这种 GUI 交互,这是本文最核心的形式化创新,全文的方法与训练都围绕它展开。
SFT、错误注入与 GRPO 强化学习
SFT(监督微调)让预训练 VLM 模仿专家轨迹。但纯模仿学不会'从自己的错误中恢复',因此采用 DART 式错误注入:向专家轨迹中植入损坏动作(欠修正、过冲、错轴),只对错误之后的恢复动作计算损失(掩码 $w_t$ 屏蔽注入 token)。GRPO 是组相对策略优化:同一 prompt 采样多条轨迹,以组内奖励排名计算优势;本文结合 DAPO 的动态采样($K=8$ 条、剔除全同层组)、token 级非对称裁剪、去除组标准差归一与 KL 惩罚,并加截断重要性采样(TIS)。
GizmoAct 的策略质量(尤其 RL 带来的旋转误差 45.19°→20.98°)直接由这套训练流程决定,是读懂消融实验的前提。
共视性(Covisibility)与关键帧选择
共视性 $c_{i\to j}=|C_{i\to j}|/|P_i|$ 度量帧 $i$ 中有多少三维点投影到帧 $j$ 后深度一致(容差 $\delta$),反映两帧的几何冗余。Lucida 用它与时间衰减项构造相似度 $s(i,j)$,按时间序遍历序列,只有与所有已选关键帧相似度都低于阈值的帧才被保留,从而以稀疏关键帧覆盖长序列。
解析阶段的第一步,消融(Table 5)显示换成均匀采样会使检测 mAP 从 0.597 掉到 0.516,是理解'几何感知'价值的最直接证据。
研究动机
可组合场景建模要把真实室内场景恢复成完整、可编辑的对象资产加上它们的空间排列,这是机器人仿真、具身智能、AR/VR 与内容创作直接消费的形式。现有路线各有硬伤:NeRF 与 3DGS 这类可微渲染重建能忠实复现房间,但输出是一个不可拆分的整体;对象级扩展(高斯分组、掩码监督等)仍绑定于观测到的几何,被遮挡的表面永远无法恢复;Real-to-Sim 系统及其依赖的 CAD 检索对齐方法虽能返回仿真就绪的场景,却用库内资产填充房间,保真度被封顶在数据库覆盖率上;交互式场景合成生成的房间合理却不锚定于任何真实采集。把任务拆成'解析-生成-放置'三步后,每一步又各自预设了杂乱采集无法满足的输入:解析被要求输出精确实例几何(干净掩码、纯净点云、度量 3D 布局),而遮挡让物体边界含混、重复家具让跨视角关联与去重不可靠;生成假设有无遮挡的居中视角或干净分割的点云;放置通常被表述为 6/9-DoF 位姿估计,假设资产与观测几何一致,而生成资产必有偏差、深度有噪声。端到端联合预测形状与位姿则两者互相拖累。由于三步固定顺序执行,任何一步的需求未满足都会污染其后所有步骤。
本文的目标是本文的目标是构建一个从有位姿的 RGB(-D) 观测到可编辑、对象级场景副本的完整系统:每个真实物体实例变成一个完整的 3D 资产(包括从未被直接观测到的表面),由 9-DoF 位姿(位置、朝向、各向异性缩放)安放回场景,并以场景图组织支撑、包含、相邻等空间关系,使产物可直接用于机器人仿真。与以往工作不同,作者明确要求每一步只消耗真实采集'可靠提供'的信息——多视角 RGB 证据、粗糙 3D 初始估计、指代文本——而把精度留给流水线末端的闭环步骤去达成。量化目标是在三个层面同时超越强基线:场景级 3D 检测对比 Boxer/WildDet3D,物体位姿估计对比 Any6D/SAM 3D/RecGen,系统级场景重建对比 SceneGen/SAM 3D,评测覆盖自建 R2S 基准、CA-1M 与 ADT 三个数据集。
与已有工作不同的是,本文的独特切入是'保持顺序、重新分配需求',灵感来自人类建模师的工作方式:看素材记录有什么、为每个物体建或取模型、把模型放进场景后对照观测微调——切换视角、修正残差,直到两者吻合。精度是这个过程的终点,而不是对起点的苛刻要求。具体体现为两个关键转译:其一,解析不再要求精确的实例重建作为输出,只负责发现实例、汇总多视角证据、给出代表性 3D 框供后续初始化与 grounding;其二,把放置从'回归一个绝对位姿'重新表述为'多轮 GUI 交互'——像在 3D 编辑器里选中物体,通过 gizmo 发出一系列增量编辑,VLM 策略在闭环中自己判断何时对齐,从而移除了 Render-and-compare 方法'渲染必须能逼近观测'且'需要外部收敛判据'两个前提。系统命名 Lucida 源自明箱(camera lucida)——把真实场景叠加到画布上的绘图辅助,恰好呼应其叠加与对齐的本质。
核心方法
直觉上,与其要求每个模块一开始就精确,不如让前面的模块'宽进'(只吃真实采集可靠提供的证据),把精度交给最后一个闭环模块收敛。技术路线是 parse–generate–place 三段。解析阶段(Sec 2.1)输入有位姿 RGB-D 观测 $I=\{(I_i,D_i,K_i,T_i)\}_{i=1}^N$,先做几何感知关键帧选择,在关键帧上用 VLM 发现实例、3D 检测器出框并跨帧分组,随后进行对象级全序列证据整合(把代表性 3D 框投影到所有帧作为提示做逐帧估计,必要时用视频分割传播到邻近帧并做多视角验证),再经关系感知的场景细化修正错误合并/拆分、补全缺失支撑物,输出场景图 $G=(V,E)$,每个节点携带证据束 $E_o=\{V_o,M_o,P_o,b_o,c_o\}$。生成阶段(Sec 2.2)从 $E_o$ 中挑选可见度高、几何一致且视角多样的互补视图,用 Set-of-Mark 提示让 VLM 组织锚定图与参考图并产出编辑指令,图像编辑模型合成无遮挡的完整对象图像,再由 image-to-3D 模型升成资产 $A_o$。放置阶段由 GizmoAct(Sec 2.3)接管:把资产与 3D 框、gizmo 坐标轴渲染叠加在场景点云上,VLM 每轮发出一个增量旋转/平移/缩放指令,闭环迭代直到自行预测 stop;可选后处理再统一约束支撑、碰撞与接触一致性(Sec 2.4),刻意与智能体解耦。
核心创新有三层。第一是'需求重分配'原则:不改变三步顺序,而是重新定义每步的输入输出契约——解析只产出证据而非精确重建,生成以证据为条件而非干净裁剪,放置接受失配资产和粗糙初值并在闭环末端收敛,因此遮挡、杂乱、资产失配都不再是先决条件。第二是 GizmoAct 的交互表述:状态 $x_t=(p_t,R_t,s_t)$,每轮把当前状态渲染成图形观测(原始图与资产/3D框/gizmo 叠加、辅助多视角、沿局部轴的正交视角、被点云遮挡区域的半透明绿色标记),VLM 读图后发出一个 XML 标签动作。两个设计消除经典难点:所有编辑都表达在 gizmo 定义的物体局部坐标系中,策略永不回归绝对位姿;平移与尺度以当前物体尺寸为单位($\delta p\odot s_t$),永不估计公制尺度。针对大初始旋转误差,增加 switch_obs 沿 6 个带符号轴重渲染加 permute_axis 一步完成 24 种轴对齐重定向,规避欧拉角万向锁。第三是与 Render-and-compare 的本质区别:更新不是从'渲染 vs 观测'差值回归出来的,而是 VLM 在 GUI 上的操作决策,何时停止由策略自己从渲染判断,不需要固定迭代数或外部收敛准则。
方法步骤详情
第一步关键帧选择:计算方向共视性 $c_{i\to j}=|C_{i\to j}|/|P_i|$,相似度 $s(i,j)=\frac{2c_{i\to j}c_{j\to i}}{\max(c_{i\to j}+c_{j\to i},\epsilon)}\left(\lambda+(1-\lambda)\exp(-|i-j|/\tau)\right)$,按时间序保留与已选关键帧相似度均低于阈值的帧。第二步实例发现:VLM 在关键帧识别实例、3D 检测器出框,按语义与几何一致性跨帧分组。第三步全序列证据整合:选出代表性 3D 框(不一致时用视频分割传播重选),投影到全部输入帧作提示做逐帧 3D 框估计,验证后保留为全序列证据。第四步关系感知细化:跨物体比较修正合并/拆分错误,推断支撑关系并补拍缺失支撑物。第五步资产生成:选少量互补视角,Set-of-Mark 标注目标,VLM 产出编辑指令,图像编辑模型合成完整孤立图像,image-to-3D 升为资产 $A_o$。第六步 GizmoAct 放置:$o_t=\mathcal{R}(A_o,x_t,E_o,v_t)$,$a_t\sim\pi_\theta(\cdot|o_{\le t},a_{<t})$,update_pose 满足 $R_{t+1}=R_tR_{\mathrm{ZXY}}(\delta r)$、$s_{t+1}=s_t\odot(1+\delta s)$、$p_{t+1}=p_t+R_{t+1}(\delta p\odot s_t)$(旋转先行,使 $\delta p$ 作用于下一个 gizmo 帧),策略认为对齐即发 stop;大旋转误差时先 switch_obs 重渲染、再 permute_axis 一步完成 24 种轴对齐重定向。第七步训练:在三个数据源(3D-FRONT+Mesa-Task、FoundationPose 重纹理、CA-1M train split)上用特权专家构造轨迹,注入损坏动作并只监督恢复动作做 SFT;再用 GRPO 在线强化,奖励 $r(\xi)=\frac{S}{8}\left(4+2\mathbb{1}[\ell_g{=}3]+2\mathbb{1}[\ell_R{=}3]+\mathbb{1}[a_T{=}\mathrm{stop}]\right)$,$S=\mathbb{1}[\ell_g\ge2]\mathbb{1}[\ell_R\ge2]$,由广义 3D IoU(界 0.75/0.85/0.925)与测地旋转误差(30°/10°/5°)量化四级;每 prompt 采 $K=8$ 条并剔除全同层组,采用 DAPO 式 token 级裁剪、去组标准差归一、TIS、无 KL 惩罚。
技术新颖性
与 MegaPose/FoundationPose 等 Render-and-compare 精化相比,GizmoAct 不假设渲染能逼近观测(生成资产的几何可以与实物失配),不需要外部收敛判据,且同时估计含各向异性尺度的 9-DoF 状态——传统方法极少超出 SE(3)。与 PlaceIt3D、FirePlace、VULCAN 等 VLM 场景布置智能体相比,目标从'语言约束下的摆放合理性'转为'对观测点云的公制精确对齐',且 GUI 抽象可迁移:同一回路可操纵 3D 框(检测/布局)或 gizmo 帧(朝向估计),还能消费多视角与虚拟正交渲染来消除单视角的尺度-深度歧义。与小型 RL 策略的离散位姿精化相比,预训练 VLM 带来跨类别、跨失配程度的泛化,单一策略即可适配 Boxer/Any6D*/SAM 3D 三种误差分布迥异的初始化而无需重训练(Table 3)。训练侧的'错误注入+仅监督恢复动作'与'量化奖励+动态采样'分别针对示范学习不会纠错、连续奖励引入优势噪声两个已知痛点,使 RL 增益集中在困难样本上:110 个非对称物体的硬子集上旋转误差从 45.19° 降到 20.98°,ADD-SB@0.01 从 6.4% 提到 11.8%,而无上下文的单步 SFT 变体在 @0.01 上只有 0.9%,证明闭环历史与 RL 缺一不可。
实验结果
论文在三个层面评估。场景级 3D 检测(Table 1):R2S-Scene 的 all 协议下 mAP 从 Boxer 的 0.351 提高到 0.592(约 +69%),filter 协议 0.355→0.597;CA-1M 上 0.171→0.180、0.373→0.390,四个协议全部第一——且本方法只用关键帧提示,Boxer 拿到全部帧提示仍落败。物体位姿估计(Table 2):R2S-Object 上 GizmoAct(max-4-view) 把 ADD-SB 从最强基线 RecGen 的 0.038 降到 0.017,@0.05 从 79.2% 提到 92.0%,3D IoU 从 0.500 提到 0.719;CA-1M 上 ADD-SB 0.046→0.021,@0.05 从 57.8%→83.4%,IoU 0.434→0.607;ADT 上 max-4-view 版 @0.05 达 90.0%、IoU 0.670。Table 3 显示同一策略无需重训练即可精化 Boxer/Any6D*/SAM 3D 三种初始化(R2S-Object @0.05 分别 90.4%/84.8%/91.2%)。系统级场景重建(Table 4):scene F-Score 0.924 对 SAM 3D 的 0.794 与 SceneGen 的 0.351;场景 Chamfer 0.010 m² 对 0.022 且两个方向都更低;BBox IoU 0.495 对 0.396;物体级 F-Score 0.736 对 0.704。消融(Table 5):均匀关键帧采样使 mAP 0.597→0.516;去全序列证据整合 mAP 0.535、GT-to-pred CD 0.011→0.025(漏检增多);去关系细化 mAP 0.526。Table 6:RL 训练分布对齐 Boxer 初始化后三个数据集 @0.05 再涨 1.6/5.5/8.3 个百分点。Table 7 硬子集(110 个非对称物体、大误差初始化):RL 把旋转误差从 SFT 的 45.19° 降到 20.98°,Rot.@5° 52.7%→67.3%,ADD-SB@0.01 从 6.4%→11.8%。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 场景级 3D 目标检测(R2S-Scene,all 协议) | 类无关 mAP(IoU 0.05–0.50) | 0.592 | Boxer 0.351(WildDet3D 0.125) | +69%,四个评测协议全部第一 |
| 物体位姿估计(R2S-Object,max-4-view) | ADD-SB@0.05 / 3D IoU | 92.0% / 0.719(ADD-SB 0.017) | RecGen(1 view) 79.2% / 0.500(ADD-SB 0.038) | +12.8 个百分点 / +0.219 |
| 物体位姿估计(CA-1M,max-4-view) | ADD-SB@0.05 / 3D IoU | 83.4% / 0.607(ADD-SB 0.021) | RecGen(1 view) 57.8% / 0.434(ADD-SB 0.046) | +25.6 个百分点 / +0.173 |
| 系统级场景重建(R2S-Scene) | Scene F-Score@0.1m / 场景 CD | 0.924 / 0.010 m² | SAM 3D 0.794 / 0.022 m²(SceneGen 0.351) | +0.130 / CD 降低约 55% |
| GizmoAct 训练策略消融(110 个非对称物体硬子集,大误差初始化) | 测地旋转误差 / Rot.@5° | 20.98° / 67.3%(RL 策略) | SFT 45.19° / 52.7% | 降低 24.21° / 提升 14.6 个百分点 |
局限与改进
作者明确承认两点:解析阶段漏掉的物体无法被后续生成或放置找回,错误只能向下游传递而无恢复机制;agentic 闭环目前只作用于最后的放置步骤,解析与生成仍是开环执行。我的补充观察:其一,系统链路极长,依赖关键帧 VLM、3D 检测器、视频分割跟踪、图像编辑模型、image-to-3D(Seed3D 2.0/SAM 3D)再叠加一个需 RL 训练的 VLM 策略,任何一环都会成为复现与延迟瓶颈,单个物体放置最多需 12 轮多图渲染的大模型推理;其二,评测依赖大量人工环节——CA-1M 与 R2S 的掩码需要手动过滤、9-DoF 位姿靠人工标注与 LiDAR 对齐,且 R2S 是自建基准(9-10 个场景、125-199 个物体)、协议由作者自定义,缺少第三方数据集上的系统级重建对比;其三,RL 训练显式排除了对称物体(测地旋转误差无法正确评分纹理不可辨别的朝向),而室内场景中椅子、杯凳等对称物体很常见,这部分对齐质量缺乏严格监督;其四,RL 奖励只在最终状态打分并广播到全部动作 token,长轨迹的信用分配被弱化,错误注入只能部分缓解。
独立分析的弱点
弱点一:上游单点故障。解析漏检即终局失败(作者承认),在杂乱、重复家具和小薄物体上尤其脆弱(CA-1M 的 all 协议 mAP 也只有 0.180,长尾类别仍难)。改进方向:引入主动感知,让系统在证据不足时规划新采集视角(移动机器人场景天然可行),或对低置信区域触发二轮检测与针对性补拍。弱点二:计算成本与延迟。每个物体要经历图像编辑、image-to-3D、再最多 12 轮多视图渲染的 VLM 推理,整场景串联后成本很高。改进方向:把收敛后的 GizmoAct 蒸馏为轻量回归头处理简单案例、只对困难样本保留大 VLM,或并行采样多个候选动作提前剪枝以减少轮数。弱点三:对称物体被排除在 RL 之外,实际部署必然会遇到。改进方向:采用对称等变奖励(ADD-S 式最近邻匹配)或对对称类别引入类别级朝向先验做弱监督。弱点四:自建基准加人工标注可能引入评估偏好。改进方向:在 ScanNet、ARKitScenes 等公开数据上做盲测对齐,并公开 R2S 的采集与标注协议。弱点五:假设静态室内与可靠深度,镜面/透明物体(深度失效)与动态物体未见讨论,可结合材质感知深度补全与不确定性门控来缓解。
未来方向
作者提出的方向:把闭环 agentic 处理扩展到整个 parse–generate–place 流水线,形成完全 agentic 框架——例如让智能体在解析阶段主动提出'该物体缺少支撑物,回到某个视角补看',在生成阶段发现资产不合理时触发重生成。基于其成果可延伸的方向:其一,系统化验证 GUI 抽象的可迁移性——用同一回路操纵 3D 框做场景检测与布局估计、操纵 gizmo 帧做朝向估计(文中已在相关工作中提及此接口的通用性);其二,把输出的可编辑资产与场景图接入机器人仿真器,闭环评估'重建保真度→sim-to-real 策略迁移成功率'的相关性,这正是该任务宣称的应用出口;其三,研究对称物体奖励、透明/反光材质深度噪声、重复实例消歧等鲁棒性问题;其四,把最终状态奖励改为过程奖励或步级优势估计,改善长轨迹信用分配;其五,将规则式后处理(支撑、碰撞、接触)升级为可微或生成式约束,与 GizmoAct 联合训练而非两段式解耦。
复现评估
论文提供了项目页(lucida-r2s.github.io),但正文未见代码、模型权重或 R2S 基准明确开源的承诺;R2S 的构建协议(R2S-Object 125 个物体/64 类、CA-1M 子集 199 个物体/125 类,人工掩码过滤与人工 9-DoF 位姿标注)描述详细但复刻人力成本很高。方法链路依赖大量外部大模型:关键帧 VLM、Boxer 检测器、视频分割跟踪、图像编辑模型、Seed3D 2.0 与 SAM 3D,以及作为策略底座的预训练 VLM(作者团队内部提供,致谢中说明),多数非开源可得。训练侧,SFT 需要三个数据源的合成专家轨迹(3D-FRONT、FoundationPose 重纹理渲染、CA-1M train split 加 SAM 3D 生成资产并人工对齐 LiDAR);RL 侧每迭代至少 40 prompt、320 条在线轨迹、每批优化 2 epoch,配合高吞吐渲染环境,需要多卡 GPU 集群,算力门槛显著高于一般视觉项目。综合判断:完整复现难度很高,比较现实的路径是等作者开源 R2S 数据与评测协议后,复现评测部分,或在开源 SFT 数据的前提下只复现 RL 阶段。
论文图表
teaser 展示:给定真实室内场景的多视角观测,方法构建对象级多视角证据、生成完整 3D 资产并放置成可组合重建;插图演示对物体模型做闭环旋转、平移、缩放精化,使其与观测场景几何对齐。
一图概括论文要解决的问题(实拍到可编辑仿真场景)与核心机制(闭环 gizmo 精化),是快速建立直觉的入口。