Roomer:面向3D室内布局合成的反思式对象接地编辑与修复框架 Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis
把布局残缺陷转为对象级局部修复,验证门控只提交安全编辑。
前置知识
3D室内布局合成 (3D Indoor Layout Synthesis)
在给定建筑空间(墙体、门窗、地板轮廓)内,自动安排家具(床、沙发、餐桌、衣柜等)的位置、朝向和尺度,使之同时满足语义合理、几何无碰撞、功能可用的任务。主流方法从早期基于规则和优化的搜索(Merrell 2011)、发展到自回归Transformer(ATISS)、图网络(SceneHGN)、扩散模型(DiffuScene)、约束引导生成(PhyScene),再到近期用LLM/VLM做语义规划(LayoutGPT、Holodeck、ReSpace)。其评测通常结合分布质量(FID/KID)与物理有效性(碰撞率/越界率)。
Roomer不是再做一个生成器,而是为「已经生成完毕但仍带缺陷」的布局做局部修复,必须先理解布局合成的主流范式与典型缺陷类型,才能理解为什么全场景重生成不是最优解、为什么需要对象级的局部编辑。
对象接地与对象归因 (Object Grounding / Object Attribution)
把一个抽象的「场景级故障」(如「这个房间有碰撞」)拆解并绑定到具体、可寻址的场景实体(如「床头柜实例 #nightstand_3 与床 #bed_1 重叠 0.15 m²」)的过程。接地要求系统给每个对象一个稳定引用(stable reference),使后续的编辑指令能精确作用到同一个实例上,而不会因为渲染、序列化或重新解析而指向错误对象。
Roomer的核心命题是「残缺陷是稀疏、局部、可归因到少数对象的」,整个RoReview机制就是为了把测量到的违约绑定到 implicated objects。理解不了对象接地,就无法理解为什么本文能做「只动一个对象、其余保留」的局部修复。
验证门控提交 (Verification-Gated Commit)
一种「先试探、再决定」的事务式更新机制:每个候选编辑先作用到一个临时布局上,然后对整个场景重新跑规则评估器;只有当候选同时满足「目标违约被消除、不引入新的硬违约键、所有受保护的已满足关系仍然成立、结构有效、全局残差下降」五条约束时才被正式提交,否则回滚。它类似于数据库事务的ACID思想在场景编辑上的应用。
本文Eq.(3)的五子句验证门是「Safe Repair 96.27%、New Hard Error 0.00%」的根本保障。消融实验表明去掉验证会让54.27%的场景引入新的硬错误,这是理解Roomer相对Full-Scene JSON Rewrite优势的关键。
视觉-语言模型的条件化与交叉注意力 (VLM Conditioning / Cross-Attention)
在多模态大模型(本文用Qwen2.5-VL-7B-Instruct)中,把外部几何/数值证据注入语言解码过程的技术。典型做法是在解码器的若干层插入残差交叉注意力适配器:将语言隐藏态投影到低维(512维)作为query,将外部证据token作为key/value,再把输出投影回原维度并与原隐藏态相加。公式形如 $eH^\ell = H^{\ell,sa} + \gamma^\ell W_o^\ell \, \mathrm{CrossAttn}^\ell(W_q^\ell \bar H^{\ell,sa}, \bar Z, \bar Z)$。
Roomer的Geometry-Conditioning Adapter把16个证据实体的几何token注入到Qwen2.5-VL的第22/24/26/28层,这是planner能读懂「距离/方向/重叠/净空」差异的核心。消融显示去掉它会令Target Resolution从98.96%降到88.40%。
3D-FRONT / 3D-FUTURE 数据集
3D-FRONT(Fu et al. 2021a)是大规模「带家具与语义的3D房间」数据集,提供房间墙体、门窗几何与人工设计的家具摆放;3D-FUTURE(2021b)是对应的带纹理家具3D模型库。二者合起来是室内场景合成的事实标准训练/评测来源。本文用其中满足目标房间规格的合法布局作为Roomer-CC的种子,构造67,550个「损坏-修复」配对。
Roomer-CC的全部监督信号都派生自3D-FRONT的合法布局经过「可控损坏」后的逆向修复;评测用的common-1100也是3D-FRONT测试房间经Qwen-Image生成后的冻结cohort。理解数据来源才能判断Roomer的覆盖范围为什么限于住宅类房间。
分布质量与物理有效性指标 (FID/KID/SCA Gap/OOB/COL)
FID(Fréchet Inception Distance)和KID(Kernel Inception Distance)度量生成布局与真实分布在Inception特征空间的距离,越低越像真实分布;SCA Gap(Scene Classification Accuracy Gap)用真实/生成二分类器的精度偏离50%的程度衡量可分辨性。OOB(out-of-bounds)是家具网格越出地板的物体比例,COL(collision)是参与持久碰撞对的唯一物体比例(经5mm分离测试)。这些指标共同构成Roomer-Eval的前两层。
Table 1的核心比较就是FID/KID/SCA Gap/OOB/COL/Practical六个指标。要判断「Roomer是否在保分布质量的同时提升物理有效性」,必须先理解每个指标度量的对象层级(场景级vs物体级)和方向(越低/越高越好)。
研究动机
现有室内布局生成器虽然能产出「看上去全局合理、语义连贯」的布局,却常常残留局部违约:家具互相碰撞、物体越出房间边界、家具遮挡门窗洞口、动线被堵死。文章用一组冻结的common-1100评测cohort量化了问题的严重性——即便是作者自己微调的Qwen-Image上游生成器(Ours-Initial),越界率OOB仍达24.40%、碰撞率COL达29.52%;而外部生成器更糟:DiffuScene-RS的OOB/COL为38.18%/28.44%,InstructScene为37.49%/28.50%,SemLayoutDiff-RS高达49.43%/60.42%。更隐蔽的是,即使布局无碰撞且在边界内,也可能因为净空不足、动线断裂而「物理合法却不可用」。两条主流路线都无法对症下药:数据驱动方法(ATISS、DiffuScene、InstructScene)用场景级目标函数生成,不会把残缺陷归因到具体对象;LLM规划类方法(LayoutGPT、Holodeck、Scenethesis)的修订主要服务于「满足用户指令」或「场景级改善」,而非基于绑定到具体对象的几何测量。结果是:要么重生成整个场景(可能破坏已合理的家具与空间关系并引入新违约),要么做语义修订却无法保证物理可验证。
本文的目标是本文要打造一个「反思式、对象接地」的局部修复框架Roomer,其具体目标是:给定任意上游生成器产出的完整布局,系统能(1)把残缺陷测量出来并归因到 implicated 对象实例,(2)以结构化的「StatePatch」提议局部编辑(只动一个目标对象),(3)用一个确定性求解器在有限候选空间里找到可执行的精确参数,(4)只有当候选通过「全场景重新验证」(目标违约消除、不引入新硬违约、保护关系不被破坏、结构有效、全局残差下降)才提交,否则回滚。同时配套两个资产:训练用数据Roomer-CC(67,550个对象接地修复配对)和评测协议Roomer-Eval(分布质量+物理有效性+实用性三维)。在冻结的common-1100上,作者希望证明局部修复能在不退化分布质量的前提下,显著降低OOB/COL并提升Practical,并能把同样的修复流程plug-and-play地迁移到四个外部生成器。
与已有工作不同的是,本文的独特切入角度来自一个被既有工作忽视的洞察:生成布局里的残缺陷通常是「稀疏、局部、可归因到少数对象及其局部几何关系」的,因此应当被表述成「验证门控的局部状态修复」而非「全场景重生成」。这一点恰好填补了两个空白:其一,已有方法都没有把测量证据(measured evidence)和对象归因(object attribution)绑在一起——学习类方法只做场景级目标,LLM类方法虽有视觉反馈但不做基于具体对象几何的确定性测量;其二,已有基准(FID/KID/碰撞率/SceneEval)只关心分布相似度和基础物理有效性,几乎不评估「物理合法的布局是否真的可用」。Roomer同时把「诊断(RoReview)」与「规划(StatePatch)」解耦、把「语义决策(planner)」与「数值精确性(确定性solver)」解耦、把「修复时检测」与「最终评测」解耦,从而让局部修复既可训练又可验证。
核心方法
Roomer的整体思路是「先把场景变成可寻址的对象状态,再把违约测量绑定到具体对象,然后让VLM做语义决策、确定性求解器做数值精确化,最后用全场景验证门控把关」。直觉上,它像一个「室内设计师在已完成的房间里巡视」:先量出哪张床头柜和床打架(测量)、指出责任对象(归因)、决定「把床头柜往左挪」(语义动作)、试算具体挪多少厘米(数值)、再确认挪完之后整间房没有新问题(验证)、不行就回滚换下一个候选。技术路线上,模型由四块串联:(1)RoState——把布局序列化为对象可寻址的规范表示 $S_t=(A,Y_t,F_t,\Pi_t)$,含不可变建筑 $A$、已提交家具布局 $Y_t$、几何派生的功能区 $F_t$、稳定引用映射 $\Pi_t$;(2)RoReview——规则评估器检测违约实例,调度器选一个活动实例 $v_t=(r_t,\rho_t)$,序列化为 $q_t=(\kappa,\tau,E,W,\delta)$,含稳定键、类型、参与实体、关系角色、类型化测量;(3)几何条件化的VLM planner——以渲染图、目标规格、RoState、RoReview为输入,预测schema受限的StatePatch $b^t_p=(b^t_a,b^t_\xi,b^t_{\alpha_0})$,含动作/目标/参数种子;(4)确定性求解器与验证门控——先验证并评估归一化种子,被拒则按「种子距离+编辑幅度」排序生成有限候选邻域,第一个通过Eq.(3)五子句验证的候选才提交。整个循环重复到「无违约/全部阻塞/预算$K$耗尽」为止。
核心创新是「把布局校正表述为验证门控的局部状态修复」而非全场景重生成,并据此把任务分解成三个本质区别于已有工作的环节。第一,RoReview只做诊断不做规划——它把每个测量到的违约绑定到具体实体与关系角色(如「床是anchor、净空区是protected、侵入家具是obstructer、净空缺口0.15m」),却刻意不规定该用什么动作修复,把语义决策留给planner。这与LayoutGPT/Holodeck等「按用户指令做场景级修订」形成本质区别。第二,planner与solver职责分离——VLM负责「该动哪个对象、做什么动作」(语义强项),确定性求解器负责「具体挪几米、转几度」(数值精确性强项),且planner给出的连续参数种子从不被直接提交,永远先经确定性验证。第三,验证门控使用「稳定硬违约键集合」$H$ 而非违约计数,杜绝「消一个碰撞却引入另一个」的虚假修复;同时用「受保护已满足关系」$Z^{keep}_t$ 强制非目标对象在身份/类别/位姿/尺度/朝向上完全不变,从而严格保障局部性。消融里去掉RoReview会让Target Resolution崩到2.44%,去掉验证会让54.27%的场景引入新硬错误,证明这三点缺一不可。
方法步骤详情
完整修复流程分七步。第一步初始布局生成:用rank-64 DiT LoRA微调的Qwen-Image把建筑条件图+结构化房间提示映射到512×512俯视语义布局,解析器把RGB映射回语义标签、滤除伪影与房间无关类别、抽取连通分量作家具实例、再用预训练APM补全属性,得到结构化初始布局$Y_0$。第二步RoState构造:$S_t=(A,Y_t,F_t,\Pi_t)$,功能区$F_t$含门保护区、床侧净空区、餐桌操作区、主动线,均由当前对象几何派生而非固定标注。第三步RoReview构造:规则评估器检测可用规则实例,调度器按整数优先级(碰撞10、越界20、门阻挡30、窗阻挡40、动线断裂50……)排序选一个活动实例,序列化为$q_t$。第四步几何条件化StatePatch规划:planner接收渲染图$I_t$、目标$G$、RoState、RoReview;几何分支最多编码16个证据实体为512维token,由8个Repair Queries聚合,注入解码器第{22,24,26,28}层(零基索引[21,23,25,27])的残差交叉注意力;planner输出六类动作之一(MOVE/ROTATE/SCALE/INSERT/DELETE/REPLACE)的目标与参数种子。第五步确定性实例化:先做schema/引用/动作校验,再评估归一化可执行种子(如MOVE的八方向$D_8$、ROTATE的有符号角度),被拒则按种子距离+编辑幅度生成有序回退邻域(MOVE的距离阶梯0.05→1.20m、ROTATE的±180/±90/±45/±15°等)。第六步验证门控提交:候选$p$只作用于临时布局$Y^p_t=Y_t\oplus p$,重算所有功能区与规则实例,当且仅当 $H^p_t\setminus H_t=\varnothing$、$Z^{keep}_t\subseteq Z^p_t$、$C^p_t=1$、$V^p_t\le V_t-\varepsilon_V$($\varepsilon_V=10^{-6}$)且目标键$\kappa(v_t)\notin U(Y^p_t)$时才接受,第一个通过的候选提交,否则回滚。第七步循环:成功提交清空阻塞集、无候选则把稳定键加入阻塞集、所有问题阻塞或预算$K$(默认10)耗尽则终止。
技术新颖性
技术新颖性体现在五个互相支撑的设计上。其一,首次把布局校正形式化为「验证门控的局部状态修复」,并以事务回滚保证安全性,区别于Full-Scene JSON Rewrite(消融显示其Target Resolution仅32.48%、New Hard Error 32.64%、Safe Repair仅1.91%)。其二,RoReview把「测量-归因」与「规划」解耦——证据是绑定到对象的几何测量(净空缺口、侵入比、重叠深度、越界距离、角 deficit、通道宽度 deficit),但动作选择完全交给planner,这种「测而不修」的设计让监督信号可由「已知可行的逆向StatePatch」自然提供。其三,几何条件化适配器以零初始化($W_o^\ell=0$、$\gamma^\ell=1$)起步,初始时网络等价于冻结骨干,再渐进学习;query/cross-attention矩阵Xavier初始化,保证梯度流到输出投影——这是一种「不破坏预训练、又能注入结构化数值证据」的轻量条件化范式。其四,planner-seed-first确定性搜索把语义决策与数值精确化分离:消融显示Direct Seed(只跑planner种子)的TR仅65.70%、Seed-Free(纯确定性搜索)TR 90.70%,而Seed-First完整系统TR 98.96%,证明二者互补。其五,Roomer-CC用六类可控损坏(MOVE/ROTATE/SCALE/INSERT/DELETE/REPLACE)从合法3D-FRONT布局派生67,550个修复配对,每例都附带对象接地证据与已知可行逆向StatePatch,并通过「触发-归因-逆向修复无新硬违约」三重过滤(整体保留率74.5%)保证监督质量,填补了现有数据集「只有完整布局、缺配对故障输入」的空白。
实验结果
实验在冻结的common-1100(777卧室/155客厅/168餐厅)上进行,核心发现分五层。第一层是密度控制的最终布局比较(Table 1):Ours-Final在SCA Gap 12.46、OOB 8.66%、COL 17.50%、Practical 82.98%四项上全部最优,FID 60.20与KID 7.82也较Ours-Initial改善;ReSpace在FID(57.42)/KID(5.10)上仍领先。相对自身初始化,Roomer把OOB从24.40%砍到8.66%(−15.74pp)、COL从29.52%砍到17.50%(−12.02pp)、Practical从72.50%抬到82.98%(+10.48pp),三个分布指标也同步改善,证明局部修复「主要强化物理有效性与实用性而不退化分布质量」。第二层是跨生成器迁移(Table 2/A15):把同一冻结修复流程套到四个外部生成器输出上,OOB/COL/Practical对每个生成器都改善——ReSpace从14.72/36.56/66.43→1.16/7.61/75.12,DiffuScene-RS从38.18/28.44/45.09→6.98/6.95/47.73,InstructScene从37.49/28.50/40.99→5.67/5.88/45.70,SemLayoutDiff-RS从49.43/60.42/57.77→32.83/43.92/66.86;分布指标12组配对中10组改善(仅ReSpace KID与DiffuScene SCA Gap例外)。第三层是受控消融(Table 3/A17):去掉RoReview使Target Resolution暴跌到2.44%、Practical 50.39%甚至低于初始72.50%,证明对象归因是「前提而非辅助」;去掉几何适配器TR降到88.40%;Direct Seed TR 65.70%、Seed-Free 90.70%、Full-Scene JSON Rewrite TR 32.48%且New Hard 32.64%、去验证New Hard 54.27%;完整方法TR 98.96%、New Hard 0.00%、Non-target Preservation 99.94%、Safe Repair 96.27%。第四层是迭代收敛与自适应计算(Figure 4/A18):K=1即达TR 31.12%、K=3达72.52%、K=5达91.16%、K=7达97.32%、K=10达98.96%;由于已解决场景退出活跃集,平均每场景仅3.756次planner调用,比固定10轮少62.44%。第五层是专业验证(Table 4):10位室内设计背景评估者对90个独立冻结布局盲评900次,按Practical分层后批准率随等级单调上升——Low 23.3%(95%CI[11.8%,40.9%])、Medium 56.7%([39.2%,72.6%])、High 83.3%([66.4%,92.7%]),Cochran-Armitage趋势检验 $Z=4.67$、$p=3.07\times10^{-6}$,Krippendorff $\alpha=0.65$,强支持Practical与专业可用性判断一致。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 密度控制的最终布局比较(common-1100) | OOB(越界物体比例↓) | Ours-Final 8.66% | Ours-Initial 24.40%;ReSpace 14.72%;DiffuScene-RS 38.18%;InstructScene 37.49%;SemLayoutDiff-RS 49.43% | 相对Ours-Initial降低15.74pp,并优于所有基线,列全部方法最优 |
| 密度控制的最终布局比较(common-1100) | COL(持久碰撞物体比例↓) | Ours-Final 17.50% | Ours-Initial 29.52%;ReSpace 36.56%;DiffuScene-RS 28.44%;SemLayoutDiff-RS 60.42% | 相对Ours-Initial降低12.02pp,全部方法最优 |
| 密度控制的最终布局比较(common-1100) | Practical(实用性规则微平均↑) | Ours-Final 82.98% | Ours-Initial 72.50%;ReSpace 66.43%;DiffuScene-RS 45.09%;InstructScene 40.99% | 相对Ours-Initial提升10.48pp,全部方法最优;并经专业验证确认与人工判断单调一致(p=3.07e-6) |
| 密度控制的最终布局比较(common-1100) | SCA Gap(场景分类可分辨度↓) | Ours-Final 12.46 | Ours-Initial 19.20;ReSpace 21.73;DiffuScene-RS 16.57;SemLayoutDiff-RS 34.12 | 相对Ours-Initial降低6.74,全部方法最优;FID 60.20、KID 7.82也较初始化改善但ReSpace仍领先 |
| 外部生成器配对迁移(ReSpace输出) | OOB / COL / Practical | After: 1.16% / 7.61% / 75.12% | Before: 14.72% / 36.56% / 66.43% | OOB −13.56pp、COL −28.95pp、Practical +8.69pp,三类指标全部改善 |
| 外部生成器配对迁移(SemLayoutDiff-RS输出,最难案例) | OOB / COL / Practical | After: 32.83% / 43.92% / 66.86% | Before: 49.43% / 60.42% / 57.77% | OOB −16.60pp、COL −16.50pp、Practical +9.09pp,但残留误差仍高,说明最终质量受上游限制 |
| 受控消融-组件隔离(common-1100同初始状态) | Strict Safe Repair(严格安全修复↑) | Ours-Final 96.27% | w/o RoReview 0.45%;w/o Geom 81.64%;Direct Seed 55.18%;Seed-Free 89.64%;Full JSON 1.91%;w/o Verif 23.18% | 完整方法相对最强变体Seed-Free +6.63pp,验证门控+对象归因+几何条件化三者缺一不可 |
| 受控消融-组件隔离(common-1100同初始状态) | Target Resolution(目标违约解决率↑) | Ours-Final 98.96% | w/o RoReview 2.44%;w/o Geom 88.40%;Direct Seed 65.70%;Full JSON 32.48% | 去掉对象归因几乎完全失效(2.44%),证明「识别责任对象」是修复的前提 |
| 迭代收敛与自适应计算(冻结K=10轨迹前缀) | Target Resolution / 平均planner调用 | K=10时TR 98.96%,平均3.756次调用/场景 | 固定10轮调用 | 比固定10轮节省62.44%的VLM调用,同时保留长尾收益(K=5已达91.16%) |
| 专业可用性验证(90布局×10评估者) | 高Practical层批准率 / 趋势检验 | High层83.3%批准,Z=4.67, p=3.07e-6 | Low层23.3%批准 | 批准率随Practical等级单调上升,统计显著,验证Practical作为可用性代理的有效性 |
局限与改进
作者在结论中明确承认两点局限:其一,Roomer目前仅覆盖预定义的住宅类规则集,仅支持卧室/客厅/餐厅三类房间;其二,修复只能在其有限的「动作特定候选空间」内进行(如MOVE的八方向+固定距离阶梯、ROTATE的离散角度集合),超出覆盖范围或无可接受候选的问题将无法解决——SemLayoutDiff-RS在修复后仍残留32.83% OOB和43.92% COL就是这种「上游太差、候选空间够不到」的体现。从我的观察补充:第三,分布质量并非全面领先,ReSpace在FID(57.42 vs 60.20)和KID(5.10 vs 7.82)上仍占优,说明Roomer的局部修复会略微偏向「修物理」而牺牲少量分布相似度。第四,Practical是规则级微平均,作者也强调它「不是建筑规范合规、不是穷举人机工程、不是美学质量」,因此高分不等于完美可用。第五,门摆代理是几何近似而非精确模拟(取开门90°扇形为proxy,忽略家具高度),0.60m通道宽度对所有场景一刀切,可能与真实人机需求存在偏差。第六,Roomer-CC训练用的床侧净空阈值是固定0.45m,而Roomer-Eval用 $0.30\times w_{bed}$ 的比例阈值,训练/评测定义不一致,可能让模型在评测阈值上的表现被轻微高估或低估。
独立分析的弱点
独立分析后我认为有五处值得改进。第一,规则库与动作空间的有限性是最大瓶颈:现有六动作+离散候选阶梯(如MOVE最远1.20m、ROTATE固定角度)在「需要大尺度重构」的场景(如家具整体重排)上力不从心,SemLayoutDiff-RS修复后仍43.92% COL即是证据;改进方向是引入「学习式候选生成」或层次化动作(先粗后细),以及把候选预算与违约严重度自适应绑定。第二,规则覆盖限于住宅三类房间,对厨房(操作三角)、卫生间(洁具净空)、商业空间(疏散动线)、户外场景完全空白;改进方向是把Roomer-Eval的五族规则扩展为可插拔规则模板,并让RoReview的schema支持领域自定义。第三,门摆代理与0.60m通道阈值过于粗糙——真实门可能是双开、推拉、外开,通道宽度应随使用场景(走廊vs卧室门口)变化;改进方向是用真实门铰链+开门轨迹做精确仿真,并把通道阈值做成场景相关的连续函数。第四,planner依赖Qwen2.5-VL-7B,虽然自适应调用把均值压到3.756次/场景,但在大规模批处理时仍是显著开销,且论文未报告端到端延迟;改进方向是用更小的蒸馏planner或把planner做成「先分类是否需要修复、再决定调用」的两阶段,以及报告wall-clock时间。第五,Practical与FID/KID之间存在轻微张力(局部修物理会牺牲分布相似度),论文没有给出「如何在分布质量与物理有效性之间权衡」的统一目标;改进方向是把分布距离作为软约束加入验证门控(如允许FID上升不超过某阈值的候选),或训练一个能同时优化二者的多目标planner。
未来方向
作者在结论里给出的明确方向是「扩展规则库与候选生成,以支持更广的房间类型与更丰富的功能需求」。基于本文成果我认为可延伸出五条值得追的研究路线。其一,把Roomer从「后处理修复」升级为「生成-修复联合训练」:让上游生成器在训练时就接收Roomer的违约梯度反馈,使生成阶段就少产生可归因缺陷,而非事后再修。其二,把确定性候选空间替换为「条件扩散/流匹配」生成连续参数:当前MOVE/ROTATE/SCALE都是离散阶梯,一个以违约测量为条件的小型扩散头可以输出任意精度的 $(\Delta x,\Delta y,\Delta\theta)$,从而把Seed-First的TR从98.96%进一步逼近100%。其三,从单对象编辑扩展到「小簇编辑」:有些违约(如动线断裂)本质需要同时移动2-3个对象,可以在保持验证门控的前提下把StatePatch的target从单对象泛化为「受控对象簇」,并用图神经网络预测簇成员。其四,把Practical从规则级扩展为「人机工程+美学」联合评测:引入人体姿态可达性、视线遮挡、色彩与对称性等软指标,并用本文的专业验证协议(10评估者盲评)做大规模校准。其五,迁移到非室内领域:对象接地的验证门控修复范式天然适用于机械装配(零件干涉修复)、机器人摆放(抓取可达性修复)、城市地块规划(红线/日照合规修复),值得做跨域验证。
复现评估
复现评估从四方面看较为乐观。数据可获得性:全部派生自公开的3D-FRONT/3D-FUTURE,common-1100是3D-FRONT测试房间(777卧室/155客厅/168餐厅)经Qwen-Image生成的冻结cohort,Roomer-CC从3,952个训练房间派生67,550个修复配对(训练61,010/验证3,270/测试3,270),房间级分层保证源房间及其衍生损坏不跨split,构造统计(Table A1)与每个动作的保留率(整体74.5%)都有记录。训练配置完整:Qwen-Image用rank-64 DiT LoRA、4 epoch、15,808步、1×A800 80GB(Table A6);planner基于Qwen2.5-VL-7B-Instruct,rank-8 LoRA(5.046M参数)+几何模块(约27.446M参数)、5 epoch、9,535步、2×A800-SXM4-80GB、有效batch 32、cosine调度5%warmup、种子42(Table A10),全部超参公开。评测协议透明:Roomer-Eval的FID/KID/SCA Gap/OOB/COL/Practical实现细节(包括CleanFID clean模式、5mm分离测试、0.60m通道、$0.30w_{bed}$净空阈值)在附录I/J完整给出,并强调「密度控制只用合法性与物体数、绝不用评测指标选候选」,冻结候选遍历顺序与种子可追溯性(Table A16)也有记录。复现难度:算力上需要至少2张A800 80GB训练planner、1张训练Qwen-Image,对中小团队可承担;工程上难点在于几何条件化适配器的零初始化注入、RoReview/RoState的稳定引用系统、以及六类动作的确定性候选空间实现,这些都需要较精细的工程量。代码/权重开源状态:论文未在正文显式声明,但从Figure A1/A2与补充视频看作者有完整artifact,需关注后续release。综合判断,按论文给出的配置在common-1100上复现OOB 8.66%/COL 17.50%/Practical 82.98%是可行的,跨生成器迁移结果也可复现。
论文图表
三栏对比图:左栏「Generated Indoor Layout」展示一个全局合理但带局部缺陷的布局(床头柜与床碰撞、家具越界、动线被堵);中栏「Full-Scene regeneration」警示整体重生成会扰动已合理区域并引入新违约;右栏「Roomer」展示对床头柜做局部Move、对衣柜做局部Move后,目标违约被解决而已合理区域被保留,并标注Collision/Obstruction/Blocked circulation三类缺陷与新违约被避免。
这张图用一图讲清「为什么要做局部修复而非全场景重生成」这一核心动机,是理解整篇论文problem formulation的视觉入口,没有它读者很难直观感受「全局合理、局部有缺陷」这一关键观察。