← 返回 2026-08-04

Roomer:面向3D室内布局合成的反思式对象接地编辑与修复框架 Roomer: Reflective Object-Grounded Model Editing and Repair for 3D Indoor Layout Synthesis

Lingwei Dang, Ziyan Qiu, Jiajia Cheng, Shishuo Shang, Zhenhao Zhang, Yufei Zhu, Qingxin Xiao, Pan Liu, Shenghui Huang, Yun Hao, Juntong Li, Qingyao Wu 📅 2026-08-03 👍 16 2026-08-09 18:30
3D-FRONT 3D室内布局合成 反思式修复 室内场景修复 对象接地推理 视觉-语言模型 验证门控闭环

把布局残缺陷转为对象级局部修复,验证门控只提交安全编辑。

前置知识

3D室内布局合成 (3D Indoor Layout Synthesis)

在给定建筑空间(墙体、门窗、地板轮廓)内,自动安排家具(床、沙发、餐桌、衣柜等)的位置、朝向和尺度,使之同时满足语义合理、几何无碰撞、功能可用的任务。主流方法从早期基于规则和优化的搜索(Merrell 2011)、发展到自回归Transformer(ATISS)、图网络(SceneHGN)、扩散模型(DiffuScene)、约束引导生成(PhyScene),再到近期用LLM/VLM做语义规划(LayoutGPT、Holodeck、ReSpace)。其评测通常结合分布质量(FID/KID)与物理有效性(碰撞率/越界率)。

Roomer不是再做一个生成器,而是为「已经生成完毕但仍带缺陷」的布局做局部修复,必须先理解布局合成的主流范式与典型缺陷类型,才能理解为什么全场景重生成不是最优解、为什么需要对象级的局部编辑。

对象接地与对象归因 (Object Grounding / Object Attribution)

把一个抽象的「场景级故障」(如「这个房间有碰撞」)拆解并绑定到具体、可寻址的场景实体(如「床头柜实例 #nightstand_3 与床 #bed_1 重叠 0.15 m²」)的过程。接地要求系统给每个对象一个稳定引用(stable reference),使后续的编辑指令能精确作用到同一个实例上,而不会因为渲染、序列化或重新解析而指向错误对象。

Roomer的核心命题是「残缺陷是稀疏、局部、可归因到少数对象的」,整个RoReview机制就是为了把测量到的违约绑定到 implicated objects。理解不了对象接地,就无法理解为什么本文能做「只动一个对象、其余保留」的局部修复。

验证门控提交 (Verification-Gated Commit)

一种「先试探、再决定」的事务式更新机制:每个候选编辑先作用到一个临时布局上,然后对整个场景重新跑规则评估器;只有当候选同时满足「目标违约被消除、不引入新的硬违约键、所有受保护的已满足关系仍然成立、结构有效、全局残差下降」五条约束时才被正式提交,否则回滚。它类似于数据库事务的ACID思想在场景编辑上的应用。

本文Eq.(3)的五子句验证门是「Safe Repair 96.27%、New Hard Error 0.00%」的根本保障。消融实验表明去掉验证会让54.27%的场景引入新的硬错误,这是理解Roomer相对Full-Scene JSON Rewrite优势的关键。

视觉-语言模型的条件化与交叉注意力 (VLM Conditioning / Cross-Attention)

在多模态大模型(本文用Qwen2.5-VL-7B-Instruct)中,把外部几何/数值证据注入语言解码过程的技术。典型做法是在解码器的若干层插入残差交叉注意力适配器:将语言隐藏态投影到低维(512维)作为query,将外部证据token作为key/value,再把输出投影回原维度并与原隐藏态相加。公式形如 $eH^\ell = H^{\ell,sa} + \gamma^\ell W_o^\ell \, \mathrm{CrossAttn}^\ell(W_q^\ell \bar H^{\ell,sa}, \bar Z, \bar Z)$。

Roomer的Geometry-Conditioning Adapter把16个证据实体的几何token注入到Qwen2.5-VL的第22/24/26/28层,这是planner能读懂「距离/方向/重叠/净空」差异的核心。消融显示去掉它会令Target Resolution从98.96%降到88.40%。

3D-FRONT / 3D-FUTURE 数据集

3D-FRONT(Fu et al. 2021a)是大规模「带家具与语义的3D房间」数据集,提供房间墙体、门窗几何与人工设计的家具摆放;3D-FUTURE(2021b)是对应的带纹理家具3D模型库。二者合起来是室内场景合成的事实标准训练/评测来源。本文用其中满足目标房间规格的合法布局作为Roomer-CC的种子,构造67,550个「损坏-修复」配对。

Roomer-CC的全部监督信号都派生自3D-FRONT的合法布局经过「可控损坏」后的逆向修复;评测用的common-1100也是3D-FRONT测试房间经Qwen-Image生成后的冻结cohort。理解数据来源才能判断Roomer的覆盖范围为什么限于住宅类房间。

分布质量与物理有效性指标 (FID/KID/SCA Gap/OOB/COL)

FID(Fréchet Inception Distance)和KID(Kernel Inception Distance)度量生成布局与真实分布在Inception特征空间的距离,越低越像真实分布;SCA Gap(Scene Classification Accuracy Gap)用真实/生成二分类器的精度偏离50%的程度衡量可分辨性。OOB(out-of-bounds)是家具网格越出地板的物体比例,COL(collision)是参与持久碰撞对的唯一物体比例(经5mm分离测试)。这些指标共同构成Roomer-Eval的前两层。

Table 1的核心比较就是FID/KID/SCA Gap/OOB/COL/Practical六个指标。要判断「Roomer是否在保分布质量的同时提升物理有效性」,必须先理解每个指标度量的对象层级(场景级vs物体级)和方向(越低/越高越好)。

研究动机

现有室内布局生成器虽然能产出「看上去全局合理、语义连贯」的布局,却常常残留局部违约:家具互相碰撞、物体越出房间边界、家具遮挡门窗洞口、动线被堵死。文章用一组冻结的common-1100评测cohort量化了问题的严重性——即便是作者自己微调的Qwen-Image上游生成器(Ours-Initial),越界率OOB仍达24.40%、碰撞率COL达29.52%;而外部生成器更糟:DiffuScene-RS的OOB/COL为38.18%/28.44%,InstructScene为37.49%/28.50%,SemLayoutDiff-RS高达49.43%/60.42%。更隐蔽的是,即使布局无碰撞且在边界内,也可能因为净空不足、动线断裂而「物理合法却不可用」。两条主流路线都无法对症下药:数据驱动方法(ATISS、DiffuScene、InstructScene)用场景级目标函数生成,不会把残缺陷归因到具体对象;LLM规划类方法(LayoutGPT、Holodeck、Scenethesis)的修订主要服务于「满足用户指令」或「场景级改善」,而非基于绑定到具体对象的几何测量。结果是:要么重生成整个场景(可能破坏已合理的家具与空间关系并引入新违约),要么做语义修订却无法保证物理可验证。

本文的目标是本文要打造一个「反思式、对象接地」的局部修复框架Roomer,其具体目标是:给定任意上游生成器产出的完整布局,系统能(1)把残缺陷测量出来并归因到 implicated 对象实例,(2)以结构化的「StatePatch」提议局部编辑(只动一个目标对象),(3)用一个确定性求解器在有限候选空间里找到可执行的精确参数,(4)只有当候选通过「全场景重新验证」(目标违约消除、不引入新硬违约、保护关系不被破坏、结构有效、全局残差下降)才提交,否则回滚。同时配套两个资产:训练用数据Roomer-CC(67,550个对象接地修复配对)和评测协议Roomer-Eval(分布质量+物理有效性+实用性三维)。在冻结的common-1100上,作者希望证明局部修复能在不退化分布质量的前提下,显著降低OOB/COL并提升Practical,并能把同样的修复流程plug-and-play地迁移到四个外部生成器。

与已有工作不同的是,本文的独特切入角度来自一个被既有工作忽视的洞察:生成布局里的残缺陷通常是「稀疏、局部、可归因到少数对象及其局部几何关系」的,因此应当被表述成「验证门控的局部状态修复」而非「全场景重生成」。这一点恰好填补了两个空白:其一,已有方法都没有把测量证据(measured evidence)和对象归因(object attribution)绑在一起——学习类方法只做场景级目标,LLM类方法虽有视觉反馈但不做基于具体对象几何的确定性测量;其二,已有基准(FID/KID/碰撞率/SceneEval)只关心分布相似度和基础物理有效性,几乎不评估「物理合法的布局是否真的可用」。Roomer同时把「诊断(RoReview)」与「规划(StatePatch)」解耦、把「语义决策(planner)」与「数值精确性(确定性solver)」解耦、把「修复时检测」与「最终评测」解耦,从而让局部修复既可训练又可验证。

核心方法

Roomer的整体思路是「先把场景变成可寻址的对象状态,再把违约测量绑定到具体对象,然后让VLM做语义决策、确定性求解器做数值精确化,最后用全场景验证门控把关」。直觉上,它像一个「室内设计师在已完成的房间里巡视」:先量出哪张床头柜和床打架(测量)、指出责任对象(归因)、决定「把床头柜往左挪」(语义动作)、试算具体挪多少厘米(数值)、再确认挪完之后整间房没有新问题(验证)、不行就回滚换下一个候选。技术路线上,模型由四块串联:(1)RoState——把布局序列化为对象可寻址的规范表示 $S_t=(A,Y_t,F_t,\Pi_t)$,含不可变建筑 $A$、已提交家具布局 $Y_t$、几何派生的功能区 $F_t$、稳定引用映射 $\Pi_t$;(2)RoReview——规则评估器检测违约实例,调度器选一个活动实例 $v_t=(r_t,\rho_t)$,序列化为 $q_t=(\kappa,\tau,E,W,\delta)$,含稳定键、类型、参与实体、关系角色、类型化测量;(3)几何条件化的VLM planner——以渲染图、目标规格、RoState、RoReview为输入,预测schema受限的StatePatch $b^t_p=(b^t_a,b^t_\xi,b^t_{\alpha_0})$,含动作/目标/参数种子;(4)确定性求解器与验证门控——先验证并评估归一化种子,被拒则按「种子距离+编辑幅度」排序生成有限候选邻域,第一个通过Eq.(3)五子句验证的候选才提交。整个循环重复到「无违约/全部阻塞/预算$K$耗尽」为止。

核心创新是「把布局校正表述为验证门控的局部状态修复」而非全场景重生成,并据此把任务分解成三个本质区别于已有工作的环节。第一,RoReview只做诊断不做规划——它把每个测量到的违约绑定到具体实体与关系角色(如「床是anchor、净空区是protected、侵入家具是obstructer、净空缺口0.15m」),却刻意不规定该用什么动作修复,把语义决策留给planner。这与LayoutGPT/Holodeck等「按用户指令做场景级修订」形成本质区别。第二,planner与solver职责分离——VLM负责「该动哪个对象、做什么动作」(语义强项),确定性求解器负责「具体挪几米、转几度」(数值精确性强项),且planner给出的连续参数种子从不被直接提交,永远先经确定性验证。第三,验证门控使用「稳定硬违约键集合」$H$ 而非违约计数,杜绝「消一个碰撞却引入另一个」的虚假修复;同时用「受保护已满足关系」$Z^{keep}_t$ 强制非目标对象在身份/类别/位姿/尺度/朝向上完全不变,从而严格保障局部性。消融里去掉RoReview会让Target Resolution崩到2.44%,去掉验证会让54.27%的场景引入新硬错误,证明这三点缺一不可。

方法步骤详情

完整修复流程分七步。第一步初始布局生成:用rank-64 DiT LoRA微调的Qwen-Image把建筑条件图+结构化房间提示映射到512×512俯视语义布局,解析器把RGB映射回语义标签、滤除伪影与房间无关类别、抽取连通分量作家具实例、再用预训练APM补全属性,得到结构化初始布局$Y_0$。第二步RoState构造:$S_t=(A,Y_t,F_t,\Pi_t)$,功能区$F_t$含门保护区、床侧净空区、餐桌操作区、主动线,均由当前对象几何派生而非固定标注。第三步RoReview构造:规则评估器检测可用规则实例,调度器按整数优先级(碰撞10、越界20、门阻挡30、窗阻挡40、动线断裂50……)排序选一个活动实例,序列化为$q_t$。第四步几何条件化StatePatch规划:planner接收渲染图$I_t$、目标$G$、RoState、RoReview;几何分支最多编码16个证据实体为512维token,由8个Repair Queries聚合,注入解码器第{22,24,26,28}层(零基索引[21,23,25,27])的残差交叉注意力;planner输出六类动作之一(MOVE/ROTATE/SCALE/INSERT/DELETE/REPLACE)的目标与参数种子。第五步确定性实例化:先做schema/引用/动作校验,再评估归一化可执行种子(如MOVE的八方向$D_8$、ROTATE的有符号角度),被拒则按种子距离+编辑幅度生成有序回退邻域(MOVE的距离阶梯0.05→1.20m、ROTATE的±180/±90/±45/±15°等)。第六步验证门控提交:候选$p$只作用于临时布局$Y^p_t=Y_t\oplus p$,重算所有功能区与规则实例,当且仅当 $H^p_t\setminus H_t=\varnothing$、$Z^{keep}_t\subseteq Z^p_t$、$C^p_t=1$、$V^p_t\le V_t-\varepsilon_V$($\varepsilon_V=10^{-6}$)且目标键$\kappa(v_t)\notin U(Y^p_t)$时才接受,第一个通过的候选提交,否则回滚。第七步循环:成功提交清空阻塞集、无候选则把稳定键加入阻塞集、所有问题阻塞或预算$K$(默认10)耗尽则终止。

技术新颖性

技术新颖性体现在五个互相支撑的设计上。其一,首次把布局校正形式化为「验证门控的局部状态修复」,并以事务回滚保证安全性,区别于Full-Scene JSON Rewrite(消融显示其Target Resolution仅32.48%、New Hard Error 32.64%、Safe Repair仅1.91%)。其二,RoReview把「测量-归因」与「规划」解耦——证据是绑定到对象的几何测量(净空缺口、侵入比、重叠深度、越界距离、角 deficit、通道宽度 deficit),但动作选择完全交给planner,这种「测而不修」的设计让监督信号可由「已知可行的逆向StatePatch」自然提供。其三,几何条件化适配器以零初始化($W_o^\ell=0$、$\gamma^\ell=1$)起步,初始时网络等价于冻结骨干,再渐进学习;query/cross-attention矩阵Xavier初始化,保证梯度流到输出投影——这是一种「不破坏预训练、又能注入结构化数值证据」的轻量条件化范式。其四,planner-seed-first确定性搜索把语义决策与数值精确化分离:消融显示Direct Seed(只跑planner种子)的TR仅65.70%、Seed-Free(纯确定性搜索)TR 90.70%,而Seed-First完整系统TR 98.96%,证明二者互补。其五,Roomer-CC用六类可控损坏(MOVE/ROTATE/SCALE/INSERT/DELETE/REPLACE)从合法3D-FRONT布局派生67,550个修复配对,每例都附带对象接地证据与已知可行逆向StatePatch,并通过「触发-归因-逆向修复无新硬违约」三重过滤(整体保留率74.5%)保证监督质量,填补了现有数据集「只有完整布局、缺配对故障输入」的空白。

Overview of Roomer.
Figure 2: Overview of Roomer.
Representative before-and-after examples of the six StatePatch actions.
Figure A1: Representative before-and-after examples of the six StatePatch actions.

实验结果

实验在冻结的common-1100(777卧室/155客厅/168餐厅)上进行,核心发现分五层。第一层是密度控制的最终布局比较(Table 1):Ours-Final在SCA Gap 12.46、OOB 8.66%、COL 17.50%、Practical 82.98%四项上全部最优,FID 60.20与KID 7.82也较Ours-Initial改善;ReSpace在FID(57.42)/KID(5.10)上仍领先。相对自身初始化,Roomer把OOB从24.40%砍到8.66%(−15.74pp)、COL从29.52%砍到17.50%(−12.02pp)、Practical从72.50%抬到82.98%(+10.48pp),三个分布指标也同步改善,证明局部修复「主要强化物理有效性与实用性而不退化分布质量」。第二层是跨生成器迁移(Table 2/A15):把同一冻结修复流程套到四个外部生成器输出上,OOB/COL/Practical对每个生成器都改善——ReSpace从14.72/36.56/66.43→1.16/7.61/75.12,DiffuScene-RS从38.18/28.44/45.09→6.98/6.95/47.73,InstructScene从37.49/28.50/40.99→5.67/5.88/45.70,SemLayoutDiff-RS从49.43/60.42/57.77→32.83/43.92/66.86;分布指标12组配对中10组改善(仅ReSpace KID与DiffuScene SCA Gap例外)。第三层是受控消融(Table 3/A17):去掉RoReview使Target Resolution暴跌到2.44%、Practical 50.39%甚至低于初始72.50%,证明对象归因是「前提而非辅助」;去掉几何适配器TR降到88.40%;Direct Seed TR 65.70%、Seed-Free 90.70%、Full-Scene JSON Rewrite TR 32.48%且New Hard 32.64%、去验证New Hard 54.27%;完整方法TR 98.96%、New Hard 0.00%、Non-target Preservation 99.94%、Safe Repair 96.27%。第四层是迭代收敛与自适应计算(Figure 4/A18):K=1即达TR 31.12%、K=3达72.52%、K=5达91.16%、K=7达97.32%、K=10达98.96%;由于已解决场景退出活跃集,平均每场景仅3.756次planner调用,比固定10轮少62.44%。第五层是专业验证(Table 4):10位室内设计背景评估者对90个独立冻结布局盲评900次,按Practical分层后批准率随等级单调上升——Low 23.3%(95%CI[11.8%,40.9%])、Medium 56.7%([39.2%,72.6%])、High 83.3%([66.4%,92.7%]),Cochran-Armitage趋势检验 $Z=4.67$、$p=3.07\times10^{-6}$,Krippendorff $\alpha=0.65$,强支持Practical与专业可用性判断一致。

Density-controlled comparison on common-1100.
Table 1: Density-controlled comparison on common-1100.
Paired transfer results on frozen outputs from four external generators.
Table 2: Paired transfer results on frozen outputs from four external generators.
Controlled ablation on identical common-1100 initial states.
Table 3: Controlled ablation on identical common-1100 initial states.
Professional approval across Practical levels with Wilson 95% confidence intervals.
Table 4: Professional approval across Practical levels with Wilson 95% confidence intervals.
Representative final-layout comparisons on common-1100.
Figure 3: Representative final-layout comparisons on common-1100.
Round-wise convergence and cost–quality trade-off on common-1100.
Figure 4: Round-wise convergence and cost–quality trade-off on common-1100.
Plug-and-play refinement of outputs from four external generators.
Figure A2: Plug-and-play refinement of outputs from four external generators.
查看结构化数据
任务指标本文基线提升
密度控制的最终布局比较(common-1100) OOB(越界物体比例↓) Ours-Final 8.66% Ours-Initial 24.40%;ReSpace 14.72%;DiffuScene-RS 38.18%;InstructScene 37.49%;SemLayoutDiff-RS 49.43% 相对Ours-Initial降低15.74pp,并优于所有基线,列全部方法最优
密度控制的最终布局比较(common-1100) COL(持久碰撞物体比例↓) Ours-Final 17.50% Ours-Initial 29.52%;ReSpace 36.56%;DiffuScene-RS 28.44%;SemLayoutDiff-RS 60.42% 相对Ours-Initial降低12.02pp,全部方法最优
密度控制的最终布局比较(common-1100) Practical(实用性规则微平均↑) Ours-Final 82.98% Ours-Initial 72.50%;ReSpace 66.43%;DiffuScene-RS 45.09%;InstructScene 40.99% 相对Ours-Initial提升10.48pp,全部方法最优;并经专业验证确认与人工判断单调一致(p=3.07e-6)
密度控制的最终布局比较(common-1100) SCA Gap(场景分类可分辨度↓) Ours-Final 12.46 Ours-Initial 19.20;ReSpace 21.73;DiffuScene-RS 16.57;SemLayoutDiff-RS 34.12 相对Ours-Initial降低6.74,全部方法最优;FID 60.20、KID 7.82也较初始化改善但ReSpace仍领先
外部生成器配对迁移(ReSpace输出) OOB / COL / Practical After: 1.16% / 7.61% / 75.12% Before: 14.72% / 36.56% / 66.43% OOB −13.56pp、COL −28.95pp、Practical +8.69pp,三类指标全部改善
外部生成器配对迁移(SemLayoutDiff-RS输出,最难案例) OOB / COL / Practical After: 32.83% / 43.92% / 66.86% Before: 49.43% / 60.42% / 57.77% OOB −16.60pp、COL −16.50pp、Practical +9.09pp,但残留误差仍高,说明最终质量受上游限制
受控消融-组件隔离(common-1100同初始状态) Strict Safe Repair(严格安全修复↑) Ours-Final 96.27% w/o RoReview 0.45%;w/o Geom 81.64%;Direct Seed 55.18%;Seed-Free 89.64%;Full JSON 1.91%;w/o Verif 23.18% 完整方法相对最强变体Seed-Free +6.63pp,验证门控+对象归因+几何条件化三者缺一不可
受控消融-组件隔离(common-1100同初始状态) Target Resolution(目标违约解决率↑) Ours-Final 98.96% w/o RoReview 2.44%;w/o Geom 88.40%;Direct Seed 65.70%;Full JSON 32.48% 去掉对象归因几乎完全失效(2.44%),证明「识别责任对象」是修复的前提
迭代收敛与自适应计算(冻结K=10轨迹前缀) Target Resolution / 平均planner调用 K=10时TR 98.96%,平均3.756次调用/场景 固定10轮调用 比固定10轮节省62.44%的VLM调用,同时保留长尾收益(K=5已达91.16%)
专业可用性验证(90布局×10评估者) 高Practical层批准率 / 趋势检验 High层83.3%批准,Z=4.67, p=3.07e-6 Low层23.3%批准 批准率随Practical等级单调上升,统计显著,验证Practical作为可用性代理的有效性

局限与改进

作者在结论中明确承认两点局限:其一,Roomer目前仅覆盖预定义的住宅类规则集,仅支持卧室/客厅/餐厅三类房间;其二,修复只能在其有限的「动作特定候选空间」内进行(如MOVE的八方向+固定距离阶梯、ROTATE的离散角度集合),超出覆盖范围或无可接受候选的问题将无法解决——SemLayoutDiff-RS在修复后仍残留32.83% OOB和43.92% COL就是这种「上游太差、候选空间够不到」的体现。从我的观察补充:第三,分布质量并非全面领先,ReSpace在FID(57.42 vs 60.20)和KID(5.10 vs 7.82)上仍占优,说明Roomer的局部修复会略微偏向「修物理」而牺牲少量分布相似度。第四,Practical是规则级微平均,作者也强调它「不是建筑规范合规、不是穷举人机工程、不是美学质量」,因此高分不等于完美可用。第五,门摆代理是几何近似而非精确模拟(取开门90°扇形为proxy,忽略家具高度),0.60m通道宽度对所有场景一刀切,可能与真实人机需求存在偏差。第六,Roomer-CC训练用的床侧净空阈值是固定0.45m,而Roomer-Eval用 $0.30\times w_{bed}$ 的比例阈值,训练/评测定义不一致,可能让模型在评测阈值上的表现被轻微高估或低估。

独立分析的弱点

独立分析后我认为有五处值得改进。第一,规则库与动作空间的有限性是最大瓶颈:现有六动作+离散候选阶梯(如MOVE最远1.20m、ROTATE固定角度)在「需要大尺度重构」的场景(如家具整体重排)上力不从心,SemLayoutDiff-RS修复后仍43.92% COL即是证据;改进方向是引入「学习式候选生成」或层次化动作(先粗后细),以及把候选预算与违约严重度自适应绑定。第二,规则覆盖限于住宅三类房间,对厨房(操作三角)、卫生间(洁具净空)、商业空间(疏散动线)、户外场景完全空白;改进方向是把Roomer-Eval的五族规则扩展为可插拔规则模板,并让RoReview的schema支持领域自定义。第三,门摆代理与0.60m通道阈值过于粗糙——真实门可能是双开、推拉、外开,通道宽度应随使用场景(走廊vs卧室门口)变化;改进方向是用真实门铰链+开门轨迹做精确仿真,并把通道阈值做成场景相关的连续函数。第四,planner依赖Qwen2.5-VL-7B,虽然自适应调用把均值压到3.756次/场景,但在大规模批处理时仍是显著开销,且论文未报告端到端延迟;改进方向是用更小的蒸馏planner或把planner做成「先分类是否需要修复、再决定调用」的两阶段,以及报告wall-clock时间。第五,Practical与FID/KID之间存在轻微张力(局部修物理会牺牲分布相似度),论文没有给出「如何在分布质量与物理有效性之间权衡」的统一目标;改进方向是把分布距离作为软约束加入验证门控(如允许FID上升不超过某阈值的候选),或训练一个能同时优化二者的多目标planner。

未来方向

作者在结论里给出的明确方向是「扩展规则库与候选生成,以支持更广的房间类型与更丰富的功能需求」。基于本文成果我认为可延伸出五条值得追的研究路线。其一,把Roomer从「后处理修复」升级为「生成-修复联合训练」:让上游生成器在训练时就接收Roomer的违约梯度反馈,使生成阶段就少产生可归因缺陷,而非事后再修。其二,把确定性候选空间替换为「条件扩散/流匹配」生成连续参数:当前MOVE/ROTATE/SCALE都是离散阶梯,一个以违约测量为条件的小型扩散头可以输出任意精度的 $(\Delta x,\Delta y,\Delta\theta)$,从而把Seed-First的TR从98.96%进一步逼近100%。其三,从单对象编辑扩展到「小簇编辑」:有些违约(如动线断裂)本质需要同时移动2-3个对象,可以在保持验证门控的前提下把StatePatch的target从单对象泛化为「受控对象簇」,并用图神经网络预测簇成员。其四,把Practical从规则级扩展为「人机工程+美学」联合评测:引入人体姿态可达性、视线遮挡、色彩与对称性等软指标,并用本文的专业验证协议(10评估者盲评)做大规模校准。其五,迁移到非室内领域:对象接地的验证门控修复范式天然适用于机械装配(零件干涉修复)、机器人摆放(抓取可达性修复)、城市地块规划(红线/日照合规修复),值得做跨域验证。

复现评估

复现评估从四方面看较为乐观。数据可获得性:全部派生自公开的3D-FRONT/3D-FUTURE,common-1100是3D-FRONT测试房间(777卧室/155客厅/168餐厅)经Qwen-Image生成的冻结cohort,Roomer-CC从3,952个训练房间派生67,550个修复配对(训练61,010/验证3,270/测试3,270),房间级分层保证源房间及其衍生损坏不跨split,构造统计(Table A1)与每个动作的保留率(整体74.5%)都有记录。训练配置完整:Qwen-Image用rank-64 DiT LoRA、4 epoch、15,808步、1×A800 80GB(Table A6);planner基于Qwen2.5-VL-7B-Instruct,rank-8 LoRA(5.046M参数)+几何模块(约27.446M参数)、5 epoch、9,535步、2×A800-SXM4-80GB、有效batch 32、cosine调度5%warmup、种子42(Table A10),全部超参公开。评测协议透明:Roomer-Eval的FID/KID/SCA Gap/OOB/COL/Practical实现细节(包括CleanFID clean模式、5mm分离测试、0.60m通道、$0.30w_{bed}$净空阈值)在附录I/J完整给出,并强调「密度控制只用合法性与物体数、绝不用评测指标选候选」,冻结候选遍历顺序与种子可追溯性(Table A16)也有记录。复现难度:算力上需要至少2张A800 80GB训练planner、1张训练Qwen-Image,对中小团队可承担;工程上难点在于几何条件化适配器的零初始化注入、RoReview/RoState的稳定引用系统、以及六类动作的确定性候选空间实现,这些都需要较精细的工程量。代码/权重开源状态:论文未在正文显式声明,但从Figure A1/A2与补充视频看作者有完整artifact,需关注后续release。综合判断,按论文给出的配置在common-1100上复现OOB 8.66%/COL 17.50%/Practical 82.98%是可行的,跨生成器迁移结果也可复现。