SceneMosaic:基于混合智能体布局演化的高效多样仿真级场景生成 SceneMosaic: Efficient and Diverse Simulation-Ready Scene Generation via Hybrid Agentic Layout Evolution
图像先验快速初始化加智能体局部演化,24倍提速生成物理有效且多样的仿真场景
前置知识
VLM智能体流水线(Agentic Pipeline)
以GPT-4o、Qwen2.5-VL等视觉语言模型为核心,通过角色提示词赋予模型感知、规划与工具调用能力,让其在'提出-执行-反馈'循环中迭代完成任务。在3D场景生成中,智能体可调用分割、重建、物理仿真等工具,依据渲染图像与结构化场景状态反复修正物体布局。
SceneMosaic的精修阶段完全建立在Critic-Actor智能体循环之上,理解智能体如何分工、传递上下文与使用工具,是读懂本文方法设计与消融实验的前提。
图像到3D场景生成(Image-to-3D)
以单张参考图为输入,利用从大规模2D数据中学到的布局先验,前馈式地推断每个物体的资产网格与6D位姿,无需迭代优化。代表方法有MIDI、SceneGen、SAM3D,速度快(约0.05-0.19小时/场景),但直接回归位姿不精确,常产生物体穿模、悬浮、越界等物理错误。
本文正是用这类模型做快速初始化,其物理缺陷是后续智能体演化要修复的对象,'快速但物理无效'这一矛盾也是论文动机的核心。
6D物体位姿参数化
每个物体由网格$M_i$与空间布局参数$T_i=(p_i, R_i, s_i)$共同刻画:$p_i \in \mathbb{R}^3$为平移,$R_i \in SO(3)$为旋转(可用单位四元数$q_i \in S^3$表示),$s_i \in \mathbb{R}^3$为各向异性缩放。场景生成本质上就是为所有物体求解这组参数。
论文的演化操作、新颖性距离度量、变体拼接都在操纵这些位姿参数,例如旋转差异$D_{rot}$就基于四元数内积$\theta_i = 2\arccos(|q_i^{(A)} \cdot q_i^{(B)}|)$。
刚体物理仿真与凸分解碰撞体
把物体当作刚体放入带重力的仿真器中,让其自然下落、贴合支撑面、消解穿透。为加速碰撞检测,先用CoACD把网格预分解为若干水密凸包作为碰撞体;仿真中锚点物体与墙体设为静态刚体,目标物体作为动态刚体演化直至位姿收敛。
SceneMosaic在演化前后都用重力仿真做物理稳定与验证,这是它能把碰撞率和越界率从约20%压到0%的关键手段,也是消融中'去物理'变体崩坏的原因。
正交投影与2D空间抽象
沿锚点相关方向(地板单元俯视、墙面单元沿外法线、包含单元沿正面)渲染1024×1024正交视图并叠加坐标网格,把3D位姿编辑简化为2D平面内的中心平移加面内旋转;2D预测经网格点的3D对应关系可确定性地反投影回3D位姿。
相比透视3D视图,正交2D消除了遮挡与透视畸变,把VLM的空间推理自由度从6D降到2D平移+面内旋转,是消融实验中效率与质量双优的关键设计。
SceneEval-100基准
一个包含100条手工设计室内场景文本提示的评测基准,提供统一的语义评估协议与物理有效性指标:可通行性NAV、碰撞率COL、越界率OOB,被广泛用于在同一协议下比较文本到3D与图像到3D两类场景生成方法。
论文全部定量对比、消融与多样性实验都在SceneEval-100上进行,理解其指标定义才能准确读懂Table 1至Table 5中的数字含义。
研究动机
具身AI与互动娱乐需要大量贴近真实的室内场景做大规模训练与评估,但现有仿真环境家具稀疏、多样性不足,真实数据采集又无法支撑规模。现有生成范式各有硬伤:智能体文本到3D流水线(SceneSmith、SAGE等)靠VLM对每个物体反复'提出-放置-修正'并管理工具调用与记忆,单场景耗时高达3.43至7.56小时,成为大规模仿真的瓶颈;参数化图像到3D模型(MIDI、SceneGen、SAM3D)虽0.05-0.19小时即可产出场景,但直接回归的位姿不精确,碰撞率高达19.8%-25.6%,SAM3D的越界率也有8.9%。更根本的是,两类方法对同一输入都只输出一个确定性布局,无法刻画真实场景被人类活动不断'重定向、重定位、重排'的动态多样性,而仿真恰恰需要大量保持场景功能与物理合理的结构化重排变体来扩大训练覆盖面。
本文的目标是本文的目标是构建一个混合框架:给定单张参考图(或文本提示经文生图模型合成的图像),同时输出一个高质量的仿真级基础场景和m个多样布局变体(实验中m=5),并且三者兼得——生成效率接近图像到3D前馈模型,物理有效性达到接近零违例(碰撞率与越界率趋零),语义布局质量比肩最强智能体基线;且各变体在空间布局层面保持显著差异,同时保留基础场景的功能结构与物理合理性,最终可直接服务于具身智能与互动娱乐所需的大规模仿真训练与评估。
与已有工作不同的是,作者的独特切入是把两条范式从'二选一'变成'先验+精修'的串联:用图像到3D模型承担全局布局初始化,把昂贵的智能体迭代只花在修复物理与语义缺陷上,从而绕开文本到3D从零搜索布局的数小时轨迹。第二个独特角度是利用室内布局的局部性:把场景树分解为'锚点+直接子节点'的独立局部单元,各单元分别演化出多个合法变体后再做笛卡尔积,把一次演化过程放大为组合数级的候选场景池;再用含相对位置、绝对距离、旋转三项的新颖性感知距离和动态Max-Min贪心搜索挑选代表,使多样性几乎'免费'获得。正交2D投影这一空间抽象则把VLM的空间推理难度大幅降低,三者共同构成了与现有工作本质不同的技术路线。
核心方法
直觉上,SceneMosaic像'先用毛坯图铺好全屋,再请设计师逐个区域微调并给出多套方案'。技术路线分三阶段。第一阶段场景重建与结构化:感知智能体完成实例注册(语义标签、文本描述、2D框),用SAM3按提示分割并迭代修复漏检、重复掩码、模糊边界与嵌套区域,再由SAM3D对每个物体独立重建网格$M_i$与初始位姿$T_i=(p_i,R_i,s_i)$;随后以DAG调度支撑推理、包含分析、墙体恢复、墙面附着、语义精修等任务智能体,恢复房间边界与墙基元,推断attach/contain关系,把场景组织成层次场景树,每个局部单元定义为锚点节点加全部直接子节点,并提取少量跨单元约束(如落地椅须朝向书桌)注入各单元上下文。第二阶段物理稳定与智能体演化:先做包含校正与按锚点方向设置重力的刚体仿真,获得物理接地的局部布局;再对每个局部单元并行运行Critic-Actor循环,在正交2D视图上修复缺陷并衍生多样变体。第三阶段多样性组合:所有单元变体经锚点相对变换与笛卡尔积组装成$k$个完整候选场景,用新颖性感知距离$N(S_A,S_B)=w_pD_{pos}+w_uD_{dist}+w_rD_{rot}$和动态Max-Min贪心搜索选出基础场景加m=5个变体。
核心创新有二。其一是混合范式:不同于SceneSmith/SAGE从文本出发全程智能体搜索(SAGE单场景7.56小时、需5张H200),SceneMosaic让图像布局先验承担'从0到大部分质量'的初始化,智能体演化只负责局部精修与变体衍生,把迭代开销压缩约一个数量级;也不同于MIDI/SAM3D的一次性前馈预测,演化阶段引入物理仿真工具与渲染反馈兜底,把碰撞率从约20%压到0%。其二是局部性分解驱动的多样性:把场景切成相互独立的局部单元,每个单元独立进化出多个合法变体,再按锚点坐标系做变换拼接(子单元物体变换为$M^{scene}_i = M^{scene}_a (M^{local}_a)^{-1} M^{local}_i$后极分解恢复合法$(p_i,R_i,s_i)$)与笛卡尔积,一次演化即得组合数级候选;配合由$D_{pos}$(物体对位移向量投影到局部坐标系的差异)、$D_{dist}$(成对欧氏距离差异)与$D_{rot}$(四元数旋转差)加权的新颖性距离,以及剪枝阈值$\tau = \alpha \cdot d_{max}$的动态Max-Min贪心选择,保证选出的场景彼此新颖、且以参考布局为种子不致跑偏。
方法步骤详情
第一步,感知与重建:感知智能体输出带语义标签、描述和2D框的物体清单,SAM3逐物体分割并迭代验证修复掩码,SAM3D对每个验证掩码独立重建网格$M_i$和初始布局参数$T_i=(p_i,R_i,s_i)$,建立语义身份、像素证据、网格与空间布局的一致对应。第二步,结构化:管理者智能体按DAG调度各子智能体恢复房间边界、墙基元与attach/contain关系,构建'锚点+直接子节点'的局部单元场景树;跨单元约束只经锚点等中间参考间接表达(如'落地椅朝向书桌、桌面显示器与书桌同向'),并按单元分组注入变体生成、Critic与Actor的提示词;同时用CoACD预计算凸分解碰撞体。第三步,物理稳定:在正交投影下检查包含关系并校正非法布局,再按锚点设置重力(地板$(0,-g,0)$、天花板反向、墙面沿外法线)运行刚体仿真,消除悬浮与穿透。第四步,Critic-Actor演化:每个局部单元先由VLM提出0-3个风格原型变体并实例化为2D位姿;每轮中Critic接收正交渲染图、2D布局JSON、深碰撞对与布局记忆,输出定性修改建议(禁止给出数值坐标)与0-100质量分;Actor把建议转成符号位姿表达式(如object_002.center.u += 0.1)由沙盒求值器精确解析执行;循环至Critic认为无需修改、达到最大轮数或早停(位移与旋转变化低于阈值且无物理问题)。第五步,组合与选择:局部变体逐个通过碰撞与越界验证后,按场景树递归笛卡尔积生成k个候选并做场景级碰撞剔除;动态Max-Min贪心以原始场景为种子、权重$(w_p,w_u,w_r)=(0.4,0.4,0.2)$、$\alpha=0.1$,选出m+1个代表场景。
技术新颖性
技术新颖性体现在四个层面。第一,范式融合层面:此前图像先验与智能体精修很少被显式串联,本文用消融证明两个组件缺一不可——去掉图像初始化后耗时从0.14小时涨到1.25小时且POS降至80.7,去掉物理稳定与仿真工具后碰撞率涨到18.9%、越界率8.5%。第二,空间抽象层面:把VLM的位姿编辑约束在锚点相关的正交2D投影内,配合2D网格到3D的可逆映射,把自由度从6D降到2D平移加面内旋转;消融显示对比'全局演化+透视3D'(POS 72.3、0.68小时),完整方法POS 84.3且仅0.14小时。第三,智能体接口设计层面:Critic只给定性建议以避免锚定于不准确的数值估计,Actor输出符号位姿表达式使对齐、等距等关系式修改精确而非近似,布局记忆显式记录历史建议与失败模式以检测左右振荡等循环调整并防止死锁。第四,多样性机制层面:以局部单元为积木的笛卡尔组装加锚点相对变换拼接,使每个变体的边际成本仅0.03小时;而重复完整采样的变体单张需0.14小时且Div-IoU更差(0.71对0.42),证明多样性来自结构性组合而非随机性。
实验结果
在SceneEval-100的100个提示上得到四组核心结论。其一,语义质量比肩最强智能体基线(Table 1):基础场景POS 84.3±2.0、ROT 78.4±3.4,超过SceneSmith的83.5/80.9(ROT略低0.9),变体场景进一步升至84.5/79.9;远超图像到3D基线SAM3D的80.1/75.4。其二,物理违例清零且速度提升24倍:COL与OOB均为0.0、NAV 99.2,而SceneSmith为0.7/0.3/96.9、SAGE的NAV只有90.1;单场景耗时0.14小时对SceneSmith的3.43小时(24倍加速),变体场景每张仅0.03小时;对比前馈基线,SAM3D的COL 20.2%与OOB 8.9%被完全消除。其三,人类评估一致(Table 2):48名参与者对15个场景按5分Likert打分,本文语义4.33±0.89、物理4.47±0.82双第一且方差最小,SceneSmith以4.01/4.16居次,SceneGen与SAM3D因频繁穿模物理分仅2.08/2.43,Kendall's W为0.648/0.633(p<0.001)。其四,消融与多样性验证设计必要性(Table 3-5):去图像初始化POS降至80.7且耗时涨9倍至1.25小时;去物理则COL 18.9%、OOB 8.5%;正交2D换透视3D后POS降至78.1且耗时0.31小时;全局演化+透视3D最差(POS 72.3)且完全无法加速变体生成。多样性方面,完整流程Div-IoU 0.42、Div-N 0.37优于随机选择(0.58/0.19)与重复采样(0.71/0.12、0.14小时);在匹配多样性(σ=0.25高斯扰动)下,本文POS 84.5、关系保持率99.1%远高于扰动的71.6/71.5%,证明多样性并非以牺牲合理性换来。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| SceneEval-100 语义布局质量(基础场景) | POS / ROT(GPT-5.5判定,越高越好) | 84.3 / 78.4 | SceneSmith 83.5 / 80.9;SAM3D 80.1 / 75.4;SAGE 59.8 / 53.3 | POS超过最强基线SceneSmith +0.8,ROT基本持平(-0.9),但耗时仅为后者1/24 |
| 物理有效性(基础场景) | COL↓ / OOB↓ / NAV↑ | 0.0 / 0.0 / 99.2 | SAM3D 20.2 / 8.9 / 98.9;SceneSmith 0.7 / 0.3 / 96.9 | 碰撞率与越界率完全清零,可通行性最高 |
| 生成效率 | 每场景平均耗时(小时,越低越好) | 基础场景 0.14h;变体场景 0.03h/张 | SceneSmith 3.43h;SAGE 7.56h;SAM3D 0.05h | 较最强智能体基线24×加速,且额外产出5个多样变体 |
| 用户研究(48人×15场景,5分Likert) | 语义合理性 / 物理合理性(↑) | 4.33 / 4.47 | SceneSmith 4.01 / 4.16;SAM3D 3.22 / 2.43;SceneGen 2.12 / 2.08 | 双维度最高且标准差最小,Kendall's W=0.648/0.633(p<0.001) |
| 布局多样性(每输入m=5个变体,同一资产集) | Div-IoU↓ / Div-N↑ | 0.42 / 0.37 | 随机选择 0.58 / 0.19;重复完整采样 0.71 / 0.12(0.14h/变体) | 多样性最佳且每变体仅0.03h,证明增益来自组合与选择策略 |
局限与改进
作者明确承认的局限:由于依赖图像初始化,方法继承了图像到3D'单张图像通常只含一个房间'的内在约束,目前只能生成房间级场景,无法直接产出多房间住宅或整栋建筑,房间级到房屋级的组合被留作未来工作。我自己的观察还有六点:第一,语义指标POS/ROT完全依赖GPT-5.5裁判打分,而被评场景又多由VLM参与生成,存在裁判与生成器同源的偏差风险;第二,所有变体共享同一套重建资产,只做位姿重排,无法替换或新增物体,多样性天花板受初始资产集限制;第三,物理评估基于刚体仿真与CoACD凸包,并对地毯、纸张等扁平物体豁免碰撞统计,对软体和铰接物体的穿透可能被低估;第四,新颖性距离的权重(0.4,0.4,0.2)为手工设定,且由于归一化分母取自参考场景A,距离不对称,空间上的'新颖'未必对应功能上有意义的重排;第五,跨单元约束只覆盖强功能关联对,弱关联(如挂画与沙发)被刻意排除,复杂开放布局下的全局协调仍依赖锚点间接表达;第六,局部单元独立演化本质是贪心分解,理论上可能错过需要跨单元联合优化才能达到的全局最优布局。
独立分析的弱点
独立分析出四个可改进的弱点。其一,评估闭环依赖VLM裁判:POS/ROT由GPT-5.5判定,且各方法的输入图像本身可由GPT-Image-2合成,评分可能与裁判模型的审美与知识分布耦合;改进方向是引入真实扫描场景(如Internscenes等大规模可仿真室内数据集)做客观对齐评估,或在主表中加入人类标注。其二,多样性只作用于布局不作用于资产:m个变体共享同一批网格,无法表达'换一个沙发款式'式的变体;可与前馈资产生成模型(Hunyuan3D、CLAY等)联合,让锚点物体本身也可采样变体,同时保持支撑关系不变。其三,单房间限制:局部单元思想其实可以提升为'房间单元',用门、走廊等连接件作为跨房间约束,把笛卡尔组装机制推广到户级乃至建筑级生成。其四,演化效率仍有压缩空间:Critic-Actor循环是串行文本迭代且每轮渲染1024×1024正交图,对含数十物体的大单元开销可观;可引入可微布局优化或布局扩散模型承担粗修,智能体只做终审与例外处理,进一步压低基础场景0.14小时的耗时,并减少对特定VLM版本的依赖。
未来方向
作者明确提出的方向是把房间级生成扩展为连贯的多房间乃至整栋建筑组合。在此基础上还有四条自然延伸:第一,把新颖性感知距离从手工加权升级为学习式度量,例如用具身任务成功率对布局差异加权,让'多样性'直接对齐下游训练收益而非几何差异本身;第二,将Critic-Actor循环与物理仿真结合成闭环策略训练,用强化学习蒸馏出一个可泛化的布局修复策略,摆脱对逐轮VLM推理的依赖并降低推理成本;第三,支持动态场景序列——真实场景随人类活动连续变化,可用本文的组合机制生成时间上连贯的布局轨迹,服务长时程具身任务的课程式训练;第四,接入真实照片或扫描数据而非文生图合成图像,检验图像先验在分布外输入下的鲁棒性,并与开放词汇感知(SAM3)做联合迭代,处理更杂乱的真实房间;此外,把变体生成与下游任务(导航、操作)的难度自动配对,形成'按需生成训练环境'的闭环也值得探索。
复现评估
复现条件总体较好。代码已在GitHub开源(https://github.com/rxjfighting/SceneMosaic),项目页(https://rxjfighting.github.io/SceneMosaic)含可视化结果。外部依赖均为公开模型或服务:SAM3(分割)、SAM3D(物体重建)、GPT-Image-2(文生图合成实验输入)、CoACD(凸分解碰撞体),所有智能体由同一底层VLM按角色提示实例化(正文提及GPT-4o、Gemini 3 Flash、Qwen2.5-VL等均为该类组件);实验环境为单张NVIDIA L40S,唯一例外是SAGE基线需5张H200本地部署VLM。评测基于公开的SceneEval-100提示集,物理指标(NAV/COL/OOB)协议明确、可确定性复算;但POS/ROT依赖GPT-5.5打分,复现分数会随裁判模型版本波动。补充材料给出了2D-3D坐标映射、锚点相关重力设置、跨单元约束注入、收敛与轮次选择规则的完整描述,以及全部5条角色提示词和Algorithm 1伪代码,工程透明度高。总体验证难度中等:单GPU即可跑通主流程,主要成本在VLM API调用费用与物理仿真细节的对齐。
论文图表
开篇总览图:给定一张参考图像(如'高科技娱乐中心'、'双显示器游戏角'的文生图结果),SceneMosaic同时输出物理有效、提示对齐且多样的仿真级3D场景与布局变体(×m);对比栏显示各方法在同类示例上的耗时——SceneSmith 2小时33分、SAGE 8小时35分、SAM-3D约7分钟、本文12分钟,并示意图像到3D的初始化物体'漂浮'、智能体方法的物体'被裁剪/未落地'等缺陷。
一图浓缩论文动机(效率-保真-多样性三难权衡)与核心卖点(约12分钟产出基础场景加变体),是快速把握论文定位与贡献的最佳入口。
伪代码:输入候选集C、原始场景$S_{org}$、目标变体数m、过滤因子α与权重$(w_p,w_u,w_r)$。先把$S_{org}$放入已选集R作种子,然后每轮选取与已选集最小新颖性距离最大的候选加入R,并以阈值$\tau = \alpha \cdot d_{max}$动态剪除与已选集过近的候选,直到选满m+1个或候选耗尽。
多样性选择的核心算法,给出权重(0.4,0.4,0.2)、α=0.1等关键超参与距离方向约定(以已选场景为参考A),是实现变体选择环节的直接依据。