VibeWorlding:多模态智能体能否端到端构建3D开放世界 VibeWorlding: Can Multimodal Agents Construct 3D Open Worlds End-to-End?
首个3D世界构建智能体的评测+多模态RL训练框架,开源30B模型Pass@1超越GPT-5.5
前置知识
MLLM(多模态大语言模型)
能同时处理文本与图像输入的大语言模型,如 Qwen3-VL、GPT-5.5、Gemini。它把图像编码为 token 与文本一起送入 Transformer,从而可以「看」渲染截图并结合文字指令进行推理和决策。
本文的智能体每回合都要读取 3D 地图文本和五视角渲染图来决定下一步工具调用,全部基线与被训练模型都是 MLLM,理解其输入输出形式是读懂实验设计的前提。
Agentic RL 与 GRPO
让模型以「智能体」身份在环境中多轮交互并用结果奖励做强化学习。GRPO(Group Relative Policy Optimization)对同一 prompt 采样一组 rollout(本文为 8 个),用组内相对优势替代价值网络来更新策略,是 DeepSeek 提出的省资源的 PPO 变体。
本文用 GRPO 做多模态 RL 后训练(学习率 $5\times10^{-7}$、KL 系数 0.05),是把开源模型从 13.6% 提到 59.3% 的关键手段,不理解 GRPO 就无法理解训练配方。
MCP 工具调用
Model Context Protocol,一种标准化「模型-工具」接口协议,把检索、编辑、渲染等能力包装成可被 LLM 按schema调用的函数。智能体每轮输出思考与工具调用,环境返回结果形成多轮轨迹。
本文沙箱把 asset retrieve/add/delete/rotate/translate 五个 3D 操作和 Blender 渲染统一封装为 MCP 工具,这是整个交互式评测与 RL 训练环境的骨架。
SFT 冷启动
在强化学习前先用监督微调(Supervised Fine-Tuning)教会模型基本格式与能力。本文用 Gemini 3.1-pro 生成成功轨迹并反推推理过程,过滤后做全参数 SFT(2 epochs,学习率 $2\times10^{-5}$,最长序列 122,880 tokens)。
论文的消融实验(图6)显示 SFT 与 RL 分工不同:SFT 奠定物理与生态基础能力,RL 才解锁空间推理,这是理解「后训练各阶段贡献」分析的核心概念。
Rubric-based MLLM Judge 与验证器
对无唯一正确答案的开放式任务,用另一个 MLLM 依照人工设计的评分细则(rubric)逐维度打分。本文验证器先用几何检查管物理可行性(碰撞、悬空),再用 Gemini 3.5-flash 按 rubric 评意图满足(3D 理解/推理须达 4/5 分等)。
同一个双约束验证器既是 benchmark 的自动评测器又是 RL 奖励函数,其与人类评审的一致性($\kappa=0.54$,Spearman $\rho=0.88$)决定了整个工作的可信度。
InfoNCE 与分级检索损失
InfoNCE 是对比学习损失 $\mathcal{L}=-\log\frac{e^{\ell(q,d^+)}}{\sum_d e^{\ell(q,d)}}$,把正例相似度拉高、负例压低。本文扩展为 ECO 铰链链:$\mathcal{L}=\mathcal{L}_{\text{InfoNCE}}+\lambda_{eco}[L(G_0,G_1)+L(G_1,G_2)+L(G_2,G_3)]$,其中 $L(G_{hi},G_{lo})=[\gamma-\ell(q,d^*_{hi})+\ell(q,d^*_{lo})]_+$,强制高等级候选排在低等级之前。
资产检索是每次从零构建的第一步,检索错误会传播到所有下游编辑;理解 G0-G3 分级(尤其 G2「错实体对属性」干扰项占难负例 88.6%)才能理解检索器为何这样设计。
Pass@1 指标
单次采样即成功的比例。本文中 unverified 查询须通过验证器全部维度才算通过,verified 查询则以正确修改资产比例的均值为 Pass@1。它是贯穿所有主实验表的统一指标。
论文所有结论(前沿模型低于 60%、开源 RL 模型 59.3% 最佳)都以 Pass@1 表述,且文中区分了 Verified/Unverified 两条轨道的 Pass@1。
研究动机
现有 MLLM 驱动的 3D 世界构建工作分两派:一是固定流水线多子代理(SceneCraft、3D-GPT:规划代理先出布局,再由批评/精化代理迭代修改);二是单智能体工具调用式(SAGE、SceneWeaver、SceneReVis:把资产编辑、程序化生成、渲染做成工具集让智能体自主交互)。但它们几乎只在理想化的简单查询上评估——指令明确、资产清晰,而真实用户的请求是开放且模糊的(如「把树整理一下」「让场景更有生气」),甚至包含库中不存在的资产等不可行子请求。同时,高质量且物理一致的 3D 资产难以规模化获取,检索、编辑、渲染操作散落在互不兼容的工具中,没有任何工作把它们统一到一个沙箱接口下;大多数框架闭源,也没有统一的公开基准。这导致两个基本问题无法回答:多模态智能体在意图理解、3D 工具使用、文本+视觉反馈推理上到底有多强?训练(尤其是 agentic RL 后训练)能否系统性提升这些底层能力?
本文的目标是本文要构建一个统一的「评测+训练」框架 VIBEWORLDING,把 vibe worlding(凭感觉造世界)形式化为多轮、多模态、工具集成的推理任务:给定多模态查询(纯文本从零构建,或已有世界+文字指令精修),智能体须自主推断意图、规划布局、调用 3D 工具、并根据 3D 地图与渲染图像反馈反思修正,直到产出最终可交互世界。具体交付三件事:(1) VWE-BENCH:2,616 个高质量资产、323 个人工标注种子世界、6,828 条反向合成查询(1,710 条有 ground-truth 的 verified + 5,118 条带 rubric 的 unverified);(2) VibeWorlding-Gym:统一资产检索/编辑/渲染为 MCP 工具的沙箱,加一个同时校验物理可行性与用户意图满足的双约束验证器,既能公平评测又可作可扩展的 RL 奖励服务;(3) 一条覆盖 SFT 冷启动与联合多模态 RL 的后训练流水线,并实证回答前沿模型差在哪、瓶颈是什么能力、RL 能补什么。
与已有工作不同的是,本文的独特切入有三点。第一,任务形式不同:不从文本一次生成场景程序,而是让单一策略在沙箱中多轮交互,每回合环境返回更新后的 3D 地图和五视角渲染图,模型必须「看着自己改的世界」继续决策,这更贴近真实创作循环。第二,数据构造采用「反向合成」:先让艺术家用统一资产库搭好种子世界,再让 MLLM 从成品世界反推出用户查询——对种子世界施加扰动(删除/移动资产)后描述变化,就自动得到带 ground-truth 地图的精确编辑查询;整体批判种子世界就得到开放式精修查询,绕开了人工写 6,828 条查询的成本,同时天然保证查询可满足。第三,验证器「一器两用」:双约束(几何碰撞/悬空检查 + rubric 化 MLLM judge)既当离线指标又当在线 RL 奖励,据作者所知这是首个面向端到端 3D 世界构建的 agentic RL 开源框架,也是首个把渲染图像反馈纳入 RL 训练信号的工作(对比 SceneReVis 等纯文本监督的多轮 RL)。
核心方法
先给直觉:让模型像玩家开「创造模式」那样工作——接到一句模糊需求后,先想清楚场景要分几个区、每区放什么;去素材库检索候选资产并按画风挑选;用坐标把资产摆进场景;然后看渲染截图检查有没有穿模、悬空、放反方向;再继续修改,直到自己满意才停手。技术路线分三块。数据侧:艺术家定义 3,148 个概念资产清单,用 Gemini 3.1-flash-image 文生图、Hunyuan3D 3.1 图生 3D 网格,过滤后标注统一尺度的 bbox,得到 2,616 个资产;艺术家用这些资产搭出 323 个种子世界(复杂度 8~258 个资产);MLLM 在种子世界基础上反向合成 6,828 条查询,分为 4 种从零构建型和 6 种精修型。环境侧:沙箱暴露 5 个 MCP 工具(asset retrieve/add/delete/rotate/translate),Blender 渲染服务每回合返回五个固定视角的 1280×720 图像;检索器基于 Qwen3-Embedding-4B 用分级相关性数据微调。验证侧:双约束验证器先做 Python 几何检查(碰撞、悬空),再用 Gemini 3.5-flash 按 rubric 评四个意图维度。训练侧:先用 Gemini 3.1-pro 尝试构建、验证器筛选成功轨迹并反推推理链做 SFT 冷启动,再用 GRPO 从纯文本与多模态两类查询上联合做 RL。
核心创新是「评测即奖励」的统一设计:同一个双约束验证器既给 VWE-BENCH 打 Pass@1,又给 RL 提供奖励——verified 查询奖励为正确修改资产的比例 $r\in[0,1]$,unverified 查询奖励为二值 0/1(须先过物理可行性再过全部 rubric 维度)。这带来三点与已有工作的本质区别。(1) 与 SceneCraft/3D-GPT 的固定流水线多子代理不同,本文端到端训练单一策略,规划、检索、摆放、反思全部内化在模型权重里,而非依赖提示词工程;(2) 与 SceneReVis 等只喂文本反馈的多轮 RL 不同,本文每回合把五视角渲染图作为环境观测纳入训练,是真正的多模态 RL;(3) 检索器不是现成向量模型,而是针对「分级相关性」定制:G0(实体属性都对)≻G1(对实体错属性,可容忍替代)≻G2(错实体对属性,最危险的干扰项)≻G3(都不对),用 InfoNCE 加 Error-Cost-Ordered 铰链链 $\mathcal{L}=\mathcal{L}_{\text{InfoNCE}}+\lambda_{eco}[L(G_0,G_1)+L(G_1,G_2)+L(G_2,G_3)]$ 训练,因为普通二分类 InfoNCE 无法表达「宁可用 G1 替代也绝不选 G2」的非对称错误代价。此外采用纯结果奖励(不做手工中间塑形)以规避 reward hacking。
方法步骤详情
第一步,资产合成:艺术家定义 3,148 个概念资产的名称与类别,文生图生成参考图,Hunyuan3D 3.1 转成 .glb 网格,过滤掉几何/外观明显偏离参考图的产物(如输入路灯却生成台灯),再统一真实尺度标注中心与半轴距,得到 2,616 个资产、覆盖 20 个语义类别(建筑 605、道具 394、环境装饰 241、植被 185、树木 193、岩石 208 等)和四档尺寸(Tiny 29/Small 980/Medium 1010/Large 597)。第二步,种子世界:艺术家从空地图搭建 323 个粗但功能完整的种子世界(8~258 个资产),合起来覆盖整个资产库。第三步,反向查询合成:构建类由 MLLM 读种子世界反推请求,按暴露细节分 Theme only(322 条)、Theme+elements(620)、Full blueprint(302)、Distractor(120,埋入不可行子请求考验澄清能力);精修类由两条路合成——施加扰动后描述变化得「精确资产编辑」(1,710 条,唯一有 ground-truth 的 verified 类)与「模糊资产编辑」(1,462 条),MLLM 整体批判种子世界得「场景批评」(553)、「场景引导」(757)、「场景复述」(505)、「复杂描述」(477)。第四步,SFT 冷启动:unverified 查询让 Gemini 3.1-pro 多次尝试构建、验证器筛优后反推完整推理轨迹;verified 查询直接从 ground-truth 地图反推;全参数 SFT 2 epochs。第五步,联合多模态 RL:以冷启动策略初始化,GRPO 训练 1 epoch,学习率 $5\times10^{-7}$、KL 系数 0.05、无熵 bonus,每个 prompt 采 8 个 rollout,奖励来自双约束验证器(verified 为比例分,unverified 为 0/1)。
技术新颖性
技术新颖性体现在四点。(1) 首个端到端 3D 世界构建的 agentic RL 完整开源栈:2,616 资产 + 323 种子世界 + 6,828 查询 + 定制检索模型 + 沙箱 + 验证器 + SFT/RL 框架一次性放出,此前该领域只有闭源系统或纯评测。(2) 双约束验证器把「不可验证的开放任务」部分转化为可验证:碰撞用几何判定(资产对互穿体积 ≥10 立方米且超出每轴 0.5 m slack 即失败);悬空检查带 3 m 支撑面规则和语义豁免(飞行动物、吊藤、粒子特效等合法悬浮不罚);意图部分由 MLLM judge 按 rubric 打 0-5 分(3D 理解与 3D 推理须 ≥4 分,纯文本回复不调工具封顶 1 分),检索合理性按 1-4 档判定。验证器可信度经盲测人类评审校验:生态合理性 Cohen's $\kappa=0.54$(93.6% 原始一致率)、意图满足 $\kappa=0.53$(78.0%)、整体 Pass@1 案例级一致率 83.4%,系统级排序 Spearman $\rho=0.88$。(3) ECO 分级检索损失直面 G2 干扰项(占 241,548 条难负例的 88.6%),这是通用 embedding 模型不会优化的错误类型。(4) 结果奖励设计避免了手工中间塑形带来的 reward hacking,同时论文诚实量化了两类奖励(确定性 ground-truth vs MLLM judge)对 RL 稳定性的不同影响。
实验结果
发现一:任务远未解决。在 254 条测试查询上,最强前沿模型 GPT-5.5 整体 Pass@1 仅 57.3%、Qwen3.8-Max 56.9%,均低于 60%;Gemini 3.5-flash 47.4%、Kimi-K3 44.5%、Gemini 3.1-pro 42.7%、Claude-Opus-4.8 仅 24.3%;未训练开源模型更差(Qwen3-VL-8B 5.3%、30B-A3B 13.6%)。三个训练-free 的 agent 脚手架基线(以 GPT-5.5 为骨干的 SceneWeaver/SAGE/SceneAssistant 分别 16.3%/13.6%/13.8%)反而远低于裸前沿模型,说明脚手架不是瓶颈、模型自身能力才是。发现二:RL 后训练让开源模型追平并超越闭源前沿——VibeWorlder-30B-A3B 从 13.6%(基座)→34.5%(SFT)→59.3%(RL),成为全部 14 个系统中最佳,超过 GPT-5.5 的 57.3%;Verified 轨道优势更明显(64.5% vs GPT-5.5 的 60.4%);VibeWorlder-8B 达 41.4%,追平 Gemini 3.1-pro(42.7%)且在 Verified 轨道反超(59.3% vs 44.4%)。人类盲评也一致:30B 模型综合通过率 47.2% 最高(Qwen3.8-Max 46.7%),RL 还把幻觉率从 SFT 的 62.5% 压到 9.2%(8B 从 76.0% 到 45.5%)。发现三:瓶颈在精确 3D 编辑——六维能力分析显示碰撞免检是所有模型最弱项(59-68%,RL 后依旧),而 RL 把 3D 推理从基座的 6-20% 拉到 56-85%(30B 达 85%,远超 Gemini 3.1-pro 的 62%)、检索合理性到 91-99%、3D 理解 90-98%、生态合理性 84-94%。发现四:训练动力学揭示两阶段分工——SFT 奠定物理/生态基础(RL 起点约 0.6/0.9,此后全程平坦)但对推理帮助有限(3D 理解仅 0.02→0.17);RL 才解锁空间能力(3D 理解 0.17→0.80、3D 推理 0.04→0.69);且 verified 奖励从 0.14 平稳升至 0.64,unverified 仅 0.04→0.37 且曲线震荡,说明 RL 上限受奖励保真度约束。发现五:失败模式集中两类——方向反转的精确距离编辑(位移量精确 7 m 但余弦相似度 -1,净误差 14 m vs 0.5 m 容差)与多轮精修中的过度编辑(正确加树却私自删树,一个未请求删除清零全部奖励)。检索器本身在 1,311 条留出查询上 multi-positive hit@10 达 99.8%,几乎每次调用都含可用候选。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 端到端 3D 世界构建(VWE-BENCH 全类型整体) | Pass@1 (%) | 59.3(VibeWorlder-30B-A3B,全部系统中第一) | GPT-5.5 57.3;Qwen3.8-Max 56.9;基座 Qwen3-VL-30B-A3B 仅 13.6 | 超最强闭源模型 +2.0;相对自身基座 +45.7 |
| 精确资产编辑(Verified 轨道,有 ground-truth 地图) | Pass@1 (%) | 64.5(VibeWorlder-30B-A3B);8B 版本 59.3 | GPT-5.5 60.4;Gemini 3.1-pro 44.4 | 超 GPT-5.5 +4.1;8B 超 Gemini 3.1-pro +14.9 |
| 3D 推理能力维度(六维分析中最弱初始能力) | 维度通过率 (%) | 85(VibeWorlder-30B-A3B,RL 后) | Gemini 3.1-pro 62;基座模型仅 6-20 | 超 Gemini 3.1-pro +23 |
| 8B 量级横向对比 | Pass@1 (%) | 41.4(VibeWorlder-8B,从 Qwen3-VL-8B 的 5.3 提升) | Gemini 3.1-pro 42.7(约 2.8T 参数级闭源) | -1.3(追平百倍大模型;单节点 8×H20 训得) |
| 人类盲评综合通过(物理可行+意图满足+生态合理+无幻觉) | Human Pass@1 (%) | 47.2(VibeWorlder-30B-A3B,最高;幻觉率 9.2%) | Qwen3.8-Max 46.7;GPT-5.5 33.3 | +0.5(且响应幻觉率比 Claude-Opus-4.8 的 69.2% 低 60 个百分点) |
局限与改进
作者承认的局限:(1) 碰撞维度在 RL 后仍只有 59-68%,精确无碰撞的 3D 编辑未被解决,是最顽固的瓶颈;(2) 资产库来自腾讯内部众包管线且仅覆盖卡通画风,查询分类学虽源自用户研究但未必覆盖真实请求的全部多样性,也不含图生世界、视频生世界等设定;(3) 最复杂世界仅 258 个资产,规模远小于真正开放世界;(4) 结果奖励对长视野任务天然稀疏,缺少回合级信用分配;(5) unverified 奖励依赖 MLLM judge,保真度直接限制 RL 收益(0.04→0.37 且曲线不稳,远不如 verified 的平滑上升);(6) 依赖模拟器渲染获取视觉反馈,耗时且拖慢评测与训练的数据扩展。我自己的补充观察:(7) verified 奖励按「正确修改资产比例」计分,而失败案例分析显示一个未请求的删除就会清零整个奖励,这种全有全无的惩罚可能把策略训得过于保守,也放大了模型状态 grounding 弱点的代价;(8) 验证器 backbone 是 Gemini 3.5-flash、冷启动数据靠 Gemini 3.1-pro,评测与训练都锚定在闭源模型上,存在版本漂移与循环论证风险,社区复现的奖励信号不会完全一致;(9) Distractor 查询上 VibeWorlder-30B-A3B 只有 50%(Kimi-K3 和 Qwen3.8-Max 为 100%),说明对不可行请求「先澄清再行动」的能力仍不稳;从零构建类查询整体偏弱(Theme only 下 8B 模型为 0%),且 RL 集中构建类查询仅 189 条,数据分布可能加剧了这一短板。
独立分析的弱点
弱点一:精确 3D 距离编辑的方向性错误。失败案例分析显示智能体常选对资产、算对位移量(精确 7 m),却把「向前」映射到场景坐标系的相反方向(余弦相似度 = -1,净误差 14 m,容差仅 0.5 m),这是坐标框架理解缺陷而非算术缺陷。改进方向:在观测中注入显式朝向标注(如渲染图上叠加坐标轴/罗盘),或增加空间对齐辅助任务(预测两资产相对方位、方向分类)作为 SFT 中间监督,也可让模型先以自然语言复述目标坐标再执行。弱点二:多轮精修中的过度编辑。指令只要求在箱子旁加一棵树,智能体加对了新树却私自删掉了原有大树——对已有世界状态的 grounding 太弱、对「未触碰元素须保持不变」缺乏约束。改进方向:把奖励显式分解为「请求内编辑得分」与「未请求改动罚分」,或在工具层引入资产白名单/保护机制;训练数据中增加含「禁止改动」约束的对照样本。弱点三:奖励稀疏且 unverified 奖励保真度有限。改进方向:作者已提出 potential-based credit assignment(在具体回合直接告知碰撞发生);进一步可把验证器六个维度做成多维加权奖励或课程式逐步解锁,甚至让智能体自检渲染图预测碰撞作为辅助自奖励。弱点四:渲染吞吐瓶颈。改进方向:课程式渲染(训练前期低分辨率/少视角,后期满配),或用神经代理渲染器近似 Blender 输出做粗筛。弱点五:碰撞这一硬瓶颈可能不是 RL 能单独解决的——逐资产输出坐标的范式让模型承担了全部数值空间计算,可考虑让模型输出结构化空间关系约束(A 在 B 左侧 2 m)、由几何求解器负责具体布局,把符号推理交给工具。
未来方向
作者明确提出的方向:(1) 更丰富、更可组合的工具与技能——当前沙箱只有五个原子操作,未来可支持「一键实例化足球场」「矩形区域散布资产生成森林」这类高层技能,而非逐资产低级编辑;(2) 更大规模世界构建——258 资产的上限离真正开放世界很远,可拆解为多个协作多模态智能体的子任务群;(3) 更高效的多模态 RL——当前整条轨迹一个结果奖励,在框架内做 potential reward credit assignment(回合级碰撞反馈)是有前景的方向;(4) 更多样的数据源与查询形态——突破单一卡通画风,纳入图生世界、视频生世界等多模态设定。基于本文成果可自然延伸的研究:(1) 把「双约束验证器即奖励服务」的模式推广到其他开放域具身/设计类任务(UI 生成、机器人任务场景合成);(2) 用 VibeWorlder 批量生成训练世界,反哺具身智能体训练,形成「世界构建-具身训练」闭环;(3) 作者在挑战部分指出空间推理可能要在预训练/中期训练阶段用 3D 数据扩规模解决,这为基座模型的空间预训练提供了明确的动机与评测靶;(4) 探索自验证机制——让智能体像 CLI 原型那样主动重渲染并检查「只有预期资产被改动」,把渲染闭环从推理技巧升级为训练信号;(5) 两阶段分工的结论(SFT 管物理/生态基础、RL 管空间推理与检索)可迁移到其他长视野工具使用任务的后训练配方设计中。
复现评估
复现条件在同类工作中属于较好水平:代码(GitHub: usail-hkust/VibeWorlding-Gym)、模型(HuggingFace: VibeWorlder-8B/30B-A3B 及各自 SFT 变体)、数据(VWE-Bench2026)全部开源,论文附录还给出了验证器打分规则(表6)、完整系统 prompt(A.5)与逐回合交互案例(A.1)。算力方面:8B 模型在单节点 8×NVIDIA H20 上训练,30B-A3B 需要三个节点(约 24 卡级别),对学术实验室偏高但并非不可及;纯推理评测门槛则低得多。需要注意的依赖:(1) RL 奖励与自动评测依赖 Gemini 3.5-flash,冷启动轨迹依赖 Gemini 3.1-pro,需要相应 API 预算,且闭源模型版本漂移会使奖励信号与论文不完全一致;(2) Blender 渲染服务是工程重头,多回合 × 8 rollout 的渲染吞吐直接决定 RL 训练时长,复现者需预留工程时间;(3) 检索器训练数据管线(28,835 条分级记录、241,548 条难负例的合成规则)在 A.2 描述得很细,超参齐全($\tau=0.05$、$\gamma=0.5$、$\lambda_{eco}=10.0$、lr $6\times10^{-6}$)。总体评估:难度中等偏高——组件多(沙箱、检索服务、渲染、RL 基建、验证器),但有完整开源代码兜底,按论文超参(GRPO lr $5\times10^{-7}$、KL 0.05、组大小 8、SFT lr $2\times10^{-5}$)对齐主结果(59.3% Pass@1)是现实的。
论文图表
两类主导失败模式的可视化案例:(a) 方向反转——要求把岩石「向前移 7 m」,智能体位移量精确但方向映射到相反坐标轴(余弦相似度 = -1),产生 14 m 误差(容差 0.5 m)并引发碰撞;(b) 过度编辑——要求在箱子旁加树,新树放对了位置([35.5, 12]),却额外删除了未要求删除的大树,单个未请求编辑清零全部奖励。
把「精确 3D 编辑是瓶颈」的定量结论落到具体可视化,说明失败源于坐标框架理解与状态 grounding 而非指令理解,直接指向改进方向。