← 返回 2026-08-07

WorldClaw:智能体驱动的规模化三维开放世界生成框架 WorldClaw: Agentic 3D Open-World Generation at Scale

Chunchao Guo, Jinpeng Li, Yang Li, Zilong Huang 📅 2026-08-05 👍 62 2026-08-11 18:30
3D场景生成 Tencent Hunyuan 图像到3D重建 地形生成 开放世界 智能体 粗到细

用粗到细的智能体管线,从开放文本生成可探索、可编辑的大规模三维世界

前置知识

智能体 / Agentic Pipeline

指由大语言模型(这里用 Claude Opus 4.8)驱动、能自主规划、调用工具、观察渲染结果并迭代修正的工作流。WorldClaw 把生成三维世界拆成多个专用智能体(意图分析、地形规划、地形精修、区域规划、场景精修等),通过结构化中间表示串联,每个智能体都能渲染场景、诊断问题、再调用 Blender/生成模型改正。

本文的核心定位就是 'agentic'。不理解智能体如何用 render-inspect-refine 闭环来修正地形和物体,就看不懂这套方法相对端到端生成模型的优势,也看不懂作者反复强调的迭代预算(iteration budget)和报告队列(report queue)。

粗到细 / 全局到区域(Coarse-to-fine, Global-to-regional)

一种分层构建策略:先确定全局共享约束(场景语义、空间组织、地形基底),再在需要细节的区域逐步实例化具体物体。WorldClaw 不一次性生成整个世界,而是先把全局地形搭好,再选择性填充需要实例级内容的区域。

这是全文的方法论总纲。公式 $P=F_{plan}(q)$、$T=F_{terrain}(P)$、$O=F_{region}(P,T)$ 三阶段正是这一思想的具体化,所有模块设计都服务于'让局部生成不破坏全局结构'。

高度场 / Height Field 与地貌算子(Geomorphic Operator)

用一个二维标量函数 $H(x)$ 表示地形海拔。WorldClaw 把每个区域的海拔写成'基础海拔 $h_r$ + 噪声分量 $N_{r,k}$ + 地貌算子 $G_{r,j}$'的组合,地貌算子包括山峰(peak)、沙丘(dune)、梯田(terrace)、侵蚀(erosion)等,再用软权重 $\tilde{e}_r$ 做区域间边界平滑融合。

全局地形生成是本文三大贡献之一。理解这个高度场组合公式 $H(x)=\sum_r \tilde{e}_r(x)[h_r+\sum_k w_{r,k}N_{r,k}+\sum_j \alpha_{r,j}G_{r,j}]$ 才能明白作者如何用'可编程、可编辑、可检查'的中间表示造出不规则但语义连贯的地形。

语义布局图 / Semantic Layout Map

一张用不同颜色编码预定义地形类别的二维图像 $I_{layout}$,把'区域类别、相对位置、邻接关系、覆盖范围'这些文字描述转成统一的空间分区。它替代了室内场景常用的户型图,专门适配自然地形那种弯曲、不规则的边界。

语义布局图是连接语言规划和几何构造的关键桥梁,后续的区域掩码提取、高度场生成、材质分配、资产散布全都共享这一分区。这也是本文区别于纯程序化生成(PCG)和纯扩散生成的地方。

图像到3D / Image-to-3D 与 SAM3 / SAM3D

把单张图像重建成带纹理的3D网格。本文先用文本引导的 SAM3 从区域合成图里分割出单个物体实例,再用 SAM3D 把每个实例重建成网格 $M_i$、外观 $U_i$ 和局部到相机变换 $T^{l2c}$,最后用 Hunyuan3D 做质量精修并生成 PBR 材质。

区域物体生成全靠这条 image-to-3D 链路。理解 SAM3 分割、SAM3D 重建、以及单视图重建带来的尺度偏差和校正(公式 $-\epsilon_i^- \le B(\Pi(K_i^o,\lambda_i M_i^c))-\hat{b}_i \le \epsilon_i^+$)是读懂物体放置与精修的前提。

模型上下文协议 / MCP(Model Context Protocol)

一种让大模型通过标准化接口连接外部工具(这里是 Blender)的协议。WorldClaw 通过 BlenderMCP 让精修智能体能够重新渲染场景、检查几何/材质/散布问题,并对区域地形参数、边界融合、材质缩放、资产密度等做局部修正。

MCP 是实现 render-inspect-refine 闭环的技术基础。场景精修阶段(Object Refinement + Terrain Refinement)全部依赖它能'看见'渲染图、'动手'改场景,否则第三大贡献——智能体精修环就无法落地。

研究动机

从一个开放文本提示生成大规模、可自由探索的三维世界,是生成式内容创作里最困难的目标之一。游戏、影视、VR、具身智能和机器人仿真都需要显式的三维场景,既要几何、外观、语义在连续空间中保持连贯,又要可行走、结构一致、可编辑。作者把现有方法分成四类并逐一指出痛点:程序化内容生成(PCG,如 Infinigen)可控、可扩展但表达能力被硬编码规则限制;图像/视频抬升法(如 Marble)内容丰富但缺全局一致性,且为拍一个完整房屋得绕一圈生成超长视频、算力浪费严重、新视角容易模糊;原生3D扩散法(体素/距离场/高斯)几何保真但被大规模3D场景数据集稀缺卡住,多样性不足;多模态大模型智能体法(MLLM-Agents)擅长全局规划和语义任务,却缺乏精确的3D空间控制,比如调整单个物体位置时常常过度修正。

本文的目标是构建一个能从开放式文本生成'大规模、可自由探索、可编辑'三维世界的端到端框架。具体目标包括三层:(1) 维持全局空间连贯,让山脉、峡谷、沙丘、河流等大尺度地貌在连续地形基底上有清晰的区域语义和过渡;(2) 在需要细节的区域生成丰富、多样的局部内容(建筑、植被、载具等),并与地形正确接触、不漂浮、不过度穿透;(3) 把世界表示成独立可编辑的带纹理网格,每个物体都是可复用、可替换的实例资产,能直接接入传统游戏引擎工作流,而不仅仅是一段固定视角的视频或一张静态图。

与已有工作不同的是,作者的独特切入角度是一个被反复强调的核心洞察:'一个全局连贯的世界并不需要处处同时生成'。共享约束(场景语义、空间组织、地形基底)可以先在全局建立,而区分各区域的物体和局部关系只需在需要的地方逐步实例化。这与上述四类方法的本质区别在于:PCG 受限于规则表达力,扩散法受限于数据规模,视频抬升受限于视角覆盖,MLLM 智能体缺乏精确空间控制——WorldClaw 用'全局语义布局图驱动的过程化地形 + 区域条件的图像编辑生成 + 双相机光线投射精确放置 + MCP 闭环精修'这条组合链,把四类方法的优势缝合起来,同时避开各自短板。

核心方法

整体直觉是'先打地基、再装修房间'。给定开放提示 $q$,WorldClaw 不试图一次性端到端生成整个世界,而是把它拆成三个顺序阶段:意图分析与规划产出结构化场景规范 $P$;全局地形生成把 $P$ 实例化成连贯地形基底 $T$;区域物体生成与放置在 $P$ 和 $T$ 条件下构造物体集合 $O$,最终合成 $S=Compose(T,O)$。技术路线上,每个阶段都由专用智能体执行,通过结构化中间表示($P$、$P_{terrain}$、$A_{terrain}$、$P_{regional}$ 等)通信,使局部生成和精修都能保留全局已建立的场景组织。整条链贯穿'显式、可检查、可编辑'的原则:所有中间产物(布局图、资产原型、材质、网格、放置变换)都是人/工具可读的,而不是隐式神经场。

核心创新是把'全局连贯'和'局部丰富'解耦,并用语义布局图驱动的过程化地形作为二者的耦合层。和已有方法的本质区别有三点:第一,不像纯扩散或视频抬升那样把世界压成单一神经表示,而是用'区域权重融合的高度场'$H(x)=\sum_r \tilde{e}_r(x)[h_r+\sum_k w_{r,k}N_{r,k}+\sum_j \alpha_{r,j}G_{r,j}]$ 显式建模地貌,使山脉/峡谷/沙丘/梯田能形成连续但语义分明的复合地形;第二,不像 MLLM 智能体那样直接让 LLM 去摆物体(容易过度修正),而是先在地形上渲染2D图、用图像编辑模型把物体'种'进画面、再用 SAM3/SAM3D 切分重建、最后用双相机光线投射恢复精确3D放置;第三,引入基于 BlenderMCP 的智能体精修环,能迭代修正地形几何、材质、资产分布以及物体-地形接触缺陷。

方法步骤详情

第一步意图分析与规划:意图分析智能体只提取用户明确表达过的约束(场景类型、风格、关键区域/物体、空间关系),不擅自补全;场景规划智能体在保留用户意图的前提下补全下游需要的缺失信息,输出 $P=(R, C_{terrain}, C_{object})$。第二步全局地形生成含三小步:地形规划智能体产出 $P_{terrain}=(p_{layout},p_{asset},p_{material},\theta_{terrain})$(含世界尺度、基础海拔、噪声频率/振幅、地貌算子权重等数值参数);地形资产生成用 GPT-Image-2 生成语义布局图 $I_{layout}$ 和代表性资产图 $I_{asset}$,用 Hunyuan3D 的 image-to-3D 把图转成可复用资产原型 $O_{asset}$,并用生成式纹理合成+过程化 Blender 材质节点两条路径构建材质集 $M_{terrain}$;地形生成与精修先生成复合高度场并按区域赋材质,再按 $p_{asset}$ 的区域亲和性和密度散布岩石/植被等地形相关资产,最后 BlenderMCP 智能体重新渲染、诊断、局部修正直至无问题或达到迭代预算。第三步区域物体生成与放置:区域规划智能体选出子集 $R^+ \subseteq R$ 并细化出 $P_{regional}$;区域物体生成渲染局部地形得 $I_{terrain}^r$,用图像编辑模型在保留地形拓扑和视角的条件下生成区域合成图 $I_{comp}^r$;物体生成用 SAM3(含滑窗推理)分割单实例、SAM3D 重建、做图像空间尺度校正(迭代调 $\lambda_i$ 让前景包围盒面积比 $\hat{b}_i$ 落在容差内);物体放置从重建相机和地形相机各投一条光线、求交点 $P_o/P_t$,由 $s_i=Z_t f_i^o/(Z_o \hat{f}_i)$ 算初始尺度,再沿地形相机光线联合搜索锚点深度和各向同性尺度直到底部体素与地形的接触比达标。最后场景精修智能体维护任务队列,先做物体精修(修正尺度/姿态,必要时用 Hunyuan3D 配合粗网格+物体图重生成更高质 PBR 材质,大物体给 $2048\times2048$、小物体给 $1024\times1024$),再做地形精修(在支撑区域内做物体-地形协同形变,解决漂浮/穿透/支撑不稳)。

技术新颖性

技术新颖性体现在四个方面:(1) 语义布局图驱动的区域感知过程化地形生成器——用颜色编码预定义地形类别生成不规则但语义连贯的二维分区,再喂给复合高度场公式,使大尺度地貌可控制、可编辑;(2) 全局场景约束+局部地形约束同时编码进可执行的区域规划,产出空间连贯、区域细粒度可控的物体布局;(3) 智能体精修环——这是与一次式规划方法(如 3D-GPT、SceneCraft)的根本区别,能迭代改进地形、修正物体尺度和姿态、解决物体-地形接触问题;(4) 把世界表示为独立可编辑带纹理网格+显式地形放置,天然支持自由视角渲染、资产复用和传统游戏引擎工作流,这一点与 WorldGen 最接近但 WorldClaw 在地貌表达力上更强。底层用 Claude Opus 4.8 作为智能体大脑,配 GPT-Image-2、SAM3、SAM3D、Hunyuan3D,在 4× NVIDIA H20 GPU + Blender 5.1.1 上运行。

Overview of WorldClaw
Figure 1: Overview of WorldClaw
Overview of global terrain generation and refinement
Figure 2: Overview of global terrain generation and refinement
Scene refinement
Figure 3: Scene refinement

实验结果

由于本文是技术报告型工作,全部结果为定性展示与定性对比,没有定量指标表。核心发现可分三块:(1) 四个代表性世界的定性结果(Figure 4-7)——热带海盗岛(不规则海岸线和分离陆地)、部落聚落峡谷(连续河流串起峡谷、谷底、植被、聚落,含显著高程变化)、沙漠战场(开阔战斗区+层叠岩石地貌+建筑/防御工事/载具)、红警风雪山谷(围合山体含多个功能区),证明 WorldClaw 能在统一地形基底上表达差异巨大的地貌组合,而非一堆断开的局部场景;局部行走视角展示了建筑、植被、码头、防御设施、通讯塔、载具等区域特异性内容,分布随地形与功能变化,开放区域也按要求保留,对应的实例/深度/法线渲染图暴露了独立组件、地形起伏和明确物体表面。(2) 与 SynCity、Marble、MajutsuCity、WorldGen、GPT 5.6 Sol 的定性对比(Figure 8,同为中世纪村庄主题):WorldClaw 用语义布局图造出明显高程变化、语义分区相连的地形,而 SynCity 长程组织弱、Marble 缺区域级组织、MajutsuCity 地面过于规则、WorldGen 地形偏平、GPT-5.6 Sol 地貌表达粗糙;(3) 内容丰富度与提示对齐方面,WorldClaw 按需保留开放地形并选择性引入聚落/植被/动物/环境物体,类别多样性更高、与区域功能对齐更紧。补充结果(Figure 9-15)还覆盖中世纪村庄、雪境河畔村、龙环沙漠营地、日式海岛镇、火山魔窟、宝石矿场、霍比特人山谷共7种主题,进一步验证可适配显著不同的世界布局、主题要求和局部复杂度。

Tropical pirate stronghold
Figure 4: Tropical pirate stronghold
Canyon with tribal settlements
Figure 5: Canyon with tribal settlements
Thrilling battlefield in the desert
Figure 6: Thrilling battlefield in the desert
Snow-covered mountain valley with style of Command & Conquer: Red Alert
Figure 7: Snow-covered mountain valley with style of Command & Conquer: Red Alert
Qualitative comparison with representative text-driven 3D scene generation methods
Figure 8: Qualitative comparison with representative text-driven 3D scene generation methods
查看结构化数据
任务指标本文基线提升
开放文本到三维世界生成(定性:地形与区域组织) 定性评估——地貌表达力、区域语义分区连贯性、区域间过渡质量 语义布局图驱动复合高度场,生成明显高程变化、语义分区相连且过渡自然的连续地形 SynCity 块状 latent 长程组织弱;Marble 缺区域级组织;MajutsuCity 地面规则;WorldGen 地形偏平;GPT-5.6 Sol 几何形态简单、过渡粗糙 地形地貌表达力和区域组织明显优于全部5个基线,能呈现山脉/峡谷/沙丘/梯田等复合地貌且区域语义清晰
开放文本到三维世界生成(定性:内容丰富度与提示对齐) 定性评估——物体类别多样性、与提示的语义对齐度、区域功能匹配度 按需保留开放地形并选择性引入聚落、植被、动物、环境物体,类别多样、与区域功能对齐紧密 SynCity 局部重复结构多;Marble 物体类别少(建筑+植被为主);MajutsuCity 偏城市结构、村庄对齐弱;WorldGen 视图间变化有限;GPT-5.6 Sol 物体几何简化、表面细节少 内容多样性和提示对齐优于全部5个基线,开放区域保留与功能区填充兼顾
开放文本到三维世界生成(定性:自由视角外观与场景表示) 定性评估——多视角几何稳定性、远距一致性、实例级可编辑性、引擎可用性 显式全局地形+独立重建并放置的物体网格,保留大尺度结构与局部内容,同时保留实例级可编辑性 SynCity 块间几何粗糙、不一致;Marble 远距质量退化、近距暴露离散高斯基元;MajutsuCity 受规则城市布局影响;WorldGen 显式网格、局部稳定(最接近);GPT-5.6 Sol 几何简化、视觉保真度低 在视角稳定性、远距一致性、实例可编辑性三者间取得最佳平衡,仅 WorldGen 在下游可用性上接近但地貌表达力不及

局限与改进

作者承认三类局限:(1) 对底层模型高度依赖——管线被拆成语言模型规划、图像生成布局/合成图、3D模型重建资产多段,每段都强依赖模型泛化能力。实验中开源语言模型常无法生成既可执行又符合用户需求的过程化地形和材质,开源图像模型常无法产出可用的语义布局图或在物体图生成/提取时丢失外观和姿态,最终视觉质量被3D生成骨干的天花板直接限死,所以现阶段只能靠 Claude Opus 4.8、GPT-Image-2、Hunyuan3D 这类强模型才跑得通。(2) 代码生成稳定性风险——多个阶段靠 LLM 生成 Blender 程序,尺度估计、数值参数、节点连接出错就直接体现在场景里(地貌不一致、材质不对、物体布局跑偏),常需多轮 render-inspect-refine;Blender 这类专业软件的 API 和节点工作流对当前语言模型仍是挑战,艺术家用复杂节点图做的材质效果在生成程序里常被简化成粗糙近似。(3) 效率开销——为构造实例级可编辑场景,要逐个生成/重建物体并对地形、资产、接触关系做多轮精修,长链路带来显著推理延迟和算力成本,随物体数和迭代数线性增长,对简单场景反而比整体生成法更慢更费,规模越大密度越高越明显。我的补充观察:论文完全没有定量评测指标和用户研究,难以客观判断优势幅度;与基线的对比仅一张同主题定性图,可能存在挑选偏差;4× H20 + Claude Opus 4.8 的算力与 API 成本对绝大多数团队难以复现。

独立分析的弱点

(1) 缺乏定量评测体系——全篇仅定性对比,没有用户研究、CLIP 相似度、几何指标(如 Chamfer 距离)、FID/FVD、视角一致性分数等。改进方向:构建一套包含提示集、参考场景、多维度评分(地貌合理性、区域对齐、物体接触质量、视角一致性、可编辑性)的 benchmark,最好有人评或多模型裁判。场景:复现对比或学术引用时无法客观定论。(2) 物体放置对单视图重建质量敏感——SAM3D 重建尺度偏差靠图像包围盒校正,但深度误差和分割边界仍可能引入漂浮/穿透,需要靠精修环兜底。改进方向:引入多视图证据或轻量几何先验约束重建,减少对精修环的依赖。(3) 长链路效率瓶颈——逐物体生成+多轮精修使延迟随复杂度爆炸。改进方向:批量重建、缓存复用资产原型 $O_{asset}$、对相似区域做模板化实例化、用更轻量的精修策略分级触发。场景:生成高密度城市时耗时不现实。(4) 强模型依赖导致难以落地开源生态——改进方向:蒸馏/微调专用小模型替换 Claude Opus 4.8 与 GPT-Image-2,或在开源模型上做针对性 skill 训练。(5) 材质表达被简化——专业节点图材质在生成程序里降级。改进方向:建立可检索的过程化材质库 + 智能体学习调用而非从零写节点图。

未来方向

作者明确指出两个方向:(1) 代码原生(code-native)3D 建模——当前区域物体主要靠生成式3D模型重建,难以稳定恢复零件层级、参数化结构、关节定义和交互逻辑;随着基础模型在代码生成、空间推理、工具使用上进步,可用可执行程序建模物体(WorldClaw 已在材质生成上试水 Blender 节点图和 shader 脚本),未来把程序化结构/材质与生成式几何/外观先验结合,提升可控性、可复用性、可动画性,最终可能完全用可执行代码构建沉浸式3D世界。(2) 与更成熟的生产级场景构建和 PCG 工具集成——当前主要靠 Blender,但大规模游戏世界还需要程序化生成、导航、物理、交互的运行时系统;可把 WorldClaw 的规划与代码生成能力接入 Unreal Engine 的 PCG 工具、关卡编辑、shader 编写、物理仿真和运行时交互,提升效率、可扩展性和实用性。基于成果可延伸的方向:构建三维世界生成 benchmark、把世界接入具身智能训练数据流水线、引入物理仿真验证场景合理性、扩展到室内/城市/水下等更多场景类型、加入时序与天气变化让世界可演化。

复现评估

复现难度高。开源情况:论文未明确提供代码或权重,仅给出项目主页 https://tencent-hunyuan.github.io/Hunyuan3D-WorldClaw,截至报告未承诺开源完整管线。数据:无需训练数据(零样本组合现有基础模型),但要复现需要能调用 Claude Opus 4.8(商业闭源 API)、GPT-Image-2(商业闭源 API)、SAM3、SAM3D、Hunyuan3D(部分开源)以及 Blender 5.1.1 + BlenderMCP 工具链。算力:作者用 4× NVIDIA H20 GPU,对绝大多数学术/个人团队是显著门槛。难度评估:方法描述相当详尽(结构化规范 $P$、高度场公式、放置变换 $T_{place}^i=s_i R_i$ 等),但 agent skill 的提示工程、各智能体的具体提示模板、错误恢复策略、迭代预算默认值等工程细节未全部公开,且强依赖闭源模型能力,他人用开源模型难以达到同等质量(作者自己在 Limitations 中也承认)。综合判断:思路可借鉴、组件可拼装,但端到端达到论文展示质量基本不可复现。