← 返回 2026-08-13

StateFlow:面向预可视化的三维世界状态构建、演化与访问 StateFlow: Building, Evolving, and Accessing 3D World States for Previsualization

Yuyang Yin, Zixiang Li, Longxuan Deng, Hongkai Li, Shifang Zhao, Junnan Liu, Weirong Huang, Mengyu Wang, Tianxiao Fu, Yikai Wang, Peng-Shuai Wang, Xiaojie Jin, Yao Zhao, Yunchao Wei 📅 2026-08-12 👍 26 2026-08-18 18:30
3D场景生成 世界模型 免训练系统 智能体视频生成 相机规划 预可视化

以可编辑的持久3D世界状态为中心,把预可视化从一次性视频生成变为可构建、演化、访问的世界建模

前置知识

预可视化(Previsualization)

影视、游戏、建筑行业中在正式制作之前的中间环节:创作者用低成本手段规划场景布局、动作走位、相机机位与时空动态,反复迭代验证创意后再进入正式生产。它优先传达创作意图而非精致画面,传统依赖游戏引擎等手工工具,耗时数周到数月。

这是本文的应用定位。理解预可视化强调迭代编辑而非一次性出片,才能理解为什么作者坚持要维护一个可反复修改和观察的持久世界状态,而不是生成一段视频就结束。

BEV(鸟瞰图)视角

Bird's-Eye-View,从场景正上方俯视的2D图像。俯视图能可靠表达物体在地面上的水平布局、相对距离和场景拓扑,但丢失高度与外观细节;与正面视图互补。自动驾驶中广泛用BEV做空间感知。

本文状态构建的核心设计是双视角:正面视图负责外观与资产,BEV负责空间布局,二者通过冲突消解融合成3D世界。不懂BEV的空间语义就无法理解为什么单视角不可靠、如何被提升算子 lifting 到3D盒。

VLM(视觉语言模型)作为推理引擎

视觉语言模型(如Gemini)能同时理解图像和文本,执行实例检测、布局推理、语义校验等任务。本文把它当作免训练系统的知识先验来源:判别幻觉物体、预测接地先验、解析用户意图、生成状态转移计划和相机提案。

StateFlow 是一个免训练、模型无关的系统,VLM 承担了几乎所有语义决策。论文中 Plan_VLM、Propose_VLM、Eval 等算子都由 VLM 实例化,理解这一点才能分清哪些模块是训练的、哪些是推理时编排的。

结构化状态表与状态转移

把世界表示为对象记录的表格,每行包含 ID、类别、3D盒 (x, y, z, w, l, h, yaw) 和状态(static/moving/explosion 等)。编辑即对表中若干行做紧凑更新,而非重新生成整幅图像或视频,类似数据库的 UPDATE 操作。

这是本文最核心的表示创新:论文 Fig. 2 直接给出了月球基地的状态表实例。所有演化操作(扩展、移动、爆炸替换)都定义为转移计划 Δt 作用在这张表上,这是与一次性生成方法的本质分野。

研究动机

预可视化是影视、游戏、建筑与城市设计中连接创意与正式制作的关键中间环节,创作者需要反复打磨场景布局、物体摆放、动作走位与相机机位,以低成本探索不同叙事可能。传统工作流依赖游戏引擎和实时3D工具,专业门槛高、周期长达数周甚至数月。近年图像与视频生成模型(如 SVD、CogVideoX、HunyuanVideo、Seedance 2.0、Wan 2.2)视觉质量大幅提升,但它们为一次性合成而设计:一个简短 prompt 必须同时指定场景内容、布局、运动和相机四个纠缠因素;生成结果不暴露任何持久状态供局部编辑与校验,导致修改、扩展或换机位观察时出现时空不一致、主体身份漂移和局部细节不稳定。面向长视频的智能体方法(MovieAgent、AniMaker、AniME)虽然引入了分层规划,但仍以脚本、分镜或依赖图为中心,无法维护统一的3D空间状态,在相机运动或场景演化时一致性依然脆弱。

本文的目标是本文的核心主张是:预可视化真正缺失的组件是一个显式且持久的工作状态。作者希望把预可视化从一次性视觉输出生成,转变为对可编辑、可演化、可复用的持久3D世界的建模,并形式化为三步:给定输入条件 $\mathcal{C}$,先构建初始世界状态 $W_0 = \mathcal{F}_{build}(\mathcal{C})$,再按用户意图演化 $W_{t+1} = \mathcal{F}_{evolve}(W_t)$,最后通过可控相机轨迹访问产生观测 $y_t = \mathcal{F}_{access}(W_t)$。系统需自动完成从文本 prompt 到可导出视频创作与3D游戏原型的完整流程,做到局部编辑不改全局、跨机位身份一致、相机轨迹几何可行。

与已有工作不同的是,现有工作的空白在于:3D场景生成方法(程序化生成 Infinigen、LLM/VLM 布局检索 Holodeck、LayoutGPT,生成式方法 SynCity、PartCrafter、SAM3D)普遍把场景构建当终点,产出基本静态的世界,不联合建模后续演化和相机控制的反复访问;智能体视频方法(MovieAgent、VideoClaw、Toonflow、ViMax)虽然暴露可编辑的制作阶段,但中心是剧本、分镜或依赖关系,不是统一的3D状态。本文的独特切入是把对象中心的结构化3D状态表作为一等公民表示——每个对象携带几何 $g$、位姿 $p$、语义 $s$ 三元组,视频只被视为对这个显式世界的一种观测。由此构建、演化、访问三个被生成模型纠缠在一起的角色被彻底解耦,预可视化第一次拥有了和人工工作流中场景文件同等地位的显式工作状态。

核心方法

直觉上,人工预可视化流程天然分三步:先搭场景、再反复修改、最后多机位查看,且全程维护一个显式工作状态(引擎里的场景文件)。StateFlow 让生成式系统模仿这一流程:把世界表示为对象集合 $W_t = \{o_t^i\}_{i=1}^{N_t}$,每个对象是三元组 $o_t^i = (g_t^i, p_t^i, s_t^i)$——几何 $g$ 用于渲染和物理推理、3D位姿盒 $(x, y, z, w, l, h, yaw)$ 决定空间布局、语义状态 $s$ 存类别与 static/moving/explosion 等可编辑属性,缺一即丢失视觉实现、空间一致性或可控演化能力。系统免训练,由现成模型编排:Gemini 3.1 做全部 VLM 推理,Nano Banana 2 生成双视角参考图,Hunyuan3D 做图生3D,Seedance 2 做视频后端。流水线依次执行状态构建、状态演化、状态访问三阶段。

核心创新是以显式持久世界状态为中心组织预可视化,与已有方法的本质区别体现在三处。其一,与一次性生成方法不同:编辑不是重新生成整个视频或场景,而是 VLM 对结构化状态表产出紧凑转移计划 $\Delta_t = \mathrm{Plan}_{VLM}(W_t, u_t)$,再 $W_{t+1} = \mathrm{Apply}(W_t, \Delta_t)$,只更新受影响对象的 $(g, p, s)$ 项,未触碰的对象完整保留身份与世界记忆,避免每次编辑都全场景重生成。其二,与静态3D场景生成不同:初始场景只是起点,同一世界可被持续演化并被任意相机反复访问,构建-演化-访问解耦后各自可独立优化和替换。其三,与文本驱动的相机生成(如 ChatCam)不同:相机规划由低成本渲染反馈闭环验证,几何真实的渲染会暴露可见性、遮挡、构图和碰撞问题并指导局部修复,而不依赖 VLM 语义推理的盲猜,也不需要训练相机策略。

方法步骤详情

阶段一状态构建:先用图像模型生成正面视图(外观与资产源)与BEV鸟瞰图(空间布局源),分别检测实例与2D布局框;因两视角独立生成必然冲突,按非对称角色做冲突感知消解——数量一致的对象按BEV框放置正面资产;BEV-only 对象经 VLM 结合 prompt 与邻域语境判别,与 prompt 矛盾或物理上无支撑的被判为幻觉删除或降权,合理的语境元素保留;front-only 对象作为语义锚点,由 VLM 生成暂定布局假设。随后 VLM 为每个保留物体预测接地先验 $\gamma_i \in \{\mathrm{grounded}, \mathrm{floating}\}$,用接地感知提升算子 $b_i^{(0)} = \mathrm{Lift}_{\gamma_i}(\hat{r}_{BEV}^i, \bar{s}_i)$ 初始化3D盒,floating 物体高度由 VLM 或类别先验推断。最后在推理时优化 $B^\star = \arg\min_B \mathcal{L}_{front} + \lambda_b \mathcal{L}_{bev} + \lambda_v \mathcal{L}_{vlm} + \lambda_p \mathcal{L}_{phys}$,四项分别保持正面外观、BEV布局、语义存在性与接地先验、惩罚碰撞与越界,只更新盒子参数不动模型权重;同时正面裁剪经 Hunyuan3D 得到 $g_i^0$,加上语义属性组成 $W_0$。阶段二状态演化:场景级支持场景扩展(复用构建流程生成新区域并合并,保留原空间支撑与身份)和风格改写(重写场景/对象描述符);对象级支持刚体运动(更新 $p_t^i$)、角色姿态轨迹更新(保身份表达行为态)、爆炸毁伤等难连续仿真事件用事件级资产替换(替换 $g_t^i$,保留身份、语义角色与粗略位置)、外观状态更新 $s_t^i$。阶段三状态访问:从 $W_t$ 读取对象身份、位姿、包围框、遮挡层级、重要物体与场景范围,加上规范渲染视图提供视觉语境;用户指令被总结为分段导演意图 $d_i$;VLM 提案 $\pi_i^{\prime 0} = \mathrm{Propose}_{VLM}(W_t, \mathcal{V}, d_i)$;执行渲染 $R_k^i = \mathrm{Render}(W_t, \pi_k^i)$ 并评估 $e_k^i = \mathrm{Eval}(R_k^i, \pi_k^i, d_i, W_t)$,总结意图不符、目标不可见、构图差、碰撞风险、运动瑕疵等差异;反思把问题转为相机参数的局部修复候选集 $P_k^i = \{\pi_k^i + \Delta^m\}_{m=1}^M$,按打分 $\pi_k^{i+1} = \arg\min_{\pi \in P_k^i} J(\pi; d_i, W_t, R_k^i)$ 选最优,$J$ 综合意图对齐、目标可见性、构图、避碰与运动平滑,迭代直到无显著问题或达最大轮数。

技术新颖性

技术新颖性体现在四点。第一,非对称双视角初始化:正面视图管外观资产、BEV管空间布局,配合跨视角冲突感知消解(数量匹配、幻觉删除、语义锚点三种情形),绕开了需要昂贵3D标注且在开放生成场景上易分布外失效的专用3D框检测器。第二,推理时轻量盒优化:$\lambda_b \mathcal{L}_{bev} + \lambda_v \mathcal{L}_{vlm} + \lambda_p \mathcal{L}_{phys}$ 等四项损失只优化盒子参数而非任何模型权重,保持训练自由与模型无关,任何更强的图像或3D模型出现都可直接替换接入。第三,事件级资产替换:把爆炸、毁伤、大幅非刚性形变这类难以连续仿真的动态,建模为几何项 $g_t^i$ 的离散替换而非让视频模型幻觉出物理过程,换来可编辑性与跨视角一致性。第四,问题驱动的相机修复:只在当前轨迹周围生成由具体渲染缺陷引发的紧凑候选集 $P_k^i$ 做局部搜索,而非全局轨迹优化或端到端训练相机策略,无需相机轨迹标注,兼具效率与可解释性。

StateFlow turns creative intent into a persistent 3D world that can be constructed, evolved, and accessed for downstream creation.
Figure 2: StateFlow turns creative intent into a persistent 3D world that can be constructed, evolved, and accessed for downstream creation.

实验结果

场景生成对比(Table 2):与 SynCity(免训练逐瓦片生成)、SAM3D(前馈图生3D)、PartCrafter(部件感知生成)在45°俯拍环绕视频上比,StateFlow 的 CLIP-I 达 0.788(SynCity 0.689、SAM3D 0.580、PartCrafter 0.542),CLIP-T 达 30.214(SynCity 22.880、SAM3D 15.481),视觉与文本对齐均显著领先;HPS V2 0.151 与 Q-Align 3.621/2.859 略低于 SynCity 的 0.175 与 3.535/2.966,作者解释这两个指标偏好色彩与视觉风格。视频创作对比(Table 1 VBench):StateFlow 平均分 0.8484 居首(Seedance 2.0 为 0.8387、Wan 2.2 为 0.8283、Animaker 0.8092、MovieAgent 0.8075),并在主体一致性 0.9135(Wan 2.2 为 0.8836)、背景一致性 0.9506、运动平滑 0.9923、防闪烁 0.9902 四项全部第一,说明基于持久世界状态的生成在结构与时间性维度优势明显;Aesthetic 0.5257 落后于偏色彩风格的基线。主观评测(Table 3):N=30 名参与者、每设置 12 个 prompt、5 点 Likert 量表加匿名随机排序,辅以 gemini-3.1 的 MLLM 自动评测;场景级 Overall 得分 4.5/3.7(用户/MLLM),大幅超过 SAM3D 的 3.5/2.5 与 SynCity 的 3.2/3.0,布局合理性 4.6/3.3、预可视化有用性 4.7/3.1 均最佳;视频级 Overall 4.5/4.0 超过 Seedance 2 的 3.6/2.1,空间一致性 4.7/4.3、身份一致性 4.7/3.9、相机质量 4.6/4.4 优势显著。消融实验(Figure 5):去掉 BEV 布局导致全局布局弱、物体比例失真;去掉冲突消解产生物体缺失、重复与互穿;用直接再生成替代选择性状态转移会削弱跨编辑的身份保持与空间一致性;VLM-only 相机出现焦点错误、轨迹穿模、过度简化轨迹等失败,验证渲染反馈反射的必要性。

Quantitative comparison with video generation methods on VBench
Table 1: Quantitative comparison with video generation methods on VBench
Quantitative comparison with scene generation (CLIP-I, CLIP-T, HPS V2 and Q-Align)
Table 2: Quantitative comparison with scene generation (CLIP-I, CLIP-T, HPS V2 and Q-Align)
User study and MLLM-based evaluation on 3D scene generation (top) and video generation (bottom)
Table 3: User study and MLLM-based evaluation on 3D scene generation (top) and video generation (bottom)
Qualitative comparison on Scene Generation
Figure 3: Qualitative comparison on Scene Generation
Qualitative comparison on previsualization applications
Figure 4: Qualitative comparison on previsualization applications
Visualization of Ablation Study
Figure 5: Visualization of Ablation Study
查看结构化数据
任务指标本文基线提升
视频创作(VBench 综合) Average(越高越好) 0.8484 Seedance 2.0:0.8387;Wan 2.2:0.8283;Animaker:0.8092;MovieAgent:0.8075 较最强基线 Seedance 2.0 提升 +0.0097,超过全部四个视频生成范式
视频主体一致性(VBench) Subject Consistency 0.9135 Wan 2.2:0.8836;Seedance 2.0:0.8110;MovieAgent:0.7533 +0.0299,验证持久3D状态跨镜头保持身份的能力
3D场景生成 CLIP-I(视觉质量) 0.788 SynCity:0.689;SAM3D:0.580;PartCrafter:0.542 +0.099,场景完整性与物体级细节显著优于三类范式
3D场景生成 CLIP-T(文本对齐) 30.214 SynCity:22.880;SAM3D:15.481;PartCrafter:20.761 +7.334,prompt 语义还原度大幅领先
视频级预可视化用户研究 Overall Score(5点Likert,用户/MLLM) 4.5 / 4.0 Seedance 2:3.6 / 2.1;Wan 2.2:3.1 / 2.3;AniMaker:2.5 / 1.7;MovieAgent:1.7 / 1.4 用户评分 +0.9,MLLM 评分近乎翻倍(+1.9)
场景级预可视化用户研究(45°环绕视频) Overall Score(用户/MLLM) 4.5 / 3.7 SAM3D:3.5 / 2.5;SynCity:3.2 / 3.0;PartCrafter:2.0 / 2.0 用户评分 +1.0,布局合理性 4.6 对基线最高的 3.2

局限与改进

作者承认的主要局限是推理速度:虽然把工业预可视化流程从数周或数月加速到数分钟,但受第三方模型(图像生成、图生3D、视频后端)推理速度制约,尚无法支持完全实时的交互。我的补充观察:其一,系统深度绑定闭源专有模型(Gemini 3.1、Nano Banana 2、Seedance 2、Hunyuan3D),任一模型的升级或停服都会改变系统行为,也给学术复现设置高门槛;其二,状态以3D盒加离散状态标签(static/moving/explosion)表达,无法刻画角色关节动画、软体、布料、流体等连续动态,事件级资产替换是离散近似,事件前后的过渡可能生硬;其三,评测规模有限(每设置仅 12 个 prompt、30 名用户),且用户研究未报告显著性检验与置信区间;其四,VBench 上 Aesthetic 与 Imaging 不占优,说明最终观感仍高度依赖视频后端的增强,世界状态本身的渲染保真度没有被单独评估;其五,所有评测 prompt 似乎都是单一场景级描述,超长叙事、多场景跨度和密集多人交互场景的能力未被验证。

独立分析的弱点

弱点一:状态表达粒度受限。$o_t^i = (g_t^i, p_t^i, s_t^i)$ 中位姿是单个3D盒、语义是离散标签,适合刚体摆放与走位,无法表达表情、手指动作或布料飘动;改进方向是引入骨架参数、网格级形变场或可微仿真。弱点二:专有模型链耦合,VLM 幻觉或视频后端风格漂移会沿流水线传导;改进方向是增加自一致性投票与多模型冗余,并用开源替代做鲁棒性消融。弱点三:冲突消解依赖 VLM 单次判别删除 BEV 幻觉物体,密集场景下错误可能级联进3D布局;改进方向是接入支撑关系等物理/几何硬约束校验器。弱点四:相机规划的渲染反馈循环每轮都渲染加评估,长轨迹成本高;改进方向是预计算可见性与遮挡图、粗到细两级渲染。弱点五:moving 状态只是盒子位移,无重力和碰撞动力学;改进方向是把物理引擎作为演化算子,使转移同时更新动力学量。

未来方向

作者在结论与局限中提出的方向:通过更高效的部署与更快的第三方模型推理逼近实时交互,把显式3D世界状态推广为生成模型与生产级创意工作流之间的通用中间表示。基于本文成果可自然延伸的方向:一是接入实时物理仿真,把爆炸、毁伤等事件从离散资产替换升级为连续动力学模拟,同时保留资产替换作为快速兜底路径;二是把扁平对象表扩展为层级化场景图(房间-家具-零件),支撑室内外大世界与场景图级编辑、撤销与版本 diff——持久状态天然适合版本管理,可发展多人协作的云预可视化平台;三是把渲染反馈反射的评测信号 $J(\pi; d_i, W_t, R_k^i)$ 蒸馏进端到端相机策略或可微渲染模块,在保留可解释性的同时降低推理成本;四是将 Seedance 类视频后端替换为可交互世界模型(Genie 类实时生成环境),使同一3D状态直接驱动游戏级实时交互原型;五是建立针对多对象、长时段一致性的专门基准与评测协议,弥补当前 12-prompt 规模评测的不足。

复现评估

复现难度中高。论文未提供开源代码,项目页(yuyangyin.github.io/StateFlow)仅展示结果视频。方法免训练,无需大规模 GPU 训练,主要成本是 API 调用费与渲染反馈循环的多次推理;但实现依赖一串最新闭源模型:Gemini 3.1、Nano Banana 2、Hunyuan3D、Seedance 2,版本迭代会直接影响可复现性。评测协议描述相对完整:VBench 六项指标、45°环绕视频上的 CLIP-I/CLIP-T/HPS V2/Q-Align、N=30 用户研究(12 prompts、匿名随机排序、注意力检查项)加 MLLM 自动评测,四个消融变体定义清晰;但 prompt 列表、损失权重 λb、λv、λp、提升算子细节与最大反思轮数等工程细节未披露,精确复现需要较多试错。合理路径是按论文框架用可获得模型重现流水线骨架,再自行调优超参。