GraphVid:交互式图控制视频生成 GraphVid: Interactive Graph-Controllable Video Generation
用可编辑的有向交互图取代轨迹控制,冻结视频DiT加LoRA实现多物体可控生成
前置知识
图像到视频生成与扩散Transformer(DiT)
图像到视频(I2V)生成要求模型从单张静态帧合成时间连贯的视频。当前主流做法是基于大规模去噪扩散模型,尤其是扩散Transformer(DiT),如 LTX-Video、CogVideoX、Wan:把视频经 VAE 压到潜空间,用 transformer 逐步去噪,学到丰富的时空生成先验。
GraphVid 冻结 LTX-Video 2B DiT 作为生成主干,只在外面加轻量模块注入图条件。不理解 DiT 的条件注入机制(encoder hidden states、交叉注意力)就无法理解图 token 如何引导视频生成。
场景图与有向交互图
场景图是结构化表示视觉内容的图结构:节点是场景中的实体(人、手机、终端),边描述实体间的关系。GraphVid 用有向属性图 $G=(V,E)$,边带开放词表的交互类型(push、pull、lift、hold),还支持自环表示单实体动作(rotate、move、scale)。
交互图是本文的核心控制接口,用户通过增删改图上的边来指定动态。理解节点/边/自环的语义是读懂方法设计、编辑流程和边语义消融的前提。
GINEConv 与边感知消息传递
标准 GCN 把边只当二值连接,聚合时忽略关系类型。GINEConv(Graph Isomorphism Network)在消息聚合中显式注入边属性:$h_i^{(l+1)} = \mathrm{MLP}(h_i^{(l)} + \sum_{j\in\mathcal{N}(i)} \mathrm{ReLU}(h_j^{(l)} + a_{ji}))$,使节点更新同时依赖邻居特征和边语义。
本文的 Edge-Aware Graph Reasoning 模块正是基于 GINEConv,让 push 和 pull 这类语义相反的关系在聚合中产生不同的影响,这是方法的核心创新点。
LoRA 参数高效微调
LoRA(Low-Rank Adaptation)冻结预训练权重,在注意力层的 Q/K/V/输出投影旁挂一对低秩矩阵 $A\in\mathbb{R}^{r\times d}$、$B\in\mathbb{R}^{d\times r}$,只训练 $BA$ 的增量。秩 $r$ 越大表达能力越强、参数越多。
GraphVid 用 rank 128 的 LoRA 让冻结 DiT 学会响应图 token,只引入 0.6B 可训练参数;消融(Table 7)表明秩从 16 升到 128 使 FID 从 18.34 降到 17.02。
流匹配(Flow Matching)训练目标
流匹配是扩散模型的一类训练目标:在数据 $x_0$ 和噪声 $x_1$ 之间构造线性插值路径 $x_t = (1-t)x_0 + t x_1$,训练网络 $v_\theta$ 预测该路径的速度方向,损失为 $\mathcal{L}_{\mathrm{CFM}} = \mathbb{E}\|v_\theta(x_t,t,c) - (x_1 - x_0)\|^2$,比 DDPM 更直接、采样更高效。
GraphVid 沿用 LTX-Video 的流匹配目标训练,只更新 GNN、适配器和 LoRA。理解该目标才能明白训练时哪些参数在学什么。
生成视频评价指标:FID/FVD/PSNR/SSIM/EPE
FID 用 Inception 特征衡量生成帧与真实帧的分布距离(越低越好);FVD 用视频特征衡量时序分布距离;PSNR/SSIM 衡量与真值的像素级重建保真度;EPE 是预测光流与真值光流的平均端点误差,直接度量运动是否服从指定的交互。
论文所有结论都建立在这五个指标上:FID 17.02、FVD 99.42、PSNR 15.98、SSIM 0.61、EPE 2.9。不熟悉这些指标就无法判断与 WISA、Motion-I2V 对比的含金量。
研究动机
现有可控视频生成主要有两条路线,各有硬伤。其一是轨迹条件运动控制(Motion Prompting、Wan-Move、MagicMotion、Motion-I2V 等):用户要为每个物体绘制精确的点轨迹,控制信号随物体数量线性增长,在遮挡和重叠时产生歧义,而且少量轨迹误差就会导致全局不合理的运动,如接触不一致、滑动、穿透、动作去同步。其二是物理感知方法(WISA、力场/速度场控制):把物理编码为低层控制场或预定义类别,难以表达开放场景中多实体间复杂的组合交互。更致命的是数据依赖:这类方法依赖海量密集运动标注——Wan-Move 用 200 万样本训练、Motion Prompting 用 220 万、Motion-I2V 用 1000 万,标注成本极高、难以扩展到多样环境。文本提示则粒度太粗,难以把局部运动绑定到具体实体,导致运动歧义。
本文的目标是本文的目标是设计一种既精确又直观的多物体控制接口:让用户从单张输入图像出发,通过结构化的有向交互场景图直接指定动态意图。图中节点对应检测到的实体,有向边编码交互类型(如 push、pull、lift、hold)以及粗粒度的方向和幅度等物理线索,涉及单个实体的指令(如 rotate、move、scale)用自环边表示。技术目标是学习条件视频生成器 $p(I_{1:T} \mid I_0, G)$,把编辑后的交互图翻译成条件 token 注入冻结的视频扩散主干,在完整保留预训练生成先验的前提下实现结构化物体中心控制;同时大幅压缩可训练参数(0.6B)和训练数据(27K 片段),并做到最快的推理速度。
与已有工作不同的是,本文的独特切入是把运动控制从「几何位移」层面提升到「关系语义」层面。轨迹方法把运动当作像素位移,物理方法把物理当作低层场或固定类别,而 GraphVid 认为场景动态的本质是实体间的有向交互关系,因此用交互图作为控制模态:这是首个支持从单图自动构建、再由用户交互式编辑有向交互图来控制多物体动态的框架。第二个差异化是效率哲学:冻结 LTX-Video 主干,只训练 GNN、图到 token 适配器和 LoRA 模块(0.6B 参数,约为 FlashMotion 的 1/21.7),用 27K 交互中心数据(比 Motion-I2V 少约两个数量级)取得相当甚至更优的指标,推理 200 秒为所有对比方法最快,证明结构化语义接口本身可以替代密集运动监督。
核心方法
直觉上,GraphVid 让用户告诉模型「谁对谁做什么」,而不是「每个像素怎么动」。技术路线分三步:构建图、图推理、条件注入。给定输入帧 $I_0$,先用 Qwen3-VL 检测实体,为每个节点构造特征 $x_i = [f_i^{vis} \| f_i^{txt} \| b_i]$:8192 维视觉嵌入(对物体区域做 mean/max 池化)拼接 2560 维标签文本嵌入和 4 维归一化框坐标,共 10756 维;MLLM 通过关系抽取提示生成初始交互图,边用 Qwen3-Embedding 编码成 2560 维文本特征。随后边感知 GNN(GINEConv,隐藏维 512)做多轮消息传递,得到既含物体身份又含关系状态的节点嵌入;每个 $z_i = \mathrm{MLP}(h_i) \in \mathbb{R}^{4096}$ 作为语义条件 token,与边文本 token 一起作为 encoder hidden states 送入冻结的 LTX-Video DiT。LoRA(rank 128)注入 Q/K/V 和输出投影层,用流匹配目标训练,全流程端到端可微。
核心创新是边感知图推理。标准 GCN 把边当二值连接,只传播节点特征,丢掉了「关系类型决定运动模式」这一物理事实——push 和 pull 方向相反,hold 和 lift 动力学完全不同。GINEConv 把边属性 $a_{ji}$ 直接写进聚合步:$$h_i^{(l+1)} = \mathrm{MLP}^{(l)}\Big(h_i^{(l)} + \sum_{j\in\mathcal{N}(i)} \mathrm{ReLU}(h_j^{(l)} + a_{ji})\Big)$$ 使每个节点表示编码「自己正被什么关系支配」的动态状态。与最接近的 WISA 的本质区别:WISA 依赖预定义的文本物理类别,而 GraphVid 的边是开放词表、用户可交互编辑的有向关系,且通过图拓扑把运动绑定到具体实体而非全局文本提示。消融(Table 6)量化了这一设计:完整图条件 FID 17.02 优于仅拓扑图(17.52,会混淆推/拉)和纯文本提示(20.04),说明拓扑提供空间绑定、边语义提供交互意图,两者缺一不可。
方法步骤详情
第一步,图构建:输入帧经 Qwen3-VL 检测物体框与标签,物体 crop 池化得 8192 维视觉嵌入,拼接 2560 维标签文本嵌入与 4 维归一化坐标成 10756 维节点特征;MLLM 按关系抽取提示输出初始有向图,单实体动作用自环表示。第二步,交互编辑:用户在图上增删改边并附文本语境,如「Earring sways and follows head rotation due to inertial momentum」。第三步,边感知推理:节点/边特征经 MLP $\phi_n$、$\phi_e$ 投到 512 维共享空间,过 L 层 GINEConv 消息传递。第四步,条件注入:节点嵌入经 MLP 投到 LTX 的 4096 维潜空间,节点序列填充至最多 30 个,与边文本 token 拼接为 encoder hidden states。第五步,训练:目标视频经 VAE 编码,从 logit-normal 采样时间步 $t$,$x_t=(1-t)x_0+t x_1$,以流匹配损失 $\mathcal{L}_{\mathrm{CFM}}=\mathbb{E}\|v_\theta(x_t,t,c)-(x_1-x_0)\|^2$ 只更新 GNN、适配器和 LoRA,VAE 与 DiT 全程冻结。
技术新颖性
技术新颖性体现在四个层面。接口层面:首个从单图交互式构建并编辑有向交互图来控制多物体动态的框架,图到 token 的条件接口是全新的模态桥,用户不需要画轨迹,只需指定关系。表征层面:把 GINEConv 引入视频生成条件化,边语义直接参与消息传递,节点表示因此携带「动态关系状态」,这是结构化图条件驱动视频扩散的系统性实现。效率层面:0.6B 可训练参数、27K 训练片段、200 秒推理三项资源指标全面领先,EPE 2.9 还是不依赖任何显式运动监督下的最低运动误差,说明图条件本身是比轨迹更强的归纳偏置。通用性层面:把 2B LTX 换成 5B Wan 2.2,同一套 GNN+适配器几乎无损迁移(FID 17.02 对 17.29),证明图条件是主干无关的通用信号而非对某个潜空间的特调;LoRA 秩消融(16 到 128,FID 18.34 降到 17.02)则界定了适配容量的收益曲线。
实验结果
主实验在 MoveBench 交互中心子集(Table 2):GraphVid 以最少数据(27K)、最少参数(0.6B)、最快推理(200 秒)取得 FID 17.02、FVD 99.42、PSNR 15.98、SSIM 0.61、EPE 2.9。逐个对手:对物理感知的 WISA,FID 降 34.5%(25.98→17.02)、FVD 降 7.8%(107.89→99.42)、EPE 降 29.3%(4.1→2.9);对轨迹类 Motion-I2V,FID 降 39.9%(28.32→17.02)、FVD 降 37.6%(159.32→99.42)、PSNR 升 61.9%(9.87→15.98)、SSIM 升 60.5%(0.38→0.61);对 Tora,FID 降 30.3%、FVD 降 10.0%、PSNR 升 41.7%;对 FlashMotion,FID 降 10.5%(19.02→17.02);对 MagicMotion,FID 约降 36%。EPE 2.9 为同规模最低,比轨迹类方法低 9.4–25.6%,即不用显式运动监督反而运动更准。Wan-Move 绝对指标最好(FID 15.56),但用 200 万样本、14.5B 主干、1800 秒推理。多物体子集(Table 3)中 GraphVid 以 FID 49.45、FVD 291 为同规模最佳(比 FlashMotion 的 55.03/311 分别好 10.1% 和 6.4%),但所有方法较主表均明显退化。四组消融:换 5B Wan 2.2 主干 FID 仅 17.02→17.29,验证主干无关;节点容量 30 最优,扩到 256 时 FID 恶化到 17.97(零填充稀释注意力);去掉边文本后 FID 17.52、EPE 3.0,出现推/拉混淆;LoRA 秩 16→128 使 FID 降 7.2%、PSNR 升 16.6%(13.70→15.98)。定性结果(Fig. 6)展示踢球、骑车转头、倾斜杯子等复合交互的可控生成。
查看结构化数据
| 任务 | 指标 | 本文 | 基线 | 提升 |
|---|---|---|---|---|
| 交互中心可控视频生成(MoveBench 子集) | FID(感知质量,越低越好) | 17.02 | Motion-I2V 28.32;WISA 25.98 | 较 Motion-I2V 降 39.9%,较 WISA 降 34.5% |
| 交互中心可控视频生成(MoveBench 子集) | FVD(时序分布距离,越低越好) | 99.42 | Motion-I2V 159.32;WISA 107.89 | 较 Motion-I2V 降 37.6%,较 WISA 降 7.8% |
| 交互中心可控视频生成(MoveBench 子集) | PSNR(重建保真,越高越好) | 15.98 | Motion-I2V 9.87;WISA 15.08 | 较 Motion-I2V 升 61.9%,较 WISA 升 5.9% |
| 交互中心可控视频生成(MoveBench 子集) | SSIM(结构相似度,越高越好) | 0.61 | Motion-I2V 0.38;WISA 0.53 | 较 Motion-I2V 升 60.5%,较 WISA 升 15.0% |
| 运动准确性(光流端点误差) | EPE(越低越好) | 2.9 | WISA 4.1;Motion-I2V 3.9;MagicMotion 3.2 | 较 WISA 降 29.3%,为同规模方法最低 |
| 多物体交互子集(MoveBench) | FID | 49.45 | FlashMotion 55.03;Tora 56.04 | 较 FlashMotion 降 10.1%,同规模方法最佳 |
| 多物体交互子集(MoveBench) | FVD | 291 | FlashMotion 311;WISA 341 | 较 FlashMotion 降 6.4%,同规模方法最佳 |
| 推理效率 | 单条视频推理时间 | 200 秒 | FlashMotion 677 秒;Wan-Move 1800 秒 | 比 Wan-Move 快 9 倍,为全部对比方法最快 |
局限与改进
作者承认的局限:与超大规模的 Wan-Move 相比绝对指标仍有差距(FID 15.56 对 17.02、多物体子集 FVD 252 对 291),作者将其归因于数据和主干规模;多物体子集上所有方法都显著退化(GraphVid FID 从 17 涨到 49.45),说明密集场景下的交互推理仍是开放难题。我自己的观察:其一,主指标 PSNR/SSIM 是重建式指标,对生成任务(真值不唯一)的参考价值有限,人偏好研究只放在附录 D,正文缺乏任务级成功率之类的评测;其二,初始图由 MLLM 自动构建,检测漏检或关系误判会级联进生成,论文没有量化图构建本身的准确率,也没讨论错误图的鲁棒性;其三,30 节点上限是为对抗注意力稀释的经验选择,对极端复杂场景可能截断关键实体;其四,数据统一为 81 帧 16fps 的短片段,长时序一致性、交互随时间演化(时变拓扑)未覆盖;其五,训练集 GraphVid-Bench 与评测子集均由作者构建,分布重叠可能带来隐性利好。
独立分析的弱点
弱点一:MLLM 自动图构建无质量保证。Qwen3-VL 漏检小物体或误判关系(把「拿着」判成「靠着」)会直接传导成错误运动,而论文没有图构建精度的量化,也没有失败兜底。改进方向:引入图一致性校验(如视觉问答复核每条边)、多模型投票,或输出边级置信度让用户编辑时聚焦可疑边。弱点二:边语义是纯文本嵌入。Qwen3-Embedding 的 2560 维向量难以精确表达「向左上 30 度、力度中等」这类参数化物理线索,Table 6 显示去掉边文本会出现推/拉混淆。改进方向:把方向、幅度、时序作为显式结构化边属性拼接进 $a_{ji}$,而不是全部塞进一句话。弱点三:静态图假设。真实交互随时间演化(先拿起再放下、先追再超越),固定拓扑无法表达时变交互。改进方向:时间戳边或边调度表,让图本身携带时序结构。弱点四:评估偏重建指标,建议补充交互执行成功率、实体绑定准确率等任务级指标并扩大人评规模。弱点五:多物体性能崩塌(FID 49.45)说明填充 token 和全局自注意力在密集场景下绑定不稳,可探索实例级交叉注意力或边到区域注意力掩码。
未来方向
作者方向:结论把交互图定位为可扩展的控制接口范式,附录 C 的 DAVIS 子集和附录 D 的人偏好研究都可扩展为更大规模评测。基于其成果可延伸的方向:其一,时空场景图(4D 图),给边加起止时刻与演化关系,支持长视频中交互的出现与消失,直接回应静态拓扑的局限;其二,与可微物理仿真结合,把边作为仿真约束,生成的运动在接触、摩擦、动量上更一致,也可反过来用仿真数据扩充训练;其三,具身智能与世界模型方向——交互图天然衔接动作规划,用图条件视频生成做机器人操作的预训练世界模型是很自然的延伸;其四,「指令到图再到视频」两级分解:让 LLM 把自然语言指令解析成图编辑操作,实现纯文本驱动的精确多物体控制,把 GraphVid 变成可编程接口;其五,随主干规模扩展——Wan 2.2 迁移实验显示图条件在更大主干上几乎无损,值得在更大 DiT 和更长序列上验证增益曲线;其六,构建带真实交互标注的公开评测基准,替代自建训练/评测耦合的设定。
复现评估
复现评估:论文有项目主页(PLAN Lab,plan-lab.github.io/graphvid),但正文未明确承诺代码与权重开源。有利条件是所有组件均可开源获得:LTX-Video 2B 与 Wan 2.2 主干公开、Qwen3-VL 与 Qwen3-Embedding 开源、数据集构建流程写在附录 A,训练只涉及 0.6B 参数(GNN + 适配器 + rank 128 LoRA),单机 4 到 8 张 A100 级别即可在 27K 片段上完成训练,算力门槛中等。不确定性与难点:其一,交互图标注高度依赖 MLLM 的提示工程,附录 A 的细节若不够具体,重建的数据分布会有偏差;其二,MoveBench 交互中心子集与多物体子集的划分规则未完整公开,指标可能对不上;其三,自建训练集与自选评测子集存在分布耦合,独立复现时应警惕;其四,论文未说明推理 200 秒的硬件配置,批量评测耗时需自行估算。综合判断:组件全部可得、参数量小,属于中等偏上难度,主要风险在数据管线的忠实重建。
论文图表
Teaser 图,展示两个完整案例。上例:从输入帧构建场景图(手机、支付终端、购物袋、两个人等实体及 look/touch/lean 等关系边),用户编辑图并给出自然语言提示(低头看手机笑、倾身、看向对方手机并微笑、把手机移向支付终端轻触),最终生成符合交互的视频。下例:舞者拉扯纱裙使其外扩上扬的交互编辑与生成。
一图看懂论文要解决的问题和使用方式:用户不画轨迹,而是在自动构建的交互图上直接改边,这是全文最核心的产品形态与控制范式。