提出预测式视频VAE,丢弃未来帧使潜空间捕获运动先验,提升34.42 FVD并加速收敛52%
Yian Zhao, Feng Wang, Qiushan Guo, Chang Liu, Xiangyang Ji, Jian Zhang, Jie Chen
2026-05-06
变分自编码器
扩散模型
潜空间设计
视频生成
预测学习
首个统一评估交互式世界模型的基准,提出动作生成框架,跨4.9K任务对14个模型做九维评测。
Jianjie Fang, Yingshan Lei, Qin Wan, Ziyou Wang, Yuchao Huang, Yongyan Xu,...
2026-05-06
交互式世界模型
具身智能
动作生成框架
基准评测
相机控制
基于视频扩散先验的统一框架,单模型支持15种像素对齐任务的文本/视频间多模态生成。
Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing...
2026-05-04
LoRA
SIGGRAPH
多模态学习
扩散模型
本征分解
用第三人称视频生成作为中间表征,把任务指令转化为可执行的人形机器人行为,无需任务专属数据采集。
Yanghao Zhou, Jingyu Ma, Yibo Peng, Zhenguo Sun, Yu Bai, Börje F. Karlsson
2026-05-01
世界模型
人形机器人控制
具身智能
视频生成
零样本泛化
用物理属性图+VLM反馈把可控物理合成注入视频扩散模型
Sriram Narayanan, Ziyu Jiang, Srinivasa Narasimhan, Manmohan Chandraker
2026-05-01
ControlNet
VLM奖励
扩散模型
物理一致性
视频生成
用多智能体+多臂老虎机把抽象创意转化为连贯广告视频
Yale Song, Yiwen Song, Nick Losier, Nathan Hodson, Ye Jin, Rhyard Zhu, Yan...
2026-04-29
创意优化
多智能体
多臂老虎机
广告生成
视频生成
四阶段流水线(SFT+GRPO+提示增强+自回归蒸馏)弥合视频扩散模型预训练与部署差距。
Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li,...
2026-04-29
GRPO
RLHF
后训练
扩散模型
自回归蒸馏
DeFI:将视频预测与动作推理解耦预训练,再端到端融合实现高效通用机器人策略。
Wenyao Zhang, Bozhou Zhang, Zekun Qi, Wenjun Zeng, Xin Jin, Li Zhang
2026-04-28
世界模型
机器人学习
模仿学习
视觉-语言-动作模型
视频生成
用语义进度函数量化并线性化视频中的语义变化节奏
Gal Metzer, Sagi Polaczek, Ali Mahdavi-Amiri, Raja Giryes, Daniel Cohen-Or
2026-04-27
RoPE位置编码
扩散模型
视频生成
视频编辑
语义分析
为交互式视频世界模型提供标准化场景、统一动作接口与多维评估工具
Xiaojie Xu, Zhengyuan Lin, Kang He, Yukang Feng, Xiaofeng Mao, Yuanyang Yin,...
2026-04-24
世界模型
交互式生成
图像到视频
基准测试
视频生成
把时间做成可学习概念,教会模型感知并按指定播放速度生成视频
Yen-Siang Wu, Rundong Luo, Jingsen Zhu, Tao Tu, Ali Farhadi, Matthew...
2026-04-24
慢动作数据集
扩散模型
时间建模
自监督学习
视频理解
双流协同+人类感知MoE在DiT中嵌入交互几何先验,零推理开销实现HOI视频生成
Xiangyang Luo, Xiaozhe Xin, Tao Feng, Xu Guo, Meiguang Jin, Junfeng Ma
2026-04-22
人-物交互
扩散Transformer
数字人
混合专家
视频生成
用图像质量路由实现视频扩散的推测解码,1.59×加速保98%质量
Yuezhou Hu, Jintao Zhang
2026-04-22
奖励路由
推测解码
推理加速
自回归扩散
视频生成
ByteDance Seed 团队发布的多模态音视频联合生成模型,在 T2V/I2V/R2V 三大任务六维评测中全面领先 Sora 2 Pro、Veo 3.1、Kling 3.0。
Team Seedance, De Chen, Liyang Chen, Xin Chen, Ying Chen, Zhuo Chen, Zhuowei...
2026-04-16
可控生成
图生视频
多模态生成
扩散模型
文生视频
单图生成长时3D一致视频并重建可交互3D场景
Tianchang Shen, Sherwin Bahmani, Kai He, Sangeetha Grama Srinivasan, Tianshi...
2026-04-15
3D Gaussian Splatting
三维重建
扩散模型
视频生成
长时一致性
HBQ近无损离散token+可擦除全局细化AR,2B刷新多任务SOTA
Jian Han, Jinlai Liu, Jiahuan Wang, Bingyue Peng, Zehuan Yuan
2026-04-15
二值量化
图像生成
图像视频统一
离散Tokenizer
自回归生成
首个同时融合文本/参考图/音频/姿态四模态的HOIVG统一生成框架。
Donghao Zhou, Guisheng Liu, Hao Yang, Jiatong Li, Jingyu Lin, Xiaohu Huang,...
2026-04-14
Flow Matching
人-物交互
多模态融合
扩散Transformer
视频生成
反向扩展视频生成器为基座,用统一流匹配统一视频生成与理解
Luozheng Qin, Jia Gong, Qian Qiao, Tianjiao Li, Li Xu, Haoyu Pan, Chao Qu,...
2026-04-14
Flow Matching
MoE 架构
多模态统一模型
扩散模型
视频生成
提出推理时插拔式方法,通过交叉注意力路由实现多事件视频的精确时间控制,无需训练或架构修改
Gordon Chen, Ziqi Huang, Ziwei Liu
2026-04-14
多事件合成
扩散模型
时间控制
注意力机制
视频生成
循环Transformer+环内自蒸馏,单次训练实现任意时间推理,参数减少4倍。
Sahil Goyal, Swayam Agrawal, Gautham Govind Anil, Prateek Jain, Sujoy Paul,...
2026-04-13
参数高效
图像生成
循环Transformer
扩散模型
视频生成