首个面向自回归视频扩散模型的量化框架,用帧敏感度加权与自适应双尺度量化加速推理。
Siao Tang, Xinyin Ma, Gongfan Fang, Xingyi Yang, Xinchao Wang
2026-05-22
PTQ
异常值检测
推理加速
模型量化
自回归扩散模型
用MLLM在自身ViT嵌入空间做语义规划,解耦理解与扩散渲染,统一视频生成与编辑。
Bernini Team, Chenchen Liu, Junyi Chen, Lei Li, Lu Chi, Mingzhen Sun,...
2026-05-22
多模态大模型
扩散模型
统一框架
视频生成
视频编辑
多智能体辩论+3D首帧接地,从一句话生成完整可播短剧。
Yufei Shi, Weilong Yan, Naixuan Huang, Yucheng Chen, Chenyu Zhang, Tao He,...
2026-05-22
3D场景接地
叙事建模
多智能体系统
检索增强生成
短剧生成
首个多镜头音视频生成基准,含自适应混合评估框架与人类判断一致性达91.5%。
Yujie Wei, Yujin Han, Zhekai Chen, Yongming Li, Kaixun Jiang, Zhihang Liu,...
2026-05-20
基准测试
多模态生成
大模型
视频生成
评估方法
VideoRLVR框架用可验证奖励优化视频模型,提升规则验证任务的推理能力
Tinghui Zhu, Sheng Zhang, James Y. Huang, Selena Song, Xiaofei Wen, Yuankai...
2026-05-20
Flow-Matching
强化学习
扩散模型
视觉推理
视频生成
KVPO:面向流式自回归视频生成,在ODE原生范式下做KV语义探索的偏好对齐
Ruicheng Zhang, Kaixi Cong, Jun Zhou, Zhizhou Zhong, Zunnan Xu, Shuiyang...
2026-05-19
GRPO
偏好对齐
强化学习
流匹配
自回归模型
实时交互式人体服装视频定制,23.8 FPS 单卡推理
Quanjian Song, Yefeng Shen, Mengting Chen, Hao Sun, Jinsong Lan, Xiaoyong...
2026-05-18
实时推理
扩散模型
服装定制
自回归生成
视频生成
单步训练视频扩散GRPO,6倍加速且匹配全轨迹性能。
Xiaoxuan He, Siming Fu, Zeyue Xue, Weijie Wang, Ruizhe He, Yuming Li,...
2026-05-18
GRPO强化学习
RLHF
Wan2.1
扩散模型
流匹配
2.6B参数高效分钟级720p相机控制世界模型,单卡可部署
Haoyi Zhu, Haozhe Liu, Yuyang Zhao, Tian Ye, Junsong Chen, Jincheng Yu, Tong...
2026-05-15
世界模型
扩散模型
相机控制
线性注意力
视频生成
把相机诱导的 warp 塞进视频模型的原生历史通路,零样本激活相机跟随行为。
Yifan Wang, Tong He
2026-05-15
LoRA 微调
历史条件化
扩散模型
相机控制
视频生成
RAVEN 通过重打包自展开轨迹并结合一致性模型策略优化,实现高质量实时自回归视频生成。
Yanzuo Lu, Ronglai Zuo, Jiankang Deng
2026-05-15
一致性模型
实时生成
强化学习
扩散模型蒸馏
自回归生成
通过分头混合压缩 KV 缓存,为自回归视频扩散提速 1.5–2.8 倍
Yicheng Ji, Zhizhou Zhong, Jun Zhang, Qin Yang, XiTai Jin, Ying Qin, Wenhan...
2026-05-15
KV缓存压缩
扩散模型
推理加速
注意力机制
视频生成
实时因果多镜头视频生成,支持动态提示与长程一致性
Yihao Meng, Zichen Liu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Yue Yu,...
2026-05-13
KV缓存
多镜头叙事
实时交互
自回归
视频生成
系统梳理世界模型在机器人策略学习、模拟器、视频生成与导航驾驶中的架构范式、功能角色与评测体系。
Bohan Hou, Gen Li, Jindou Jia, Tuo An, Xinying Guo, Sicong Leng, Haoran...
2026-05-13
世界模型
具身智能
机器人学习
策略学习
视觉-语言-动作模型
把视频生成评测重定义为世界状态预测,提供436个结构化推理用例与6K专家偏好对的诊断式基准。
Keming Wu, Yijing Cui, Wenhan Xue, Qijie Wang, Xuan Luo, Zhiyuan Feng, Zuhao...
2026-05-12
VLM评判
世界模型
奖励模型
视频生成
评测基准
级联运动/外观专家+BiMamba-Transformer,3D中间表示刷新音乐驱动舞蹈视频SOTA
Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei...
2026-05-11
Mamba
姿态驱动动画
扩散模型
舞蹈生成
视频生成
用智能体闭环+多模态记忆+分层自改进,把分钟级长视频一致性提升30%、叙事连贯性提升20%。
Do Xuan Long, Yale Song, Min-Yen Kan, Tomas Pfister, Long T. Le
2026-05-11
多模态记忆
扩散模型
智能体系统
测试时自改进
视频生成
把CoT推理与最终打分解耦的视频奖励模型,解决生成式奖励训练不稳定。
Yuan Wang, Ouxiang Li, Yulong Xu, Borui Liao, Jiajun Liang, Jinghan Li, Meng...
2026-05-08
Bradley-Terry
CoT推理
DeScore
GRPO
MLLM
把奖励信号拆解到 rollout 与像素级,对 DMD 蒸馏做时空局部化加权。
Bin Wu, Mengqi Huang, Shaojin Wu, Weinan Jia, Yuxin Wang, Zhendong Mao,...
2026-05-07
奖励建模
扩散模型
流式生成
知识蒸馏
视频生成
首次把测试时 scaling 引入流式视频生成,三机制协同提升长视频时空一致性。
Yijing Tu, Shaojin Wu, Mengqi Huang, Wenchuan Wang, Yuxin Wang, Chunxiao...
2026-05-07
KV 缓存管理
扩散模型
流式生成
测试时 scaling
视频生成