四阶段流水线(SFT+GRPO+提示增强+自回归蒸馏)弥合视频扩散模型预训练与部署差距。
Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li,...
2026-04-29
GRPO
RLHF
后训练
扩散模型
自回归蒸馏
IAM 框架:联合生成身份相符的人体动作与 SMPL 体型参数
Wenqi Jia, Zekun Li, Abhay Mittal, Chengcheng Tang, Chuan Guo, Lezi Wang,...
2026-04-29
SMPL 体型建模
多模态条件
扩散模型
文本驱动动作合成
身份感知动作生成
用语义进度函数量化并线性化视频中的语义变化节奏
Gal Metzer, Sagi Polaczek, Ali Mahdavi-Amiri, Raja Giryes, Daniel Cohen-Or
2026-04-27
RoPE位置编码
扩散模型
视频生成
视频编辑
语义分析
用扩散先验增强神经表示,高效完成稀疏视角CT重建
Shiyan Su, Ruyi Zha, Danli Shi, Hongdong Li, Xuelian Cheng
2026-04-27
CT重建
扩散模型
神经表示
稀疏视角
逆向问题
针对反演无关视频编辑中编辑信号的不稳定问题,提出训练免费的 SAR 与 AMM 双锚定机制。
Ze Chen, Lan Chen, Yuanhang Li, Qi Mao
2026-04-27
Rectified Flow
扩散模型
无训练方法
注意力机制
视频编辑
把时间做成可学习概念,教会模型感知并按指定播放速度生成视频
Yen-Siang Wu, Rundong Luo, Jingsen Zhu, Tao Tu, Ali Farhadi, Matthew...
2026-04-24
慢动作数据集
扩散模型
时间建模
自监督学习
视频理解
用 4D 点云做视频重拍,稳健控制新相机轨迹并保持场景动态
Kuan Heng Lin, Zhizheng Liu, Pablo Salamanca, Yash Kant, Ryan Burgert,...
2026-04-24
4D 点云
扩散模型
新视角合成
相机控制
视频重拍
无需微调,借分块反演与NDCFG++让扩散模型实现4K高分辨率文本引导编辑
Kunho Kim, Sumin Seo, Yongjun Cho, Hyungjin Chung
2026-04-24
分类器自由引导
图像编辑
扩散模型
无调参方法
高分辨率生成
CoReDi:让语义投影与扩散模型联合训练,稳定共演化提升生成质量。
Theodoros Kouzelis, Spyros Gidaris, Nikos Komodakis
2026-04-24
ImageNet
图像生成
扩散模型
流匹配
特征坍塌
在同一架构中联合训练图像生成与伪造检测,让两者互为老师、学生并协同进化。
Yanran Zhang, Wenzhao Zheng, Yifei Li, Bingyao Yu, Yu Zheng, Lei Chen, Jiwen...
2026-04-24
AI生成图像检测
协同训练
多模态大模型
扩散模型
生成-判别统一
用可学习query token对齐MLLM与扩散模型的低成本统一多模态生成框架
Zijie Li, Yichun Shi, Jingxiang Sun, Ye Wang, Yixuan Huang, Zhiyao Guo,...
2026-04-23
图像编辑
多模态生成
扩散模型
表征对齐
视觉语言模型
图像优先解耦外观与时序,用FLUX图像先验+Wan免训练精修实现姿态与视角可控的人体视频生成。
Zhengwentai Sun, Keru Zheng, Chenghong Li, Hongjie Liao, Xihe Yang, Heyuan...
2026-04-23
LoRA微调
SMPL-X
人体视频生成
免训练时序精修
图像优先
阿里拍立淘团队提出工业级虚拟试穿系统,统一 MMDiT 架构支持多参考图多品类,3.92s 出图、整体质量超越 GPT-Image-2、Seedream 等闭源模型。
Mengting Chen, Zhengrui Chen, Yongchao Du, Zuan Gao, Taihang Hu, Jinsong...
2026-04-22
MMDiT
多图编辑
工业部署
扩散模型
电商生成式AI
统一推理与生成的自动摄影图像编辑框架
Ying Zeng, Miaosen Luo, Guangyuan Li, Yang Yang, Ruiyang Fan, Linxiao Shi,...
2026-04-22
图像增强
图像编辑
多模态大模型
强化学习
扩散模型
Mesh Head 桥接 BAGEL 与 Hunyuan3D,实现零样本文本驱动 3D 生成与编辑。
Peng Huang, Yifeng Chen, Zeyu Zhang, Hao Tang
2026-04-22
3D理解
3D网格生成
Chain-of-Mesh
Self-Reflection
扩散模型
用VLM奖励+Flow-GRPO后训练,让图像编辑更贴合人类审美。
Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang,...
2026-04-22
GRPO
RLHF
人类偏好对齐
图像编辑
奖励模型
首次将GRPO引入均匀离散扩散,通过将最终干净样本作为动作并用前向过程重构轨迹,解决训练崩溃。
Jiaqi Wang, Haoge Deng, Ting Pan, Yang Liu, Chengyuan Wang, Fan Zhang,...
2026-04-22
GRPO
RLHF
强化学习
扩散模型
文本到图像
面向多智能体多视角的可扩展视频世界建模框架
Haoyu Wu, Jiwen Yu, Yingtian Zou, Xihui Liu
2026-04-21
具身智能
多智能体
多视角一致性
扩散模型
视频世界模型
指出 DPM 反向去噪样本的 SNR 始终低于前向样本,提出免训练的小波域差分校正方法 DCW。
Meng Yu, Lei Sun, Jianhao Zeng, Xiangxiang Chu, Kun Zhan
2026-04-20
免训练方法
小波域校正
扩散模型
生成式建模
采样偏差修正
基于5000+众包鼠标追踪数据,7支队伍用大模型视频主干角逐视频显著性预测SOTA。
Andrey Moskalenko, Alexey Bryncev, Ivan Kosmynin, Kira Shilovskaya, Mikhail...
2026-04-20
InternVideo2
NTIRE挑战赛
V-JEPA2
多模态融合
扩散模型