把多任务扩散RL的训练冲突与灾难遗忘统一在在线策略蒸馏框架下。
Quanhao Li, Junqiu Yu, Kaixun Jiang, Yujie Wei, Zhen Xing, Pandeng Li,...
2026-05-15
LoRA微调
在线策略蒸馏
多任务强化学习
扩散模型
文本到图像
用流匹配矫正不可靠文本先验,用不确定性建模细化笔画,单步扩散实现毫秒级文本超分
Zihang Xu, Xiaoyang Liu, Zheng Chen, Yulun Zhang, Xiaokang Yang
2026-05-15
不确定性学习
图像超分辨率
扩散模型
文本图像修复
流匹配
通过分头混合压缩 KV 缓存,为自回归视频扩散提速 1.5–2.8 倍
Yicheng Ji, Zhizhou Zhong, Jun Zhang, Qin Yang, XiTai Jin, Ying Qin, Wenhan...
2026-05-15
KV缓存压缩
扩散模型
推理加速
注意力机制
视频生成
用纯合成数据训练图层分解模型,验证其可行性、规模效应与分布平衡性
Kam Man Wu, Haolin Yang, Qingyu Chen, Yihu Tang, Jingye Chen, Qifeng Chen
2026-05-15
VLM
合成数据
图层分解
图形设计
扩散模型
潜码投到定半径超球面并改用 slerp 路径,ImageNet FID 大幅提升且无需改动扩散架构
Tuna Han Salih Meral, Kaan Oktay, Hidir Yesiltepe, Adil Kaan Akan, Pinar Yanardag
2026-05-15
ImageNet-256
VAE潜码
图像生成
扩散模型
流匹配
提出WAIM范式与DAWN模型,让世界预测与轨迹生成在隐空间中递归互炼。
Hongbo Lu, Liang Yao, Chenghao He, Haoyu Wang, Xiang Gu, Xianfei Li, Wenlong...
2026-05-14
世界模型
扩散模型
潜在空间推理
端到端规划
自动驾驶
非对称参数化流速度(数据全维、噪声低秩),实现像素空间 DiT 训练及潜空间→像素微调
Hansheng Chen, Jan Ackermann, Minseo Kim, Gordon Wetzstein, Leonidas Guibas
2026-05-14
DiT
像素空间生成
扩散模型
流匹配
潜在空间微调
L2P 丢弃 VAE、冻结 LDM 中间层,仅用 8 卡把潜在扩散先验高效迁移到像素空间。
Zhennan Chen, Junwei Zhu, Xu Chen, Jiangning Zhang, Jiawei Chen, Zhuoqi...
2026-05-13
像素空间生成
扩散模型
文生图
知识迁移
超高分辨率
DRoRAE融合ViT所有层级特征,大幅提升视觉分词器重建与生成质量
Xuanyu Zhu, Yan Bai, Yang Shi, Yihang Lou, Yuanxing Zhang, Jing Jin, Yuan Zhou
2026-05-13
DINOv2
多层级融合
扩散模型
表征自编码器
视觉分词器
首个真实户外单视图重光照基准+物理引导自适应框架
Lezhong Wang, Mehmet Onurcan Kaya, Siavash Bigdeli, Jeppe Revall Frisvad
2026-05-13
单图重光照
扩散模型
数据集
测试时自适应
逆渲染
统一框架下的高质量图像生成与精确图像编辑模型,支持长文本渲染、多语言排版和高分辨率照片级生成
Bing Zhao, Chenfei Wu, Deqing Li, Hao Meng, Jiahao Li, Jie Zhang, Jingren...
2026-05-12
MMDiT
VAE
图像生成
图像编辑
多模态学习
把图像特征直接反投影回三维体素空间,让生成与输入像素严格一一对应,从根本上解决 image-to-3D 的保真度瓶颈。
Dong-Yang Li, Wang Zhao, Yuxin Chen, Wenbo Hu, Meng-Hao Guo, Fang-Lue Zhang,...
2026-05-12
3D生成
三维重建
像素对齐
反投影条件
图像到三维
首个面向电影级多镜头叙事与S2V生成的大规模数据集,配套视觉逻辑驱动的双轨评估基准与反复制粘贴新指标
Haojie Zhang, Di Wu, Bingyan Liu, Linjie Zhong, Yuancheng Wei, Xingsong Ye,...
2026-05-12
VLM标注
主体到视频生成
多镜头视频生成
扩散模型
数据集构建
提出 MV-Split 残差,把均值与中心化信号分开增益,稳住千层 DiT 训练。
Pengqi Lu
2026-05-11
Transformer 训练稳定性
扩散模型
残差结构
深度学习理论
级联运动/外观专家+BiMamba-Transformer,3D中间表示刷新音乐驱动舞蹈视频SOTA
Kaixing Yang, Jiashu Zhu, Xulong Tang, Ziqiao Peng, Xiangyue Zhang, Puwei...
2026-05-11
Mamba
姿态驱动动画
扩散模型
舞蹈生成
视频生成
用归一化流精确建模扩散反向条件,实现4步生成且保留似然
Jiatao Gu, Tianrong Chen, Ying Shen, David Berthelot, Shuangfei Zhai, Josh Susskind
2026-05-11
少步生成
归一化流
扩散模型
文本到图像
生成模型
用智能体闭环+多模态记忆+分层自改进,把分钟级长视频一致性提升30%、叙事连贯性提升20%。
Do Xuan Long, Yale Song, Min-Yen Kan, Tomas Pfister, Long T. Le
2026-05-11
多模态记忆
扩散模型
智能体系统
测试时自改进
视频生成
梯度空间均衡多奖励,单模型同时提升扩散RL所有质量维度
Canyu Zhao, Hao Chen, Yunze Tong, Yu Qiao, Jiacheng Li, Chunhua Shen
2026-05-08
图像生成
多奖励优化
强化学习
扩散模型
梯度调和
首次把DMD蒸馏从离散时间锚点迁移到连续时间域,无需GAN或奖励模型即可在4步文生图中取得SOTA。
Tao Liu, Hao Yan, Mengting Chen, Taihang Hu, Zhengrong Yue, Zihao Pan,...
2026-05-08
分布匹配
少步生成
扩散模型
文生图
模型蒸馏
提出解耦生成管线Sparkle,合成14万段高质量视频背景替换数据并发布最大评测基准。
Ziyun Zeng, Yiqi Lin, Guoqiang Liang, Mike Zheng Shou
2026-05-08
扩散模型
指令引导生成
数据集构建
背景替换
视频编辑