语义解耦VAE取代浅层对齐,ImageNet 256×256 FID达1.21
John Page, Xuesong Niu, Kai Wu, Kun Gai
2026-01-13
ImageNet
VAE
图像生成
扩散模型
表征学习
多尺度推测解码加速自回归图像生成,实现5倍提速且质量不降
Elia Peruzzo, Guillaume Sautière, Amirhossein Habibian
2026-01-09
加速推理
图像生成
多尺度
推测解码
自回归模型
提出细粒度属性解耦的CPO方法,将扩散模型从粗粒度二元偏好对齐提升到多维、离散、非均衡的专家评价标准
Chenye Meng, Zejian Li, Zhongni Liu, Yize Li, Changle Xie, Kaixin Jia, Ling...
2026-01-09
DPO
偏好对齐
图像生成
多目标优化
强化学习对齐
通过合并低熵去噪步骤为高熵SDE步骤,提升流模型GRPO训练效率
Shengjun Zhang, Zhang Zhang, Chensheng Dai, Yueqi Duan
2026-01-08
GRPO
人类偏好对齐
图像生成
强化学习
扩散模型
在 1D 视觉 tokenizer 中引入层次残差设计,显著提升 AR 图像生成效率和质量
Xu Zhang, Cheng Da, Huan Yang, Kun Gai, Ming Lu, Zhan Ma
2026-01-08
图像生成
层次表示
残差学习
自回归生成
视觉tokenizer
通过解耦的Thinker-Generator架构和两阶段强化学习,显著提升图像生成的推理能力
Sashuai Zhou, Qiang Zhou, Jijin Hu, Hanqing Yang, Yue Cao, Junpeng Ma,...
2026-01-07
图像生成
强化学习
推理增强
模块化架构
视觉语言模型
统一自回归Transformer通过next-scale预测实现高效多模态理解与生成
Huichao Zhang, Liao Qu, Yiheng Liu, Hang Chen, Yangyang Song, Yongsheng...
2026-01-06
Next-Scale预测
图像生成
多模态学习
统一建模
自回归生成