HBQ近无损离散token+可擦除全局细化AR,2B刷新多任务SOTA
Jian Han, Jinlai Liu, Jiahuan Wang, Bingyue Peng, Zehuan Yuan
2026-04-15
二值量化
图像生成
图像视频统一
离散Tokenizer
自回归生成
在导数空间用对抗目标训练连续流模型,仅10个epoch后训练即大幅降低FID
Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan
2026-04-14
后训练
图像生成
对抗训练
扩散模型
概率流ODE
基于 Focus-and-Refine 的区域化图像精修,在用户指定区域内恢复细节且严守背景不变。
Dewei Zhou, You Li, Zongxin Yang, Yi Yang
2026-04-13
LoRA
图像生成
图像编辑
多模态
局部精修
循环Transformer+环内自蒸馏,单次训练实现任意时间推理,参数减少4倍。
Sahil Goyal, Swayam Agrawal, Gautham Govind Anil, Prateek Jain, Sujoy Paul,...
2026-04-13
参数高效
图像生成
循环Transformer
扩散模型
视频生成
用条件与无条件高斯的线性混合源分布,拉直生成轨迹并显著提升 Rectified Flow 采样效率。
Nazir Nayal, Christopher Wewer, Jan Eric Lenssen
2026-04-13
Flow Matching
ODE 求解
Rectified Flow
图像生成
扩散模型加速
把生成拆为四阶段交错推理轨迹,过程监督提升组合保真度与可解释性。
Lei Zhang, Junjiao Tian, Zhipeng Fan, Kunpeng Li, Jialiang Wang, Weifeng...
2026-04-09
BAGEL
GenEval
WISE
交错推理
图像生成
首次从 token 空间视角解决深度压缩自编码器的表征坍缩问题
Teng Li, Ziyuan Huang, Cong Chen, Yangfu Li, Yuanhuiyi Lyu, Dandan Zheng,...
2026-04-09
Vision Transformer
图像生成
扩散模型
自监督学习
视觉 tokenizer
首次提出端到端统一多模态智能体框架,通过Think-Research-Recaption-Generate四阶段流水线实现真实世界的知识密集型图像生成
Shuang Chen, Quanxin Shou, Hangting Chen, Yucheng Zhou, Kaituo Feng, Wenbo...
2026-04-01
世界知识
图像生成
多模态智能体
文本到图像
知识检索增强
无需训练的单图像到城镇规模3D场景生成方法,通过扩展潜在空间和重叠块式流实现高保真度。
Seungwoo Yoon, Jinmo Kim, Jaesik Park
2026-04-01
3D生成
图像生成
场景重建
扩散模型
训练-free方法
首个基于扩散模型的文本到raw图像生成框架,支持任意目标相机
Dongyoung Kim, Junyong Lee, Abhijith Punnappurath, Mahmoud Afifi, Sangmin...
2026-04-01
ISP处理
低层视觉
图像生成
扩散模型
计算机视觉
首个商业视觉生成系统化基准
Yan Li, Zezi Zeng, Ziwei Zhou, Xin Gao, Muzhao Tian, Yifan Yang, Mingxi...
2026-04-01
商业设计
图像生成
基准测试
多模态评估
布局控制
首个用强化学习训练多跳搜索智能体,为知识密集型图像生成收集外部知识与视觉参考
Kaituo Feng, Manyuan Zhang, Shuang Chen, Yunlong Lin, Kaixuan Fan, Yilei...
2026-03-31
GRPO
图像生成
多模态搜索
智能体强化学习
检索增强生成
提出统一的图像生成/编辑评估基准,覆盖6任务6主题,用可解释标注揭示模型失败模式
Samin Mahdizadeh Sani, Max Ku, Nima Jamali, Matina Mahdizadeh Sani, Paria...
2026-03-31
VLM评估
人类评估
图像生成
图像编辑
评估基准
0.39B参数统一扩散模型,在手机端实现<1秒图文生成与编辑
Kailai Feng, Yuxiang Wei, Bo Chen, Yang Pan, Hu Ye, Songwei Liu, Chenqian...
2026-03-31
图像生成
图像编辑
扩散模型
模型压缩
移动端部署
仅调约102个缩放参数,用进化策略校准 DiT 各模块权重,即可显著提升生成质量并加速推理
Danil Tokhchukov, Aysel Mirzoeva, Andrey Kuznetsov, Konstantin Sobolev
2026-03-27
参数高效微调
图像生成
扩散模型
无梯度优化
模型对齐
用多智能体框架从2D模型提取隐式3D知识生成连贯3D场景
Ziya Erkoç, Angela Dai, Matthias Nießner
2026-03-23
3D场景生成
3D高斯溅射
VLM
图像生成
多智能体系统
提出D-MMD方法将离散扩散模型蒸馏为少步生成器,在文本和图像上超越教师
Emiel Hoogeboom, David Ruhe, Jonathan Heek, Thomas Mensink, Tim Salimans
2026-03-23
图像生成
扩散模型
文本生成
模型蒸馏
离散生成
首次在768维高维表示token上实现离散扩散生成,达到离散生成SOTA
Yuqing Wang, Chuofan Ma, Zhijie Lin, Yao Teng, Lijun Yu, Shuai Wang, Jiaming...
2026-03-20
MaskGIT
图像生成
离散扩散
视觉生成
高维表示
通过引入语义航点解耦噪声到像素的生成路径,解决像素空间 Flow Matching 的轨迹冲突问题
Hainuo Wang, Mingjia Li, Xiaojie Guo
2026-03-18
Diffusion Transformer
Flow Matching
像素空间生成
图像生成
表示对齐
提出IOMM框架,通过纯图像预训练和混合数据微调,实现高效统一多模态模型训练
Peng Sun, Jun Xie, Tao Lin
2026-03-18
图像生成
扩散模型
掩码图像建模
数据高效训练
统一多模态模型