联合训练扩散先验和解码器学习潜变量表示,实现高效生成
Jonathan Heek, Emiel Hoogeboom, Thomas Mensink, Tim Salimans
2026-02-20
变分自编码器
图像生成
扩散模型
潜变量学习
生成模型效率
通过动态调整去噪步骤中的patch大小,在保持生成质量的同时实现3.5倍加速
Dahye Kim, Deepti Ghadiyaram, Raghudeep Gadde
2026-02-20
动态计算
扩散模型
效率优化
文本到图像
文本到视频
可学习路由+QAT优化稀疏线性注意力,97%稀疏下18.6倍加速
Jintao Zhang, Haoxu Wang, Kai Jiang, Kaiwen Zheng, Youhe Jiang, Ion Stoica,...
2026-02-19
扩散模型
模型加速
注意力机制
稀疏注意力
视频生成
提出Nexus适配器,通过跨注意力融合文本与结构,实现高效条件生成
Aryan Das, Koushik Biswas, Swalpa Kumar Roy, Badri Narayana Patro, Vinay Kumar Verma
2026-02-19
图像生成
扩散模型
条件生成
跨注意力
适配器
用二值扩散头替换 softmax,大幅扩展词表并行生成
Yuang Ai, Jiaming Han, Shaobin Zhuang, Weijia Mao, Xuefeng Hu, Ziyan Yang,...
2026-02-17
二值量化
并行生成
扩散模型
文本生图
自回归生成
小红书团队通过系统优化数据工程与训练方法,实现开源SOTA指令图像编辑
Super Intelligence Team, Changhao Qiao, Chao Hui, Chen Li, Cunzheng Wang,...
2026-02-17
Diffusion Transformer
图像编辑
强化学习
扩散模型
指令跟随
通过分离局部编码器与全局嵌入器,实现计算量与编辑区域成正比的高效视频编辑框架
Yehonathan Litman, Shikun Liu, Dario Seyb, Nicholas Milef, Yang Zhou, Carl...
2026-02-17
交互式编辑
扩散模型
视频修复
视频编辑
计算效率
整合600万+轨迹构建统一流形学习VLA模型,实现跨具身通用机器人操作
Yandan Yang, Shuang Zeng, Tong Lin, Xinyuan Chang, Dekang Qi, Junjin Xiao,...
2026-02-16
VLA基础模型
具身智能
扩散模型
数据工程
机器人操作
提出UniDFlow统一框架,用离散流匹配同时实现图像理解、生成和编辑
Onkar Susladkar, Tushar Prakash, Gayatri Deshmukh, Kiet A. Nguyen, Jiaxun...
2026-02-16
偏好对齐
图像生成
图像编辑
多模态
扩散模型
无需训练框架,在极端视角变化下实现4D视频重光照
Zhenghuang Wu, Kang Chen, Zeyu Zhang, Hao Tang
2026-02-16
4D视频生成
扩散模型
流匹配
计算机视觉
重光照
发现音频扩散模型存在语义瓶颈层,局部激活转向实现最优音乐概念控制
Łukasz Staniszewski, Katarzyna Zaleska, Mateusz Modrzejewski, Kamil Deja
2026-02-16
可解释性
扩散模型
激活转向
音乐控制
音频生成
通过联合优化矢量笔画,在绘制过程中实现语义幻觉
Huai-Hsun Cheng, Siang-Ling Zhang, Yu-Lun Liu
2026-02-13
SIGGRAPH
扩散模型
矢量图形生成
草图生成
视觉错觉
提出视频扩散模型PISCO,用稀疏关键帧控制实现精确的视频物体插入
Xiangbo Gao, Renjie Li, Xinghao Chen, Yuheng Wu, Suofei Feng, Qing Yin, Zhengzhong Tu
2026-02-13
实例插入
扩散模型
稀疏控制
视频生成
视频编辑
基于扩散模型的多音轨同步生成框架,推理速度提升25-50%
Shih-Lun Wu, Ge Zhu, Juan-Pablo Caceres, Cheng-Zhi Anna Huang, Nicholas J. Bryan
2026-02-13
Flow Matching
多音轨
扩散模型
音乐生成
音频分离
用户通过绘制2D骨骼线稿和输入文本提示,即可生成可动画化的3D骨骼绑定模型
Ruisi Zhao, Haoren Zheng, Zongxin Yang, Hehe Fan, Yi Yang
2026-02-12
3D生成
图神经网络
扩散模型
条件生成
骨骼绑定
用最优传输理论修正自回归扩散模型中的条件误差,在ImageNet上达到SOTA
Yucheng Zhou, Hao Li, Jianbing Shen
2026-02-11
图像生成
扩散模型
最优传输
条件生成
自回归生成
统一VLA框架交错语言规划、视觉预测与动作生成
Yucheng Hu, Jianke Zhang, Yuanfei Luo, Yanjiang Guo, Xiaoyu Chen, Xinshu...
2026-02-11
多模态学习
扩散模型
机器人操作
视觉语言动作模型
长时程任务
提出600万高质量图文对数据集,弥合开源与商用文生图模型的数据鸿沟
Xu Ma, Yitian Zhang, Qihua Dong, Yun Fu
2026-02-11
微调
扩散模型
数据集
文生图
自回归模型
将无用的池化文本嵌入变为免费的质量提升器
Nikita Starodubcev, Daniil Pakhomov, Zongze Wu, Ilya Drobyshevskiy, Yuchen...
2026-02-11
ICLR
Transformer
扩散模型
推理优化
文本生成图像
黎曼流匹配+雅可比正则化,解决扩散Transformer在表征空间收敛失败的几何问题
Amandeep Kumar, Vishal M. Patel
2026-02-11
图像生成
扩散模型
流匹配
表征学习
黎曼几何