通过聚类和簇内最优传输,实现更直的流匹配轨迹,提升生成质量
Chiensheng Chiang, Kuan-Hsun Tu, Jia-Wei Liao, Cheng-Fu Chou, Tsung-Wei Ke
2026-03-20
Flow Matching
Optimal Transport
扩散模型
生成模型
提出DPL和RSL协同去噪框架,实现语义驱动的部分级文本到3D生成
Tianjiao Yu, Xinzhuo Li, Muntasir Wahed, Jerry Xiong, Yifan Shen, Ying Shen,...
2026-03-20
扩散模型
文本到3D生成
结构化表示
语义对齐
部分感知生成
融合显式3D与隐式注意力的Patch级混合空间记忆机制
Wei Yu, Runjia Qian, Yumeng Li, Liquan Wang, Songheng Yin, Sri Siddarth...
2026-03-19
3D重建
世界模型
扩散模型
相机控制
空间记忆
首个相机条件约束的立体世界模型,联合学习外观与双目几何,实现端到端立体视频生成
Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi
2026-03-19
世界模型
扩散模型
注意力机制
相机控制
立体视频生成
一个统一的扩散模型框架,支持文本到图层生成、文本到图像生成以及图像到图层分解三种任务
Vlad-Constantin Lungu-Stan, Ionut Mironica, Mariana-Iuliana Georgescu
2026-03-19
分层媒体设计
图像分解
图层生成
扩散模型
文本生成
视频扩散模型的推理沿去噪步骤展开,而非跨帧进行
Ruisi Wang, Zhongang Cai, Fanyi Pu, Junxiang Xu, Wanqi Yin, Maijunxian Wang,...
2026-03-18
DiT
扩散模型
推理机制
无需训练
视频生成
通过运动学控制机器人+4D扩散模型生成环境反应,实现高保真具身仿真
Mutian Xu, Tianbao Zhang, Tianqi Liu, Zhaoxi Chen, Xiaoguang Han, Ziwei Liu
2026-03-18
4D生成
世界模型
具身智能
扩散模型
机器人仿真
提出IOMM框架,通过纯图像预训练和混合数据微调,实现高效统一多模态模型训练
Peng Sun, Jun Xie, Tao Lin
2026-03-18
图像生成
扩散模型
掩码图像建模
数据高效训练
统一多模态模型
通过稀疏关键帧引导,将视频超分辨率从黑盒转变为用户可控的交互式过程
Jiongze Yu, Xiangbo Gao, Pooja Verlani, Akshay Gadde, Yilin Wang, Balu...
2026-03-18
交互式图像处理
关键帧传播
扩散模型
时空一致性
视频超分辨率
系统性研究像素空间扩散模型中视觉协同去噪的四个关键设计,提出有效recipe提升生成质量
Han Lin, Xichen Pan, Zun Wang, Yue Zhang, Chu Wang, Jaemin Cho, Mohit Bansal
2026-03-18
像素空间生成
分类器自由引导
协同去噪
扩散模型
视觉表示对齐
在3D基础模型表示空间直接进行扩散,实现高质量跨视角一致的3D场景生成
Sensen Gao, Zhaoqing Wang, Qihang Cao, Dongdong Yu, Changhu Wang, Tongliang...
2026-03-18
3DGS重建
3D场景生成
扩散模型
表示学习
跨视角一致性
通过二进制编码和索引洗牌优化扩散语言模型,提升零样本推理性能
Chen-Hao Chao, Wei-Fang Sun, Junwei Qua, Chun-Yi Lee, Rahul G. Krishnan
2026-03-18
子词编码
扩散模型
计算最优
语言模型
零样本学习
引入Diffusion DNA和图论规划,将扩散模型从固定调度升级为动态System 2式规划
Ping Chen, Xiang Liu, Xingpeng Zhang, Fei Shen, Xun Gong, Zhaoxiang Liu,...
2026-03-18
System 2推理
图论规划
扩散模型
自适应调度
采样优化
首尔世界模型:用街景图像检索增强,实现真实城市级别的世界模拟视频生成
Junyoung Seo, Hyunwook Choi, Minkyung Kwon, Jinhyeok Choi, Siyoon Jin,...
2026-03-17
世界模型
城市场景模拟
扩散模型
检索增强生成
自动驾驶
仅用2D图像训练,实现视频DiT的多种编辑任务,无需任何视频数据
Ruonan Yu, Zhenxiong Tan, Zigeng Chen, Songhua Liu, Xinchao Wang
2026-03-17
LoRA微调
Transformer
扩散模型
视频编辑
风格迁移
提出LightCtrl框架,通过少量物理先验实现细粒度可控的单图像重光照
Haoze Zheng, Zihao Wang, Xianfeng Wu, Yajing Bai, Yexin Liu, Yun Li,...
2026-03-17
内在分解
单图像编辑
图像重光照
扩散模型
物理先验
统一视频扩散框架,实现场景、多视角主体和运动的解耦控制
Zhenghong Zhou, Xiaohang Zhan, Zhiqin Chen, Soo Ye Kim, Nanxuan Zhao,...
2026-03-17
ControlNet
多视角一致性
扩散模型
视频生成
运动控制
提出区域级偏好优化方法提升多语言复杂字形渲染精度
Xincheng Shuai, Ziye Li, Henghui Ding, Dacheng Tao
2026-03-17
多语言
扩散模型
文本渲染
直接偏好优化
视觉文本
通过混合扩散和对抗训练实现少步轨迹可控视频生成,质量与精度双提升
Quanhao Li, Zhen Xing, Rui Wang, Haidong Cao, Qi Dai, Daoguo Dong, Zuxuan Wu
2026-03-17
对抗训练
扩散模型
知识蒸馏
视频生成
轨迹控制
提出谱匹配假设,通过ESM和DSM统一提升潜在扩散生成质量
Mang Ning, Mingxiao Li, Le Zhang, Lanmiao Liu, Matthew B. Blaschko, Albert...
2026-03-17
VAE
图像生成
扩散模型
潜在扩散
谱分析