首个显式建模语音token层级先验的离散扩散VTS模型。
Jiaxin Ye, Gaoxiang Cong, Chenhui Wang, Xin-Cheng Wen, Zhaoyang Li, Boyuan...
2026-04-20
RVQ层级
扩散模型
离散语音token
视频生成语音
音视频对齐
腾讯混元开源的统一 3D 世界模型,将全景生成、轨迹规划、视频扩展、几何重建融合为单条流水线
Team HY-World, Chenjie Cao, Xuhui Zuo, Zhenwei Wang, Yisu Zhang, Junta Wu,...
2026-04-17
3D 世界模型
3D 高斯溅射
全景生成
前馈三维重建
图像到 3D
用扩散生成器采样轨迹、RL判别器在低维打分,再配BEV特征级仿真,把闭环规划的安全性提升56%。
Hao Gao, Shaoyu Chen, Yifan Zhu, Yuehao Song, Wenyu Liu, Qian Zhang, Xinggang Wang
2026-04-17
GRPO
强化学习
扩散模型
端到端学习
自动驾驶
首个把HOI生成与编辑统一在单一DiT中的框架,首次实现多交互编辑。
Jiun Tian Hoe, Weipeng Hu, Xudong Jiang, Yap-Peng Tan, Chee Seng Chan
2026-04-17
Diffusion Transformer
人-物交互
可控生成
图像生成
图像编辑
先把 VFM 语义特征自回归预测出来,再用扩散模型渲染像素,实现 7× 训练加速。
Efstathios Karypidis, Spyros Gidaris, Nikos Komodakis
2026-04-17
世界模型
分层生成
扩散模型
自动驾驶
视觉基础模型
用无条件反演破解文本到3D模型的'沉陷陷阱'难题
Victoria Yue Chen, Emery Pierson, Léopold Maillard, Maks Ovsjanikov
2026-04-17
3D生成
分布外泛化
反演编辑
扩散模型
文本到3D
ByteDance Seed 团队发布的多模态音视频联合生成模型,在 T2V/I2V/R2V 三大任务六维评测中全面领先 Sora 2 Pro、Veo 3.1、Kling 3.0。
Team Seedance, De Chen, Liyang Chen, Xin Chen, Ying Chen, Zhuo Chen, Zhuowei...
2026-04-16
可控生成
图生视频
多模态生成
扩散模型
文生视频
用结构化多维推理奖励替代标量打分,缓解奖励黑客并实现零参数测试时优化
Haozhe Wang, Cong Wei, Weiming Ren, Jiaming Liu, Fangzhen Lin, Wenhu Chen
2026-04-16
奖励模型
强化学习
扩散模型
推理增强
视觉生成
LogC3 对齐扩散模型潜在空间,LoRA 微调实现 SDR→HDR 视频生成。
Naomi Ken Korem, Mohamed Oumoumad, Harel Cain, Matan Ben Yosef, Urska...
2026-04-16
HDR视频生成
LoRA微调
LogC3编码
扩散模型
潜在空间对齐
单图生成长时3D一致视频并重建可交互3D场景
Tianchang Shen, Sherwin Bahmani, Kai He, Sangeetha Grama Srinivasan, Tianshi...
2026-04-15
3D Gaussian Splatting
三维重建
扩散模型
视频生成
长时一致性
用朗之万恒等映射统一扩散模型的VAE/score/flow三大视角
Candi Zheng, Yuan Lan
2026-04-15
VAE
得分匹配
扩散模型
教学博文
朗之万动力学
DDTree:从单次块扩散草稿的逐位分布构建最优草稿树,提升投机解码接受长度。
Liran Ringel, Yaniv Romano
2026-04-15
DFlash
LLM推理
扩散模型
投机解码
推理加速
反向扩展视频生成器为基座,用统一流匹配统一视频生成与理解
Luozheng Qin, Jia Gong, Qian Qiao, Tianjiao Li, Li Xu, Haoyu Pan, Chao Qu,...
2026-04-14
Flow Matching
MoE 架构
多模态统一模型
扩散模型
视频生成
提出推理时插拔式方法,通过交叉注意力路由实现多事件视频的精确时间控制,无需训练或架构修改
Gordon Chen, Ziqi Huang, Ziwei Liu
2026-04-14
多事件合成
扩散模型
时间控制
注意力机制
视频生成
在导数空间用对抗目标训练连续流模型,仅10个epoch后训练即大幅降低FID
Shanchuan Lin, Ceyuan Yang, Zhijie Lin, Hao Chen, Haoqi Fan
2026-04-14
后训练
图像生成
对抗训练
扩散模型
概率流ODE
720p@40FPS 长程记忆交互世界模型,统一数据、模型与加速
Zile Wang, Zexiang Liu, Jaixing Li, Kaichen Huang, Baixin Xu, Fei Kang,...
2026-04-13
交互式世界模型
实时推理
扩散模型
记忆机制
长视频生成
基于 Focus-and-Refine 的区域化图像精修,在用户指定区域内恢复细节且严守背景不变。
Dewei Zhou, You Li, Zongxin Yang, Yi Yang
2026-04-13
LoRA
图像生成
图像编辑
多模态
局部精修
循环Transformer+环内自蒸馏,单次训练实现任意时间推理,参数减少4倍。
Sahil Goyal, Swayam Agrawal, Gautham Govind Anil, Prateek Jain, Sujoy Paul,...
2026-04-13
参数高效
图像生成
循环Transformer
扩散模型
视频生成
用稀疏点轨迹的逐步自回归扩散,从单张图像生成上千种物理一致的开集未来预测,比视频生成快几个数量级。
Stefan Andreas Baumann, Jannik Wiese, Tommaso Martorella, Mahdi M. Kalayeh,...
2026-04-13
世界模型
扩散模型
稀疏表示
自回归Transformer
规划
用视觉语言联合推理自动生成相机轨迹,实现精准可控视频生成
Haoyu Zhao, Zihao Zhang, Jiaxi Gu, Haoran Chen, Qingping Zheng, Pin Tang,...
2026-04-13
多模态学习
扩散 Transformer
扩散模型
相机控制
空间推理