通过方差分析揭示流匹配的双区间结构,提出无偏降方差训练和免微调加速采样
Donglin Yang, Yongxing Zhang, Xin Yu, Liang Hou, Xin Tao, Pengfei Wan,...
2026-02-11
扩散模型
方差缩减
流匹配
生成模型
采样加速
通过耦合配对时间步的速度预测,降低流匹配训练方差并提升采样效率
Chika Maduabuchi, Jindong Wang
2026-02-11
图像生成
扩散模型
方差缩减
流匹配
生成模型
仅用5秒视频训练,测试时可生成长达30分钟的高质量自回归视频
Haodong Li, Shaoteng Liu, Zhe Lin, Manmohan Chandraker
2026-02-10
扩散模型
缓存维护
自回归模型
视频生成
长视频合成
用扩散模型学习LLM激活分布,作为先验提升引导干预和可解释性
Grace Luo, Jiahai Feng, Trevor Darrell, Alec Radford, Jacob Steinhardt
2026-02-09
元学习
可解释性
大语言模型
扩散模型
激活建模
提出分层无姿态记忆压缩器,实现1000帧连续世界模拟
Ruiqi Wu, Xuanhua He, Meng Cheng, Tianyu Yang, Yong Zhang, Zhuoliang Kang,...
2026-02-06
世界模型
交互式模拟
扩散模型
视频生成
长时记忆
用首帧锚定采样轨迹,免训练稳定自回归长视频生成
Xunzhi Xiang, Zixuan Duan, Guiyu Zhang, Haiyu Zhang, Zhe Gao, Junta Wu,...
2026-02-06
扩散模型
推理时校正
测试时优化
自回归
视频生成
用 Transformer 替代 CNN 做视频压缩,支持自适应长度编码和扩散解码
Yao Teng, Minxuan Lin, Xian Liu, Shuai Wang, Xiao Yang, Xihui Liu
2026-02-06
Transformer
扩散模型
自编码器
视频压缩
视频生成
通过滑动窗口运动提取和梯度复用,实现无训练视频运动转移加速3.4倍
Yue Ma, Zhikai Wang, Tianhao Ren, Mingzhe Zheng, Hongyu Liu, Jiayi Guo, Mark...
2026-02-06
DiT
扩散模型
视频生成
计算效率
运动转移
通过深度自适应路由多层LLM特征,提升DiT文生图质量
Bozhou Li, Yushuo Guan, Haolin Li, Bohan Zeng, Yiyan Ji, Yue Ding, Pengfei...
2026-02-05
LLM
多层特征融合
扩散模型
文本条件化
文生图
通过识别并压缩注意力中的虚拟头实现自回归视频扩散模型的无损加速
Hang Guo, Zhaoyang Jia, Jiahao Li, Bin Li, Yuanhao Cai, Jiangshan Wang,...
2026-02-05
KV缓存压缩
扩散模型
推理加速
注意力优化
视频生成
通过并行粒子探索和轨迹级置信度权重,在推理时提升扩散语言模型生成质量
Ziwei Luo, Ziqi Jin, Lei Wang, Lidong Bing, Thomas B. Schön
2026-02-05
序列蒙特卡罗
扩散模型
推理时扩展
文本生成
语言模型
隐式3D运动表征实现视角解耦的可控人体视频生成
Zhixue Fang, Xu He, Songlin Tang, Haoxian Zhang, Qingfeng Li, Xiaoqiang Liu,...
2026-02-04
3D感知
人体动画
扩散模型
视频生成
运动控制
通过角色分离蒸馏,在少步生成中同时保持样本多样性和感知质量
Tianhe Wu, Ruibin Li, Lei Zhang, Kede Ma
2026-02-04
图像生成
多样性保持
少步生成
扩散模型
模型蒸馏
通过循环一致性目标约束误差累积,实现稳定长时域视频生成
Junchao Huang, Ziyang Ye, Xinting Hu, Tianyu He, Guiyu Zhang, Shaoshuai Shi,...
2026-02-04
世界模型
扩散模型
自回归生成
视频生成
长时域建模
在x-prediction上叠加LPIPS+P-DINO感知损失,像素扩散首次超越潜在扩散
Zehong Ma, Ruihan Xu, Shiliang Zhang
2026-02-03
像素空间生成
图像生成
感知损失
扩散模型
文生图
通过时序KV压缩和ANN稀疏注意力实现5-10倍加速的自回归视频生成
Dvir Samuel, Issar Tzachor, Matan Levy, Micahel Green, Gal Chechik, Rami Ben-Ari
2026-02-03
KV缓存压缩
世界模型
扩散模型
注意力机制
稀疏注意力
64×64×4高压缩VAE+层记忆DIT,实现42倍加速的图像转视频
FSVideo Team, Qingyu Chen, Zhiyuan Fang, Haibin Huang, Xinwei Huang, Tong...
2026-02-03
图像转视频
扩散模型
模型加速
潜空间压缩
视频生成
双流DiT框架解耦感知规划与视频合成,实现文本驱动的人-物交互
Youliang Zhang, Zhengguang Zhou, Zhentao Yu, Ziyao Huang, Teng Hu, Sen...
2026-02-03
DiT
人-物交互
扩散模型
虚拟形象
视频生成
提出LingBot-VA自回归扩散框架,统一视频动态预测与动作推理实现闭环机器人操控
Lin Li, Qihang Zhang, Yiming Luo, Shuai Yang, Ruilin Wang, Fei Han, Mingrui...
2026-02-02
世界模型
扩散模型
机器人操控
自回归生成
视觉-语言-动作模型
在超球面流形上对齐DINO语义特征,实现高保真重建与高效生成
Hun Chang, Byunghee Cha, Jong Chul Ye
2026-02-02
图像生成
扩散模型
流形学习
自编码器
视觉基础模型