找到 56 条结果

把3D形状码的逐token自回归解码改为块间因果、块内并行去噪加置信度修正,提速5.15倍

Bowen Cui, Weijie Wang, Zeyu Zhang, Yefei He, Mingda Lin, Haoyu Zhao, Yuanyu... 2026-08-25
3D网格生成 块级扩散 文本到3D生成 离散去噪 自回归生成

外置相机位姿索引的几何记忆,配合长时程教师蒸馏,实现三步生成、小时级不间断的交互世界模型

Yuanyang Yin, Gongxuan Wang, Yifan Zhan, Chuanhao Li, Kaipeng Zhang, Feng Zhao 2026-08-14
世界模型 交互式生成 几何记忆 少步蒸馏 自回归生成

实时相机可控的视频世界模型,支持图像与视频条件的长程交互探索

Jiacong Xu, Hanwen Jiang, Zhixin Shu, Kalyan Sunkavalli, Vishal M. Patel, Yiqun Mei 2026-07-29
实时生成 模型蒸馏 相机控制 稀疏注意力记忆 自回归生成

基于15B扩散Transformer的交互式长时程世界模型,蒸馏至4步实现低延迟生成

AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge,... 2026-07-22
3D记忆 世界模型 扩散Transformer 自回归生成 蒸馏加速

系统刻画MLLM生成时逐token注意力动态,并用注意力阻断与增强干预验证因果并提升性能

Varun Gupta, Vineet Gandhi, Makarand Tapaswi 2026-07-08
多模态大模型 机制可解释性 注意力干预 注意力机制 自回归生成

提出双流频率标记器和MotionVLA框架,解决人形运动生成中姿态语义与物理动态的频域不匹配问题

Nonghai Zhang, Siyu Zhai, Yanjun Li, Zeyu Zhang, Zhihan Yin, Yandong Guo,... 2026-06-17
人形运动生成 多模态学习 自回归生成 视觉-语言-动作模型 频域标记化

支持相机导航、场景记忆和可组合事件控制的通用世界模型

DreamX Team, Yancheng Bai, Rui Chen, Xiangxiang Chu, Rujing Dang, Hao Dou,... 2026-06-16
世界模型 交互式生成 相机控制 自回归生成 视频生成

首个支持实时推理的唇形同步扩散模型,通过分析驱动的蒸馏框架将14B教师压缩为两步自回归学生,实现31 FPS流式生成

Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee, Joungbin Lee, Siyoon Jin,... 2026-06-10
唇形同步 实时推理 扩散模型 模型蒸馏 自回归生成