找到 74 条结果

用 Transformer 替代 CNN 做视频压缩,支持自适应长度编码和扩散解码

Yao Teng, Minxuan Lin, Xian Liu, Shuai Wang, Xiao Yang, Xihui Liu 2026-02-06
Transformer 扩散模型 自编码器 视频压缩 视频生成

通过多头RoPE抖动解决自回归视频生成中的注意力坍塌问题,首次实现12小时连续流式视频生成

Justin Cui, Jie Wu, Ming Li, Tao Yang, Xiaojie Li, Rui Wang, Andrew Bai,... 2026-01-30
Transformer 位置编码 扩散模型 自回归模型 视频生成

揭示LLM注意力斜线模式由RoPE中高频分量与近秩一查询/键的相互作用内在产生

Yuan Cheng, Fengzhuo Zhang, Yunlong Hou, Cunxiao Du, Chao Du, Tianyu Pang,... 2026-01-16
RoPE Transformer 位置编码 机制可解释性 注意力机制

通过引入中间层监督和内部引导机制,显著提升扩散Transformer的生成质量和训练效率

Xingyu Zhou, Qifan Li, Xiaobin Hu, Hai Chen, Shuhang Gu 2026-01-01
Transformer 内部引导 扩散模型 生成质量提升 采样引导