找到 323 条结果

两阶段训练修复自生成历史KV缓存写入的梯度缺口,让5秒训练窗口外推到数分钟视频

Junhao Zhuang, Shiyi Zhang, Yuxuan Bian, Yaowei Li, Yawen Luo, Yijun Liu,... 2026-07-23
KV缓存 自回归扩散模型 视频生成 训练目标设计 长视频外推

基于15B扩散Transformer的交互式长时程世界模型,蒸馏至4步实现低延迟生成

AlayaWorld Team, Kaipeng Zhang, Chuanhao Li, Yifan Zhan, Yongtao Ge,... 2026-07-22
3D记忆 世界模型 扩散Transformer 自回归生成 蒸馏加速

用可学习规划Token与分数旋转位置编码实现帧级可控多镜头视频生成

Su Guo, Guangce Liu, Haosen Yang, Jiepeng Wang, Cong Liu, Junqi Liu, Haibin... 2026-07-21
多镜头视频 扩散Transformer 旋转位置编码 电影级生成 视频生成

Wan-Streamer v0.3 将视频分解为世界与事件流,实现通用预训练可迁移的实时音视频交互。

Lianghua Huang, Zhi-Fan Wu, Yupeng Shi, Wei Wang, Mengyang Feng, Cheng Yu,... 2026-07-17
VLA 世界模型 多模态 实时音视觉 流式交互

首个无需训练、无需骨架先验的跨物种视频动作迁移框架

Ling-Hao Chen, Zixin Yin, Duomin Wang, Xianfang Zeng, Gang Yu 2026-07-14
动作迁移 扩散Transformer 注意力控制 视频生成 跨物种动画

利用预训练视频生成模型构建统一通用的多任务视觉感知框架

Letian Wang, Chuhan Zhang, Rishabh Kabra, Jasper Uijlings, Steven Waslander,... 2026-07-13
多任务学习 扩散模型 视觉-语言对齐 视频生成 通用视觉模型

支持语音控制的实时交互式数字人物视频生成系统

Jintao Zhang, Kai Jiang, Jintao Chen, Xu Wang, Yang Luo, Yuji Wang, Dechuang... 2026-07-10
多模态学习 实时推理 数字人 视频生成 语音交互

构建OpenCoF-17K数据集,通过多样化时间监督和推理token机制提升视频生成模型的推理能力

Xinyan Chen, Ziyu Guo, Renrui Zhang, Dongzhi Jiang, Hongsheng Li 2026-07-10
Chain-of-Frame Diffusion Transformer 数据集构建 视觉推理 视频生成