找到 323 条结果

用独立LoRA在并行画布上训练13种音视频控制模态,仅需55K步即可超越VACE等基线

Matan Ben-Yosef, Tavi Halperin, Naomi Ken Korem, Mohammad Salama, Harel... 2026-03-27
LoRA微调 可控生成 多模态 视频生成 音频生成

提出Visual Chronometer预测视频物理帧率,解决时间尺度幻觉

Xiangbo Gao, Mingyang Wu, Siyuan Yang, Jiongze Yu, Pardis Taghavi, Fangzhou... 2026-03-26
世界模型 帧率估计 时间建模 视觉动力学 视频生成

通过微观精确SDE和宏观双重信任区域,使视频GRPO探索保持在数据流形附近

Mingzhe Zheng, Weijie Kong, Yue Wu, Dengyang Jiang, Yue Ma, Xuanhua He, Bin... 2026-03-24
GRPO 强化学习对齐 扩散模型 流匹配 视频生成

EgoForge 仅凭单张自我中心图像+高层指令+可选外中心图,生成目标驱动的连贯第一人称视频

Yifan Shen, Jiateng Liu, Xinzhuo Li, Yuanzhe Liu, Bingxuan Li, Houze Yang,... 2026-03-23
XR应用 世界模型 强化学习对齐 扩散模型 自我中心视觉