找到 498 条结果

利用LLM构建部件级动作数据集,实现细粒度时空控制的扩散模型动作生成

Chuqiao Li, Xianghui Xie, Yong Cao, Andreas Geiger, Gerard Pons-Moll 2026-01-19
LLM数据标注 人体动作生成 扩散模型 文本驱动生成 部件级控制

统一VLM-Diffusion架构从网络视频学习语言驱动的未来光流预测,赋能机器人操控和视频生成

Kanchana Ranasinghe, Honglu Zhou, Yu Fang, Luyu Yang, Le Xue, Ran Xu,... 2026-01-19
光流预测 扩散模型 机器人操控 视觉语言模型 视频生成

基于MMDiT的实时流式人形视频生成框架,25fps低延迟交互,支持任意时长

Lizhen Wang, Yongming Zhu, Zhipeng Ge, Youwei Zheng, Longhao Zhang, Tianshu... 2026-01-16
人形动画 多模态融合 实时交互 扩散模型 视频生成

紧凑高效的指令式图像编辑系统,2B VLM+1.6B扩散模型,4秒生成2K图像

Grigorii Alekseenko, Aleksandr Gordeev, Irina Tolstykh, Bulat Suleimanov,... 2026-01-16
图像编辑 扩散模型 指令跟随 视觉语言模型 高效推理

基于扩散模型,通过VNE和宽松训练目标编辑物体内在属性。

Tal Reiss, Daniel Winter, Matan Cohen, Alex Rav-Acha, Yael Pritch, Ariel... 2026-01-16
图像编辑 属性编辑 扩散模型 视觉命名实体 身份保持

提出MOTIVE框架,通过运动加权梯度归因识别影响视频生成运动质量的训练片段。

Xindi Wu, Despoina Paschalidou, Jun Gao, Antonio Torralba, Laura Leal-Taixé,... 2026-01-14
扩散模型 数据归因 梯度方法 视频生成 运动归因