找到 251 条结果

EgoForge 仅凭单张自我中心图像+高层指令+可选外中心图,生成目标驱动的连贯第一人称视频

Yifan Shen, Jiateng Liu, Xinzhuo Li, Yuanzhe Liu, Bingxuan Li, Houze Yang,... 2026-03-23
XR应用 世界模型 强化学习对齐 扩散模型 自我中心视觉

通过将预测损失扩展到所有token并引入深层自监督,大幅提升视频自监督学习的密集特征质量

Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar, Mido Assran, Koustuv Sinha,... 2026-03-19
世界模型 密集预测 自监督学习 视觉Transformer 视频理解

首个相机条件约束的立体世界模型,联合学习外观与双目几何,实现端到端立体视频生成

Yang-Tian Sun, Zehuan Huang, Yifan Niu, Lin Ma, Yan-Pei Cao, Yuewen Ma, Xiaojuan Qi 2026-03-19
世界模型 扩散模型 注意力机制 相机控制 立体视频生成

通过将观测分解为对象-属性结构,实现零样本跨域奖励预测

Yijun Shen, Delong Chen, Xianming Hu, Jiaming Mi, Hongbo Zhao, Kai Zhang,... 2026-03-11
世界模型 大语言模型 奖励预测 强化学习 智能体规划

通过联合建模多源世界知识(运动、语义、几何),实现物理一致的视频生成。

Boming Tan, Xiangdong Zhang, Ning Liao, Yuqing Zhang, Shaofeng Zhang, Xue... 2026-03-06
世界模型 扩散模型 物理一致性 表征对齐 视频生成

从零开始系统研究统一多模态预训练的设计空间,揭示视觉与语言的互补性和缩放不对称性

Shengbang Tong, David Fan, John Nguyen, Ellis Brown, Gaoyue Zhou, Shengyi... 2026-03-04
世界模型 多模态预训练 混合专家 缩放定律 视觉生成

用因果Transformer预测下一时刻嵌入,替代像素重建学习世界模型

George Bredis, Nikita Balagansky, Daniil Gavrilov, Ruslan Rakhimov 2026-03-04
Transformer 世界模型 强化学习 模型基强化学习 表征学习