找到 102 条结果

提出Chain of Events范式,通过构建时序事件链提升MLLM的视频事件预测能力

Qile Su, Jing Tang, Rui Chen, Lei Sun, Xiangxiang Chu 2026-03-19
事件预测 多模态大语言模型 强化学习 时序建模 视频理解

通过将预测损失扩展到所有token并引入深层自监督,大幅提升视频自监督学习的密集特征质量

Lorenzo Mur-Labadia, Matthew Muckley, Amir Bar, Mido Assran, Koustuv Sinha,... 2026-03-19
世界模型 密集预测 自监督学习 视觉Transformer 视频理解

用执行视频训练奖励模型评估计算机代理任务成功率

Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu,... 2026-03-13
GUI代理 多模态学习 奖励建模 视频理解 计算机使用代理