找到 102 条结果

把视频当码率流处理,codec-stream 在事件级定位上 +44.8。

Xiang An, Yin Xie, Feilong Tang, Yunyao Yan, Huajie Tan, Didi Zhu, Changrui... 2026-05-27
多模态大模型 感知智能 时序定位 视觉token压缩 视频理解

首个系统化的隐喻视频理解基准MetaphorVU-Bench与基于隐喻知识图谱的推理时增强框架MetaphorBoost

Zhuoqun Li, Boxi Cao, Guiping Jiang, Fangrui Lv, Ruotong Pan, Jianan Wang,... 2026-05-26
多模态大模型 知识图谱 视频理解 评测基准 隐喻理解

首个无提示视频潜台词理解基准,揭示前沿多模态模型在讽刺、反讽与社会含义上的系统短板

Qi Li, Xinchao Wang 2026-05-15
基准测试 多模态大模型 社会语言学 视频理解 隐喻与反讽

把时间做成可学习概念,教会模型感知并按指定播放速度生成视频

Yen-Siang Wu, Rundong Luo, Jingsen Zhu, Tao Tu, Ali Farhadi, Matthew... 2026-04-24
慢动作数据集 扩散模型 时间建模 自监督学习 视频理解

发现视频理解数据集严重依赖语言捷径,提出仅用视觉基础问题后训练提升模型性能

Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang, Penghui Du, Yiming Jia, Dongfu... 2026-04-08
多模态学习 数据质量控制 视觉语言模型 视频理解 语言偏见

通过输入侧自适应分辨率分配,在消除90%视觉token的同时保持或超越基线性能

Huanxuan Liao, Zhongtao Jiang, Yupu Hao, Yuqiao Tan, Shizhu He, Jun Zhao,... 2026-03-31
多模态大语言模型 强化学习 自适应推理 视频理解 计算效率