找到 272 条结果

发现视频理解数据集严重依赖语言捷径,提出仅用视觉基础问题后训练提升模型性能

Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang, Penghui Du, Yiming Jia, Dongfu... 2026-04-08
多模态学习 数据质量控制 视觉语言模型 视频理解 语言偏见

提出完全开源的视觉推理训练方案,通过六类任务的多任务RL实现广泛能力提升

Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu 2026-04-07
多任务学习 开放源代码 强化学习 视觉推理 视觉语言模型

仅用最近N帧喂给现成VLM,即可超越复杂记忆机制的流式视频模型。

Yujiao Shen, Shulin Tian, Jingkang Yang, Ziwei Liu 2026-04-06
基线研究 感知-记忆权衡 流式视频理解 视觉语言模型 视频问答

通过熵引导层选择+正交融合+RoPE交叉注意力整合SigLIP与DINO双编码器,让VLM在视觉理解与定位任务上同时提升约5%

Ankan Deria, Komal Kumar, Xilin He, Imran Razzak, Hisham Cholakkal, Fahad... 2026-04-06
多模态大模型 多编码器融合 自监督视觉表征 视觉定位 视觉语言模型

使用单一早期融合Transformer实现开放词汇分割和OCR,通过Chain-of-Perception接口实现高效密集感知。

Aviraj Bevli, Sofian Chaybouti, Yasser Dahou, Hakim Hacid, Ngoc Dung Huynh,... 2026-04-01
OCR 密集感知 开放词汇分割 早期融合 视觉语言模型