找到 210 条结果

用反事实证据干预把“答案是否依赖视觉证据”变成GRPO奖励,让VLM不再靠语言先验答题。

Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong... 2026-08-11
GRPO 反事实推理 多模态大模型 奖励设计 强化学习后训练

把视觉定位重构为文本片段与图像实例的双向对应预测,一个模型统一多种定位任务

Jieyu Zhang, Ziqi Gao, Luke Zettlemoyer, Ranjay Krishna 2026-08-11
多模态大模型 开放词汇分割 指代消解 结构化预测 视觉语言定位

用预测版面分叉内容分支并行解码,端到端文档解析大幅提速

Hao Yu, Jiabo Zhan, Kang Liu, Linnan Zhao, Dongxu Yue, Rui Chen, Jinglin... 2026-08-07
KV缓存复用 多模态大模型 并行解码 文档解析 版面分析

把模态平衡本身作为在线自蒸馏的特权信息,用正负双教师提升多模态推理

Aniri, Jinhe Bi, Peng Liao, Zengjie Jin, Volker Tresp, Fei Shen, Yunpu Ma,... 2026-08-06
MLLM 后训练 在线自蒸馏 多模态大模型 模态平衡

提出多参考图锚定的视频描述新任务,用两阶段后训练实现短语级图像标签绑定。

Tengfei Liu, Yang Shi, Yuran Wang, Xiaohan Zhang, Yuqing Wen, Yuqi Tang,... 2026-07-31
GRPO强化学习 参考图锚定 多模态大模型 视觉定位 视频描述