找到 104 条结果

提出 MURGAT 基准,评估 MLLM 在复杂推理中为每个事实提供精确多模态引用的能力

David Wan, Han Wang, Ziyang Wang, Elias Stengel-Eskin, Hyunji Lee, Mohit Bansal 2026-02-13
可信AI 多模态大语言模型 归因与引用 视频理解 评估基准

通过四阶段训练流程(中期训练、离线强化学习、在线强化学习、模型合并)构建统一的GUI智能体,在多个基准测试中达到SOTA

Veuns-Team, Changlong Gao, Zhangxuan Gu, Yulin Liu, Xinyu Qiu, Shuheng Shen,... 2026-02-11
GUI智能体 人机交互自动化 多模态大语言模型 强化学习 模型合并

提出Demo驱动的视频上下文学习任务与基准,通过两阶段训练提升MLLM从演示中学习新技能的能力

Yuhao Dong, Shulin Tian, Shuai Liu, Shuangrui Ding, Yuhang Zang, Xiaoyi... 2026-02-10
上下文学习 多模态大语言模型 教学视频 知识获取 视频理解

提出BIS评分筛选MPRM训练rollout,10%数据即可匹配全量性能

Jinyuan Li, Chengsong Huang, Langlin Huang, Shaoyang Xu, Haolin Liu, Wenxuan... 2026-02-05
多模态大语言模型 强化学习 数据选择 视觉推理 过程奖励模型

揭示指令令牌作为模态仲裁结构锚点,浅层缓冲深层仲裁的稀疏头机制

Yu Zhang, Mufan Xu, Xuefeng Bai, Kehai chen, Pengfei Zhang, Yang Xiang, Min Zhang 2026-02-04
可解释性 因果分析 多模态大语言模型 模态遵循 注意力机制

首个无需扩散解码器的统一自回归多模态模型,支持文本、图像、语音的任意到任意生成

Dongjie Cheng, Ruifeng Yuan, Yongqi Li, Runyang You, Wenjie Wang, Liqiang... 2026-01-27
图像生成 多模态大语言模型 统一模型 自回归生成 语音合成

将任意区域掩码压缩为两个离散token,让MLLM像学语言一样学像素级能力

Yikang Zhou, Tao Zhang, Dengxian Gong, Yuanzheng Wu, Ye Tian, Haochen Wang,... 2026-01-23
向量量化 图像分割 多模态大语言模型 强化学习 掩码词元化

结合稀疏标注与伪标签的视频上下文学习框架,实现低资源场景下的高效适应

Ryo Fujii, Hideo Saito, Ryo Hachiuma 2026-01-23
上下文学习 主动学习 伪标签 多模态大语言模型 少样本学习