找到 144 条结果

用执行视频训练奖励模型评估计算机代理任务成功率

Linxin Song, Jieyu Zhang, Huanxin Sheng, Taiwei Shi, Gupta Rahul, Yang Liu,... 2026-03-13
GUI代理 多模态学习 奖励建模 视频理解 计算机使用代理

通过可执行代码作为感知媒介,系统性提升多模态大模型在STEM领域的视觉理解能力

Tongkun Guan, Zhibo Yang, Jianqiang Wan, Mingkun Yang, Zhengtao Guo, Zijian... 2026-03-12
STEM推理 代码生成 多模态学习 强化学习 视觉感知

首个全自动大规模空间感知多模态数据集构建流水线,从原始视频生成高质量3D空间标注。

Yuanyuan Gao, Hao Li, Yifei Liu, Xinhao Ji, Yuning Gong, Yuanjun Liao,... 2026-03-10
3D重建 多模态学习 数据集构建 空间智能 计算机视觉

LMM 通过上下文学习匹配 CLIP 分类能力,CIRCLE 迭代伪标签进一步提升

Marco Garosi, Matteo Farina, Alessandro Conti, Massimiliano Mancini, Elisa Ricci 2026-03-06
上下文学习 图像分类 多模态学习 开放世界识别 视觉语言模型

将Sonar文本嵌入空间扩展到图像和视频,实现多模态统一的潜空间推理模型

Yifu Qiu, Paul-Ambroise Duquenne, Holger Schwenk 2026-03-03
多模态学习 多语言处理 嵌入空间对齐 扩散模型 视觉-语言建模

首个统一文本、图像、音频的三模态掩码扩散模型,通过SDE参数化消除最优批量大小搜索

Louis Bethune, Victor Turrisi, Bruno Kacper Mlodozeniec, Pau Rodriguez... 2026-02-26
多模态学习 扩散模型 文本到图像生成 离散扩散 缩放定律

构建自动化数据引擎生成自我中心音视频问答数据,解决现有MLLMs音视频联合理解不足的问题

Ashish Seth, Xinhao Mei, Changsheng Zhao, Varun Nagaraja, Ernie Chang,... 2026-02-09
多模态学习 指令微调 数据引擎 自我中心视频 音视频理解

提出CoViP框架,通过个性化图像摘要和强化学习实现上下文视觉个性化

Yeongtak Oh, Sangwon Yu, Junsung Park, Han Cheol Moon, Jisoo Mok, Sungroh Yoon 2026-02-04
上下文理解 个性化 多模态学习 强化学习 视觉语言模型