找到 210 条结果

提出 AVR 框架,让视觉推理模型按任务复杂度动态选择直接回答、感知或完整推理三种格式,token 消耗降低 50–90%。

Yixu Huang, Tinghui Zhu, Muhao Chen 2026-04-20
GRPO 多模态大模型 强化学习 推理效率 视觉推理

把少量自监督任务伪装成指令,迫使多模态大模型真正用眼睛看。

Sophia Sirko-Galouchenko, Monika Wysoczanska, Andrei Bursuc, Nicolas Thome,... 2026-04-17
LLaVA 多模态大模型 自监督学习 视觉中心推理 视觉指令微调

为多模态分割模型外挂实时检索,提升新兴实体分割精度19.2% gIoU

Song Tang, Guangquan Jie, Henghui Ding, Yu-Gang Jiang 2026-04-16
SAM 多模态大模型 开放世界分割 新兴实体分割 检索增强生成(RAG)

首个覆盖工件级与型号级细粒度语义的制造领域MLLM基准,揭示领域知识才是性能瓶颈。

Xiangru Jian, Hao Xu, Wei Pang, Xinjian Zhao, Chengyu Tao, Qixin Zhang,... 2026-04-13
制造领域 域自适应 基准评测 多模态大模型 工业AI

用皮尔士三元符号学重构人与生成艺术的意义流转,提出 SemJudge 和 HSG 图,让评估器真正看懂象征与暗示。

Ruixiang Jiang, Changwen Chen 2026-04-13
基准构建 多模态大模型 意义理解 生成艺术评估 计算符号学

提出 SciTikZer 模型与 Dual Self-Consistency 强化学习框架,从图像生成可编译的 TikZ 代码,在 8B 体量上超越 Gemini-2.5-Pro 与 Qwen3-VL-235B。

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu,... 2026-04-08
TikZ/LaTeX 代码生成 图像到代码 多模态大模型 强化学习

用反向几何变换搬运图像 token,使 MLLM 在单图条件下完成邻近视角的 3D 空间推理。

Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung 2026-04-06
3D 空间推理 几何 warping 图像 token 多模态大模型 视角变换

提出 COSMIC 基准,评估两个 MLLM 代理能否通过多轮对话整合不同第一人称视角以形成共享空间心智模型。

Ankur Sikarwar, Debangan Mishra, Sudarshan Nikhil, Ponnurangam Kumaraguru,... 2026-04-06
多智能体协作 多模态大模型 对话基准 空间推理 认知地图