首个基于ART认知分类法评估MLLM视觉空间推理能力的合成基准,揭示人类与模型间30+个百分点的能力鸿沟。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
首项AVLLMs机械可解释性研究,揭示视觉主导的模态偏向机制
通过输入侧自适应分辨率分配,在消除90%视觉token的同时保持或超越基线性能
用响应熵作为全局信号,自适应选择token并支持早停
提出ScratchMath基准评估MLLM诊断学生数学错误能力
通过规划先于感知的迭代推理,让MLLM自主决定看什么、何时看、怎么看
Actor-Judge架构实现多模态推理无监督自进化,无需标注数据
用结构化文本描述3D空间布局作为中间推理链,提升MLLM的空间推理准确率
用统一MLLM实现3D场景中细粒度功能元素的主动时空定位和分割
将推测解码从token级提升到智能体级,用轻量模型跳过不必要的工具调用链
用稀疏3D VQ-VAE+MLLM将静态网格转为仿真就绪的铰接物体
AutoGaze:3M参数前置模块裁剪冗余patch,实现19×加速
利用视觉-时间亲和力图和假设-验证-细化循环,在稀疏观察下定位长视频关键线索
用MLLM语义分组约束多视角3D实例构建,实现开放词汇检测
通过强化学习对齐MLLM推理与低层动作,显著提升VLA机器人操控性能
通过领域自适应预训练和视觉指令调优构建增材制造专用多模态大语言模型
从视频生成模型提取3D先验增强MLLM空间理解
首个长音频视频理解基准,评估多模态大模型的跨模态长时理解能力
MLLMs在离散符号理解中存在识别-推理倒置的认知错配现象
提出Chain of Events范式,通过构建时序事件链提升MLLM的视频事件预测能力