通过主动视觉推理实现视觉原生的多模态深度搜索代理
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
使用冻结MLLM作为监督器,通过属性感知梯度改进视觉编码器训练
提出三阶段框架让MLLM主动恢复损坏的视觉内容,实现像素级重建与多模态推理的鲁棒理解
推理再推理:跨视角重访提升空间推理能力
👍 30提出一种推理-再推理的两阶段框架,通过合成新视角视频验证初始假设,提升第一人称视频空间推理精度。
通过优化输入图像而非模型权重,实现对冻结多模态LLM的非侵入式任务适配
发现视觉 token 在中间层饱和,提出双路径路由架构节省 25-30% 计算
首个评估全模态视频字幕指令跟随能力的综合基准,发现格式-内容权衡现象
提出"观看-记住-推理"三重框架,系统梳理基于MLLM的视频理解方法、数据集、基准和未来方向
通过在语言和潜在视觉空间之间交错推理,保留动态未来视觉结构以提升视频事件预测性能
首个机械工程图理解基准数据集与专用模型,提升多模态LLM在工程制图中的能力
GeoVR 通过从2D视频提取几何约束,零推理成本赋予MLLMs强大的3D空间感知能力。
首个多流流媒体理解基准,评估MLLMs的并发流处理能力
通过双流强化学习将视觉定位能力内化到文本推理中,无需显式输出坐标
中间训练方法显式内化 GUI 世界知识
提出DLA模块和多阶段去噪策略,整合MLLM与VAE实现高质量主题驱动图像生成
首个利用视频生成模型主动合成评测场景的MLLM时空推理基准,揭示当前模型从感知到高阶推理的性能鸿沟
用3DGS物理退化引擎构建首个评测退化下MLLM空间智能的大规模基准。
用 MLLM 把 3D 手部接触估计变成结构化提示推理,无需训练即超越监督方法。
提出平衡多维奖励的RL框架,统一效用、正确性与流畅性
X2SAM:图像与视频中的任意分割
👍 25首个统一图像与视频的多模态大语言模型分割框架,支持14种分割任务与文本/视觉双提示。