通过训练时区域蒸馏取代推理时工具缩放,实现单次前向传播的细粒度视觉感知。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出结构化属性指令数据集ASID-1M和验证管道,显著提升视频描述的细粒度和可靠性
以草稿进行思考:基于逻辑重建的光学解压
👍 36将视觉推理重构为逻辑解压,通过极简DSL草稿实现确定性视觉验证
面向可验证推理的多模态事实级归因
👍 4提出 MURGAT 基准,评估 MLLM 在复杂推理中为每个事实提供精确多模态引用的能力
仅用60K纯文本对微调,从视频MLLM中间层提取嵌入即可达到视频检索SOTA
通过四阶段训练流程(中期训练、离线强化学习、在线强化学习、模型合并)构建统一的GUI智能体,在多个基准测试中达到SOTA
提出Demo驱动的视频上下文学习任务与基准,通过两阶段训练提升MLLM从演示中学习新技能的能力
通过RL训练的策略模型自适应决定何时及如何使用世界模型进行视觉空间推理
让分割模型像人一样边搜边想,突破 MLLM 内部知识瓶颈
多模态过程奖励模型的训练数据效率研究
👍 80提出BIS评分筛选MPRM训练rollout,10%数据即可匹配全量性能
提出MCR框架,通过结构化跨模态推理消除MLLM在定位命名实体识别中的模态偏见
揭示指令令牌作为模态仲裁结构锚点,浅层缓冲深层仲裁的稀疏头机制
通过多轮强化学习训练MLLM自主调用分割工具,实现超越人工提示的医学图像分割
面向多模态大语言模型的认知超感知
👍 16用视觉想象链增强MLLM的认知推理能力
通过自评估模态相关性动态调整对比解码权重,无需训练即可抑制跨模态幻觉
用点序列预测实现无解码器的MLLM像素级分割
首个无需扩散解码器的统一自回归多模态模型,支持文本、图像、语音的任意到任意生成
分层管理KV缓存,免训练实现10倍加速的流式视频理解
SAMTok:用两个词表示任意掩码
👍 44将任意区域掩码压缩为两个离散token,让MLLM像学语言一样学像素级能力
结合稀疏标注与伪标签的视频上下文学习框架,实现低资源场景下的高效适应