用反事实证据干预把“答案是否依赖视觉证据”变成GRPO奖励,让VLM不再靠语言先验答题。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用时间戳免费导出的时间距离取代偏好与进度标注,训练出可作稠密奖励的机器人价值基础模型。
视觉语言定位即双向概念对应
👍 7把视觉定位重构为文本片段与图像实例的双向对应预测,一个模型统一多种定位任务
提出41K规模的MMOOC基准,联合评估多模态大模型的拒答能力与抗干扰鲁棒回答能力
用成语跨概念网络评测多模态模型的创造性解码能力。
用潜在视觉状态重构与隐式过程奖励强化学习,让多模态大模型掌握时序视觉推理。
让多模态大模型按问题语义动态挑选3D模态并分配专家
用预测版面分叉内容分支并行解码,端到端文档解析大幅提速
提出音视频协同编辑评测基准AVE-Compass,并配套规划式智能体AVE-Agent。
OPD-V:基于模态平衡的视觉在线自蒸馏
👍 10把模态平衡本身作为在线自蒸馏的特权信息,用正负双教师提升多模态推理
用视觉地理定位评测多模态大模型在图文冲突中如何取舍的对照事实基准
让连续视频长成时序分层记忆,同一份记忆既能答问也能主动服务。
提出结构化全掩码预测,单次前向传播完成多目标分割,破解三难困境
用反事实视觉干预分离教师修正中由视觉解释的部分并重构学生监督目标
首个 ALD/E 科学图表理解基准与竞赛,揭示多模态模型在数据抽取与推理上的瓶颈
面向真实设备的统一 GUI+CLI 基础智能体,在移动端全面 SOTA。
提出多参考图锚定的视频描述新任务,用两阶段后训练实现短语级图像标签绑定。
提出多模态上下文学习三级能力评测基准,最强模型总分仅0.28
首个联合评测遥感类别广度与查询多样性的开放词汇基准
编解码器原生视觉tokenizer+事件门控,4B参数实时流式多模态模型