提出生成式视觉奖励模型Visual-ERM,通过细粒度图像对比为图表/表格/SVG转代码任务提供可靠RL奖励信号
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
基于视频的计算机使用代理奖励建模
👍 43用执行视频训练奖励模型评估计算机代理任务成功率
通过可执行代码作为感知媒介,系统性提升多模态大模型在STEM领域的视觉理解能力
首个全自动大规模空间感知多模态数据集构建流水线,从原始视频生成高质量3D空间标注。
大型多模态模型作为通用上下文分类器
👍 27LMM 通过上下文学习匹配 CLIP 分类能力,CIRCLE 迭代伪标签进一步提升
通过动态奖励的强化学习提升多模态模型在开放世界分类中的特异性
将Sonar文本嵌入空间扩展到图像和视频,实现多模态统一的潜空间推理模型
半真半假会破坏基于相似度的检索
👍 6CLIP 类检索会被错细节迷惑;CS-CLIP 用 unit 级监督修复该漏洞。
一致性三位一体:定义通用世界模型的核心原则
👍 203提出模态/空间/时间三维一致性框架及CoW-Bench基准,系统评估世界模型的物理模拟能力
DyaDiT生成社交感知的双人对话手势
三模态掩码扩散模型的设计空间
👍 4首个统一文本、图像、音频的三模态掩码扩散模型,通过SDE参数化消除最优批量大小搜索
层次化对比学习实现IMU与视频骨架的亚秒级精确对齐
通过强化学习和任务特定奖励,统一人体运动理解与生成的多模态模型
提出LATENTLENS方法,证明LLM中视觉token在各层均具有高度可解释性
统一VLA框架交错语言规划、视觉预测与动作生成
通过精确建模模态间隙几何结构,用无配对文本替代昂贵图文数据训练MLLM
EgoAVU:自我中心音视频理解
👍 12构建自动化数据引擎生成自我中心音视频问答数据,解决现有MLLMs音视频联合理解不足的问题
首个基于强化学习的混合模态推理框架,显著提升音视频理解能力
提出ReasoningCodec分解音频为推理与重建token,构建统一音频基础模型
视觉语言模型中的上下文视觉个性化
👍 3提出CoViP框架,通过个性化图像摘要和强化学习实现上下文视觉个性化