多尺度视觉裁剪+长程轨迹RL,突破多模态深度研究瓶颈
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
基于时空上下文学习的通用角色动画框架
V-JEPA视频预训练+模拟器多模态轨迹蒸馏,实现SOTA端到端驾驶规划
首个结合原生音频-视频输入、时序定位和人口统计学元数据的多模态理解基准
训练UMM同时生成深度图和分割图,反向提升视觉理解能力
基于扩散Transformer的统一多模态视频生成框架
从视觉编码器提取亲和力提示注入语言模型,免训练提升VLA模型的空间理解能力
将文本思维链渲染成图像,用视觉编码器压缩推理过程
首个全模态未来预测基准,揭示当前MLLM在视听协同推理上的显著不足
通过隐式多模态思维链推理实现视觉语言导航,训练时用思维链、推理时无需显式生成,兼顾推理能力与实时性
多模态整流流模型从随意拍摄序列生成鲁棒的度量3D物体形状
系统分析多图像视觉语言模型的失败模式,提出 MIMIC 基准和针对性改进方案
构建1亿中文图文对数据集,通过系统化清洗流程显著提升中文视觉-语言预训练性能
让LLM先推理再生成,突破T2I模型的文字-像素映射局限
统一对比学习与3D字幕生成,通过测试时搜索提升跨域鲁棒性
将视觉和文本数学物理问题转换为可验证的LEAN形式化代码
提出百万级工业缺陷多模态数据集IMDD-1M及扩散模型基座,实现少样本缺陷检测与生成
提出无需外部数据的自我改进框架,通过Proposer-Solver-Judge三角色对弈解决统一多模态模型理解能力强但生成能力弱的问题
提出认知启发的三阶段框架,通过知识内化解决视觉数学推理中的推理漂移问题
统一自回归Transformer通过next-scale预测实现高效多模态理解与生成