DPE 通过诊断-生成-强化闭环迭代,用 1K 种子数据让 8B 多模态模型超越 72B 模型
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过能力反思和记忆反思机制,实现VLM稳定迭代自我修正的OCR框架
提出10.3万规模的多模态数学数据集,通过三阶段自动清洗管道构建,显著提升视觉推理能力
MMA:多模态记忆智能体
👍 9为记忆智能体引入动态可靠性评分,解决检索噪声导致的过度自信错误。
揭示RL微调VLMs在文本扰动下的脆弱性及准确性-忠实性权衡现象
思维链:基于自适应认知模式的推理框架
👍 75训练无关的智能体框架,动态切换四种认知模式实现自适应推理
首个开源视觉语言模型,在物理奥赛中斩获12枚金牌,排名第3
通过长度归一化消除GSPO的长度偏差,提升RLVR训练稳定性和性能
提出可动态切换文本/视觉/交错三种推理模式的混合自回归多模态推理模型
视频原生推理重排序器,两阶段训练实现31% nDCG@10提升
提出首个评估VLM自适应推理模式选择能力的基准,揭示准确率与模式选择能力解耦现象
用多格漫画作为图像和视频之间的中间推理媒介,兼顾时序结构与计算效率
构建1.8M高质量推理数据集,通过数据为中心策略显著提升VLM推理能力
通过强化学习训练多模态模型自适应选择和编排视觉工具,实现复杂推理任务的突破性性能。
视觉生成通过多模态世界模型实现类人推理
👍 25视觉生成作为世界模型在物理世界任务中显著优于纯语言推理
提出代码驱动的科学图像生成框架ImgCoder和评测基准SciGenBench,揭示精度-表现力权衡
智能体驱动的超长视频理解
👍 22提出EGAgent框架,通过实体场景图实现跨天超长视频的多跳推理问答
Think3D:用空间思考来实现空间推理
👍 48让VLM通过主动探索3D点云空间进行推理,而非被动接受2D图像
难度过滤是多模态推理数据策划的核心,多样性启发式无额外收益
统一多种多模态推理技能为生成范式,用SFT+RL实现