并行训练多领域专家并在训练中持续互蒸馏,保持行为一致性以提升能力整合效率。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用同条训练跑上稍后的 checkpoint 当老师,做 Q/V 折中最优的混合策略 RLVR。
分层动作加密集奖励GRPO,把LVLM改造成统一视觉RAG智能体。
先抽取结构化事件证据再做推理,并用P-FAB解决多目标RL的Pareto冲突。
把一致性与视觉接地作为硬约束的GRPO变体,让多模态推理既准又真。
世界模型统一定义与统一推理框架OpenWorldLib
自蒸馏只控更新幅度,环境奖励锚定方向
揭示 VLM 靠语义标签“短路”视觉推理的失败机制
首个强调感知中心推理的复杂视频理解基准,现有最强模型准确率仅45.96%
通过锚定令牌机制实现粗到精的视觉指向,提升VLM在图像、GUI和视频中的定位精度
提出双智能体自进化架构,通过GRPO强化学习提升MLLM长链视觉推理能力
VLM对问题表述方式敏感,不同格式下视觉注意力分配差异显著
通过熵感知的离散-潜在推理模式切换和视觉锚点注入,缓解多模态推理模型幻觉
评估多模态大模型在多层条件分支推理中的视觉理解与决策能力
提出家庭安全基准和双脑架构,实时检测具身智能体危险行为
揭示冷启动中视觉注意力不足的瓶颈,提出AVAR框架重塑注意力分配,平均提升7%
用LLM隐藏态回灌视觉编码器,构建视觉-语言双向推理回路。
首个系统评估「生成能否帮助理解」的统一多模态模型基准,覆盖3000样本×35模型。
首个覆盖7类推理、21项任务的真实生活多图像推理基准,揭示SOTA MLLM的巨大差距
通过视觉侧局部聚类+语言侧文本引导逐层剪枝的双阶段框架,实现VLM的极致token压缩