用反事实证据干预把“答案是否依赖视觉证据”变成GRPO奖励,让VLM不再靠语言先验答题。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
把每轮交互意图变成显式控制变量,意图校准GRPO训练出意图准确率86.6%的用户模拟器
揭示SFT多阶段训练产生任务冲突而RL可稳定共存,并提出Parallel-RL解耦框架。
多模态环境不能盲目堆量,应从能力多样性与难度结构两维度设计训练分布
用统一强化学习框架打通情感感知、理解与交互三大层次
用执行状态匹配校验特权参考轨迹,只在匹配轮次做自蒸馏,多轮智能体任务成功率显著提升。
用递归贝叶斯信念更新为长程智能体RL做回合级信用分配
用潜在视觉状态重构与隐式过程奖励强化学习,让多模态大模型掌握时序视觉推理。
用答案反推出的线索给轨迹每一步打分,实现细粒度的SFT与RL训练。
让统一多模态模型自主推理、调用工具并原生生成图像。
用技能熵度量技能切换难度,构建Skill2-Bench基准并用Skill-Entropy RL训练
RSTG在负零方差样本上选择性施加自适应蒸馏,恢复GRPO丢失的梯度信号
面向智能体强化学习自蒸馏的持久一致性方法
👍 38按教师信号的局部持久性,为每个 token 分配自适应蒸馏权重。
用工具执行结果构造轮次级多视野事后监督,自适应调制强化学习优势。
DASH通过检测答案漂移为推理段落分配信用,在减少过度思考的同时提升准确率。
把技能生成建模为顺序编辑过程,用回滚奖励训练技能编辑策略
面向在策略蒸馏的稳定优势融合
👍 34提出SAF四阶段流水线融合GRPO与OPD优势,避免熵坍塌并稳定提升性能。
将特权偏移重解为反事实敏感度,重分配 GRPO token 信用以提升长链推理。
用统一策略在行动前依据当前状态重构检索经验,GRPO 端到端训练
用反事实回放为GRPO分配令牌级信用,无需训练评分器即可提升指令跟随RL效果