揭示 GRPO/Dr. GRPO/DAPO 是对组标准差的三种操作
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
无环境的代理代码验证器,实现完全环境无关的编码代理后训练
提出RLMF方法,通过元认知反馈强化学习实现LLM数值和语言不确定性的忠实校准
提出软查询精炼方法,在连续潜在空间中迭代优化视频检索查询,结合强化学习实现检索与推理的端到端训练。
首个基于真实设备闭环训练的移动GUI代理,在RealMobile基准上达到72.0%成功率
通过play预训练学习通用操作先验,再用RL微调解决多指机器人的精密组装任务
通过多教师在线策略蒸馏实现LLM多领域能力集成
提出无需训练的测试平台QVAL,通过Q值对齐直接评估密集监督信号质量
为智能体RL的每个动作片段判定语义角色,按角色修正GRPO信用分配
HExA 让 LLM 智能体通过主动实验学习可迁移技能,无需参数更新即可显著提升性能
异步OPD中陈旧数据影响分析与高效训练流水线
通过差分答案探针奖励和结果门控优势路由,精确评估视觉工具调用的贡献并智能控制工具使用
通过多轮自适应检索和强化学习优化,显著提升KB-VQA任务的准确率
通过以对象为中心的残差RL,在仿真中训练的策略零样本提升真实VLA机器人成功率从42%到76%
基于视觉-语言-动作模型与强化学习循环的双臂衣物折叠机器人系统,在模拟赛中获得第1名,在真实机器人决赛中获得第2名的优异成绩。
通过训练时范数约束抑制RL post-training的感知质量退化
研究编码 Agent 训练中的奖励信号设计问题,提出验证器与生成器协同进化的框架
通过动作前缀并行预测替代自回归rollout,在提升视觉规划成功率的同时大幅降低计算开销
揭示多步工具RL崩溃机制,提出过程反思监督有效解决训练不稳定性问题
离散化奖励模型
👍 17通过离散化奖励模型解决过度敏感问题,提升强化学习效果