通过长度归一化消除GSPO的长度偏差,提升RLVR训练稳定性和性能
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
面向 LLM 智能体的强化世界模型学习
👍 28用自监督 RL 训练 LLM 成为动作条件的世界模型,提升智能体决策能力
用 KL3 估计器替代 GRPO 中的对称裁剪,实现有理论保证的非对称近信赖域约束
自提示语言模型增强强化学习
👍 31通过训练时注入自生成提示解决 GRPO 稀疏奖励下的优势崩塌问题
用 Beta 分布动态建模模型能力,自适应分配 RL rollout 预算以优化探索-利用权衡
Actor-Refiner协作框架解决搜索推理中的多尺度信用分配问题
Rubric-ARM通过交替强化学习联合优化评分标准生成器和判断器,提升LLM后训练效果
测试时课程合成:面向自进化的协同训练框架
👍 35通过合成课程问题与求解器协同进化,实现测试时自适应推理提升
FISSION-GRPO 框架:将执行错误转化为在线策略纠正性监督,提升工具使用错误恢复能力。
提出GUI-AiF框架,通过双奖励机制实现GUI智能体在域和分辨率漂移下的持续学习
首个开源网络安全推理模型,8B参数媲美70B模型性能
用LLM评估器回答自然语言元问题作为奖励信号,无需真值标签即可训练语言模型
MoE架构GUI智能体,SFT+GRPO训练,跨平台SOTA性能
在已饱和问题上通过失败前缀条件化恢复学习信号
发现状态信息丰富度和规划复杂度是 RL 训练保留跨域泛化能力的关键因素
扩散语言模型的任意顺序生成反而限制推理,用标准GRPO效果更佳
通过模型自我验证和提出单步纠正干预,解决强化学习在LLM推理中的信用分配问题
你的群组相对优势是有偏的
👍 158揭示GRPO等群组相对RL算法中优势估计的固有偏差,并提出HA-DW自适应修正方案
通过边界感知奖励训练LLM在信息不足时主动承认"不知道",提升智能体搜索的可靠性
将工具调用信用分配建模为二部图匹配问题,实现细粒度的回合级奖励估计