首次系统分析 RLVR 噪声标签机制,提出在线标签精炼方法 OLR。
Shenzhi Yang, Guangcheng Zhu, Bowen Song, Sharon Li, Haobo Wang, Xing Zheng,...
2026-04-07
GRPO
RLVR
噪声标签学习
强化学习
推理大模型
SRPO将正确样本路由到GRPO、失败样本路由到SDPO,实现早期效率和长期稳定性的双重优势
Gengsheng Li, Tianyu Yang, Junfeng Fang, Mingyang Song, Mao Zheng, Haiyun...
2026-04-07
RLVR
大语言模型后训练
强化学习
策略优化
自蒸馏
自蒸馏只控更新幅度,环境奖励锚定方向
Chenxu Yang, Chuanyu Qin, Qingyi Si, Minghui Chen, Naibin Gu, Dingyu Yao,...
2026-04-06
GRPO
RLVR
信用分配
多模态推理
自蒸馏
15B多域RLVR后训练,30-50%更短推理链
Rafael Pardinas, Ehsan Kamalloo, David Vazquez, Alexandre Drouin
2026-04-03
GSPO
LLM后训练
PipelineRL
RLVR
多域强化学习
多答案RL训练模型单次前向推理生成多个候选答案及置信度
Isha Puri, Mehul Damani, Idan Shenfeld, Marzyeh Ghassemi, Jacob Andreas, Yoon Kim
2026-03-27
RLVR
不确定性估计
多样性推理
大语言模型
强化学习
RLVR仅通过修改极少量关键token分布即可大幅提升推理性能
Haoming Meng, Kexin Huang, Shaohang Wei, Chiyu Ma, Shuo Yang, Xue Wang,...
2026-03-25
RLVR
Token级分析
分布偏移
大语言模型
强化学习
通过解耦推理与置信度优化目标,解决 RLVR 训练中模型过度自信的根本问题
Zhengzhao Ma, Xueru Wen, Boxi Cao, Yaojie Lu, Hongyu Lin, Jinglin Yang, Min...
2026-03-11
GRPO
RLVR
大语言模型
强化学习
推理能力
揭示内在奖励的分布锐化机制与不可避免的崩溃,提出外部奖励作为可扩展替代路径
Bingxiang He, Yuxin Zuo, Zeyuan Liu, Shangziqi Zhao, Zixuan Fu, Junlin Yang,...
2026-03-10
LLM推理
RLVR
奖励工程
强化学习
无监督学习
异构LLM智能体共享rollout协作训练,仅用一半计算成本平均提升3.6%
Zhixia Zhang, Zixuan Huang, Xin Xia, Deqing Wang, Fuzhen Zhuang, Shuai Ma,...
2026-03-05
RLVR
多智能体强化学习
异构模型协作
推理能力训练
策略优化
绕过扩散LLM不可计算的似然,用速度场整流实现精准对齐
Chenxing Wei, Jiazhen Kang, Hong Wang, Jianqing Zhang, Hao Jiang, Xiaolong...
2026-03-04
Flow Matching
RLVR
强化学习对齐
扩散语言模型
无似然优化
提出INSIGHT方法通过贝叶斯加权互信息优化RLVR训练数据选择
Xinyu Zhou, Boyu Zhu, Haotian Zhang, Huiming Wang, Zhijiang Guo
2026-03-03
RLVR
大语言模型
强化学习
数据选择
训练效率
RL 主要锐化已有支持,SFT 扩展支持,需先桥接再锐化
Ahmadreza Jeddi, Kimia Shaban, Negin Baghbanzadeh, Natasha Sharan, Abhishek...
2026-03-03
RLVR
医学视觉语言模型
支持边界
边界感知训练
采样效率
通过双尺度多样性正则化促进LLM推理中的深度探索
Zhongwei Wan, Yun Shen, Zhihao Dou, Donghao Zhou, Yu Zhang, Xin Wang, Hui...
2026-02-24
RLVR
多样性探索
大语言模型推理
强化学习
数学推理
首个统一异步执行、时间推理、噪声鲁棒性、歧义消解与多智能体协作的可验证评测基准
Romain Froger, Pierre Andrews, Matteo Bettini, Amar Budhiraja, Ricardo...
2026-02-13
Asynchronous Environment
Benchmark
LLM Agent
Multi-Agent
RLVR
利用 RLVR 导致的推理结构塌缩特征,通过 Min-kNN 距离黑盒检测训练数据
Hongbo Zhang, Yue Yang, Jianhao Yan, Guangsheng Bao, Yue Zhang
2026-02-13
RLVR
会员推断
强化学习
推理模型
数据污染检测
提出 RLTR,在 RLVR 中加入跨模型可迁移奖励,提升推理鲁棒性与采样一致性。
Hyunseok Lee, Soheil Abbasloo, Jihoon Tack, Jinwoo Shin
2026-02-12
LLM 推理
RLTR
RLVR
多数投票一致性
强化学习
通过动态调整PPO裁剪阈值灵活控制RL训练中的策略熵
Kun Chen, Peng Shi, Fanfan Liu, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao
2026-02-10
GRPO
RLVR
大语言模型
强化学习
策略熵
通过Focal加权缓解群相对RLVR在中等组大小下的分布锐化问题,无需额外计算
Daniil Plyusov, Alexey Gorbatovski, Boris Shaposhnikov, Viacheslav Sinii,...
2026-02-09
GRPO
RLVR
分布锐化
大语言模型
强化学习
通过长度归一化消除GSPO的长度偏差,提升RLVR训练稳定性和性能
Fanfan Liu, Youyang Yin, Peng Shi, Siqi Yang, Zhixiong Zeng, Haibo Qiu
2026-02-06
GRPO
GSPO
RLVR
多模态推理
大语言模型
提出科学文献问答环境,用RLVR训练搜索代理在1600万篇PubMed摘要上回答事实型问题
James Burgess, Jan N. Hansen, Duo Peng, Yuhui Zhang, Alejandro Lozano, Min...
2026-02-05
RLVR
强化学习
搜索代理
检索增强生成
科学问答