仅用128条随机抽取的示范样本,让GRPO+DPO的少样本RLVR超越千条SFT数据方法。
Kai Yan, Alexander G. Schwing, Yu-Xiong Wang
2026-05-15
DPO
GRPO
LLM后训练
RLVR
少样本学习
提出Fast-Slow Training框架,将慢权重RL与快权重提示词优化协同演化
Rishabh Tiwari, Kusha Sareen, Lakshya A Agrawal, Joseph E. Gonzalez, Matei...
2026-05-13
GEPA
LLM后训练
RLVR
可塑性
快慢权重
POISE 用策略模型自身隐藏状态预测奖励基线,替代 PPO 价值网络与 GRPO 多采样
Yunho Choi, Jongwon Lim, Woojin Ahn, Minjae Oh, Jeonghoon Shim, Yohan Jo
2026-05-13
LLM推理
RLVR
价值估计
可验证奖励
强化学习
提出渐进式模态迁移基准与盲训练控制,揭示多模态推理的视觉变量接地瓶颈与 RL 视觉虚假提升。
Kun Xiang, Terry Jingchen Zhang, Zirong Liu, Bokai Zhou, Yueling Tang,...
2026-05-13
RLVR
基准测试
多模态推理
模态迁移
物理推理
反转自蒸馏信号,放大正确 rollout 中模型自驱推理的 token
Jeonghye Kim, Jiwon Jeon, Dongsheng Li, Yuqing Yang
2026-05-12
GRPO
RLVR
信息不对称
可验证奖励
推理增强
把 GRPO 族方法重写为对响应单纯形的显式目标投影,提出 LPO
Yun Qu, Qi Wang, Yixiu Mao, Heming Zou, Yuhang Jiang, Yingyue Li, Wutong Xu,...
2026-05-11
GRPO 改进
LLM 后训练
RLVR
几何视角
策略优化
揭示 GRPO 中两种聚合规则的偏差,提出均衡聚合 BA。
Zhiyuan Zeng, Jiameng Huang, Zhangyue Yin, Jiashuo Liu, Ziniu Li, Bingrui...
2026-05-08
GRPO
LLM推理
RLVR
强化学习
聚合偏差
用隐藏态投影残差解耦正负样本的语义重叠,保护共享token免受误罚。
Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei...
2026-05-07
GRPO
LLM推理
Lazy Likelihood Displacement
NSR
Pass@1与Pass@k
首篇系统梳理 LLM 强化学习 rollout 设计的综述,提出 GFCR 四阶段框架。
Rohan Surana, Gagan Mundada, Xunyi Jiang, Chuhan Wang, Zhenwei Tang, Difan...
2026-05-06
GRPO
LLM 推理
RLVR
rollout 策略
强化学习
用Tsallis q-对数统一SFT与RLVR,提出GARL/PAFT在固定q上训练推理模型。
Chu-Cheng Lin, Eugene Ie
2026-05-06
GRPO
RLVR
SFT后训练
Tsallis损失族
冷启动
首个融合RLHF的音频推理模型,用偏好奖励突破RLVR多轮对话质量瓶颈
Yuxin Zhang, Xiangyu Tony Zhang, Daijiao Liu, Fei Tian, Yayue Deng, Jun...
2026-04-29
Chain-of-Thought
RLHF
RLVR
强化学习
语音对话
提出 TEXOCR-Bench 基准与 2B 模型 TEXOCR,用 SFT+RLVR 把 PDF 页面恢复成可编译、结构一致的 LaTeX 源码。
Chengye Wang, Lin Fu, Zexi Kuang, Yilun Zhao
2026-04-28
LaTeX 重建
RLVR
多模态大模型
强化学习
文档 OCR
用同条训练跑上稍后的 checkpoint 当老师,做 Q/V 折中最优的混合策略 RLVR。
Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng...
2026-04-23
RLVR
多模态推理
强化学习
混合策略
策略优化
首个专为视频RL设计的端到端训练评测框架,带离线缓存与异步推理
Chuanyu Qin, Chenxu Yang, Qingyi Si, Naibin Gu, Dingyu Yao, Zheng Lin, Peng...
2026-04-21
RLVR
多模态大模型
强化学习
视频理解
训练框架
RLVR 弱监督泛化由预训练先验与推理忠实性决定,Thinking SFT 可恢复
Salman Rahman, Jingyan Shen, Anna Mordvina, Hamid Palangi, Saadia Gabriel,...
2026-04-21
GRPO
RLVR
奖励饱和
弱监督学习
推理忠实性
用PPL空间解耦破解RLVR训练中探索-利用的两难困境
Xiaofan Li, Ming Yang, Zhiyuan Ma, Shichao Ma, Jintao Du, Yu Cheng, Weiqiang...
2026-04-20
GRPO
LLM后训练
RLVR
困惑度
强化学习
提出 PreRL 与 DSRL:在预训练空间以 NSR 修剪错误推理路径,再切换到标准 RL 精调。
Yuqiao Tan, Minzheng Wang, Bo Liu, Zichen Liu, Tian Liang, Shizhu He, Jun...
2026-04-16
GRPO
Policy Reincarnation
RLVR
强化学习
推理增强
把组内候选重加权变成闭式目标分布,用交叉熵直接拟合,梯度自动消失。
Jean Kaddour
2026-04-16
GRPO
LLM 强化学习
PPO
RLVR
强化学习
非线性外推低秩参数轨迹,37.5%算力削减下仍提升RLVR性能
Zhipeng Chen, Tao Qian, Wayne Xin Zhao, Ji-Rong Wen
2026-04-14
LLM训练加速
RLVR
低秩建模
参数外推
模型优化
两阶段RLVR框架联合训练推理和自我改进,无需外部监督信号
Difan Jiao, Qianfeng Wen, Blair Yang, Zhenwei Tang, Ashton Anderson
2026-04-08
GRPO
RLVR
强化学习
数学推理
自我改进