用单一任务结果信号同时驱动技能选择、利用与蒸馏三阶段协同演化
Yaorui Shi, Yuxin Chen, Zhengxi Lu, Yuchun Miao, Shugui Liu, Qi GU, Xunliang...
2026-05-08
GRPO
LLM Agent
Long-horizon Tasks
Reinforcement Learning
Skill Library
在GRPO失败样本前添加Lorem Ipsum乱文,破解零优势困境以拓宽LLM推理探索。
Langlin Huang, Chengsong Huang, Jinyuan Li, Donghong Cai, Yuyi Yang, Jiaxin Huang
2026-05-08
GRPO
LLM推理
强化学习
探索策略
提示工程
在 episode 起始采样全局策略,条件化后续所有动作,层级化 GRPO 训练。
Xiangyuan Xue, Yifan Zhou, Zidong Wang, Shengji Tang, Philip Torr, Wanli...
2026-05-08
GRPO
LLM agents
agentic RL
hierarchical policy
long-horizon tasks
用语义验证替代坐标监督,实现无标注的地理空间定位自进化
Liang Yao, Fan Liu, Shengxiang Xu, Chuanyi Zhang, Rui Min, Shimin Di, Yuhui Zheng
2026-05-08
GRPO
地理空间推理
多模态大模型
强化学习
自监督
揭示 GRPO 中两种聚合规则的偏差,提出均衡聚合 BA。
Zhiyuan Zeng, Jiameng Huang, Zhangyue Yin, Jiashuo Liu, Ziniu Li, Bingrui...
2026-05-08
GRPO
LLM推理
RLVR
强化学习
聚合偏差
把CoT推理与最终打分解耦的视频奖励模型,解决生成式奖励训练不稳定。
Yuan Wang, Ouxiang Li, Yulong Xu, Borui Liao, Jiajun Liang, Jinghan Li, Meng...
2026-05-08
Bradley-Terry
CoT推理
DeScore
GRPO
MLLM
首个开源多模态深度搜索智能体训练配方,含数据管线、七工具环境与致命感知GRPO
Shuang Chen, Kaituo Feng, Hangting Chen, Wenxuan Huang, Dasen Dai, Quanxin...
2026-05-07
GRPO
多模态智能体
工具调用
强化学习
数据合成
用隐藏态投影残差解耦正负样本的语义重叠,保护共享token免受误罚。
Zihan Lin, Xiaohan Wang, Jie Cao, Jiajun Chai, Li Wang, Xiaodong Lu, Wei...
2026-05-07
GRPO
LLM推理
Lazy Likelihood Displacement
NSR
Pass@1与Pass@k
首篇系统梳理 LLM 强化学习 rollout 设计的综述,提出 GFCR 四阶段框架。
Rohan Surana, Gagan Mundada, Xunyi Jiang, Chuhan Wang, Zhenwei Tang, Difan...
2026-05-06
GRPO
LLM 推理
RLVR
rollout 策略
强化学习
用Tsallis q-对数统一SFT与RLVR,提出GARL/PAFT在固定q上训练推理模型。
Chu-Cheng Lin, Eugene Ie
2026-05-06
GRPO
RLVR
SFT后训练
Tsallis损失族
冷启动
构建医疗 RL 训练场并提出 TT-OPD 自蒸馏框架解决多轮崩塌问题
Minbyul Jeong
2026-05-06
GRPO
LLM智能体
医疗AI
多轮推理
强化学习
用ELBO代理扩散模型似然,把GRPO嫁接到文生图后训练上,比MDP路线快2-3倍且SOTA。
Bingda Tang, Yuhui Zhang, Xiaohan Wang, Jiayuan Mao, Ludwig Schmidt, Serena...
2026-04-29
ELBO
GRPO
RLHF
在线强化学习
扩散模型
四阶段流水线(SFT+GRPO+提示增强+自回归蒸馏)弥合视频扩散模型预训练与部署差距。
Zeyue Xue, Siming Fu, Jie Huang, Shuai Lu, Haoran Li, Yijun Liu, Yuming Li,...
2026-04-29
GRPO
RLHF
后训练
扩散模型
自回归蒸馏
在短上下文GRPO中按推理步置信度屏蔽优势,稳定高效压缩推理链。
Han Wang, Xiaodong Yu, Jialian Wu, Jiang Liu, Ximeng Sun, Mohit Bansal, Zicheng Liu
2026-04-28
DeepScaleR
GRPO
强化学习
推理压缩
步级信用分配
用强化学习让 7B 小模型端到端生成可部署的多页网站,匹敌 671B 模型。
Juyong Jiang, Chenglin Cai, Chansung Park, Jiasi Shen, Sunghun Kim, Jianguo...
2026-04-24
GRPO
Web 开发
代码生成
多模态奖励
强化学习
用 GRPO 强化学习联合优化显式弃答与拒答后澄清质量,3B 模型对不可答题表现匹敌 671B DeepSeek-R1。
Skylar Zhai, Jingcheng Liang, Dongyeop Kang
2026-04-23
GRPO
可验证奖励
大语言模型对齐
幻觉抑制
强化学习
用两阶段RL课程让多模态大模型自主掌握视觉工具调用以解决复杂视觉推理
Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang,...
2026-04-23
GRPO
多模态大模型
工具调用
强化学习
视觉推理
用VLM奖励+Flow-GRPO后训练,让图像编辑更贴合人类审美。
Fan Li, Chonghuinan Wang, Lina Lei, Yuping Qiu, Jiaqi Xu, Jiaxiu Jiang,...
2026-04-22
GRPO
RLHF
人类偏好对齐
图像编辑
奖励模型
首次将GRPO引入均匀离散扩散,通过将最终干净样本作为动作并用前向过程重构轨迹,解决训练崩溃。
Jiaqi Wang, Haoge Deng, Ting Pan, Yang Liu, Chengyuan Wang, Fan Zhang,...
2026-04-22
GRPO
RLHF
强化学习
扩散模型
文本到图像
1978个MCP环境+19822工具,GRPO自演化闭环训练,23个基准全面领先开源基线。
Guanting Dong, Junting Lu, Junjie Huang, Wanjun Zhong, Longxiang Liu, Shijue...
2026-04-21
GRPO
MCP
可验证奖励
工具调用
强化学习