提出BIS评分筛选MPRM训练rollout,10%数据即可匹配全量性能
Jinyuan Li, Chengsong Huang, Langlin Huang, Shaoyang Xu, Haolin Liu, Wenxuan...
2026-02-05
多模态大语言模型
强化学习
数据选择
视觉推理
过程奖励模型
用散度约束替换PPO的比率裁剪,解决LLM强化学习中训练不稳定和效率低下的问题
Penghui Qi, Xiangxin Zhou, Zichen Liu, Tianyu Pang, Chao Du, Min Lin, Wee Sun Lee
2026-02-05
PPO
RLHF
信赖域优化
大语言模型微调
强化学习
通过训练时注入自生成提示解决 GRPO 稀疏奖励下的优势崩塌问题
Baohao Liao, Hanze Dong, Xinxing Xu, Christof Monz, Jiang Bian
2026-02-05
GRPO
大语言模型对齐
强化学习
数学推理
策略优化
提出科学文献问答环境,用RLVR训练搜索代理在1600万篇PubMed摘要上回答事实型问题
James Burgess, Jan N. Hansen, Duo Peng, Yuhui Zhang, Alejandro Lozano, Min...
2026-02-05
RLVR
强化学习
搜索代理
检索增强生成
科学问答
通过自蒸馏和多样性感知强化学习,解决大推理模型在复杂工具使用中的懒惰推理问题
Bowen Xu, Shaoyu Wu, Hao Jiang, Kai Liu, Xin Chen, Lulu Hu, Bin Yang
2026-02-05
任务分解
大推理模型
工具使用
强化学习
自蒸馏
通过学习识别并省略冗余的思考和观察token,在不损失准确率的前提下大幅降低智能体推理成本
Yansong Ning, Jun Fang, Naiqiang Tan, Hao Liu
2026-02-05
LLM智能体
上下文压缩
工具调用
强化学习
效率优化
对数概率奖励在可验证和不可验证领域均为CoT训练提供统一信号
Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier
2026-02-05
大语言模型
奖励设计
强化学习
推理优化
链式思维
将多智能体辩论的推理能力蒸馏到单个LLM,提升推理效率
Yinyi Luo, Yiqiao Jin, Weichen Yu, Mengqi Zhang, Srijan Kumar, Xiaoxiao Li,...
2026-02-05
多智能体系统
大语言模型
强化学习
推理增强
知识蒸馏
用回译与强化学习在无配对数据下同步提升代码生成与文档生成能力。
Jingwen Xu, Yiyang Lu, Zisu Huang, Changze Lv, Xiaohua Wang, Shizheng Li,...
2026-02-05
代码生成
低资源语言
强化学习
自监督学习
用离散Token统一表示蒙皮权重,实现骨骼生成与蒙皮预测的端到端自回归绑定
Jia-peng Zhang, Cheng-Feng Pu, Meng-Hao Guo, Yan-Pei Cao, Shi-Min Hu
2026-02-05
3D绑定
强化学习
离散表示
自回归生成
计算机图形学
提出MCR框架,通过结构化跨模态推理消除MLLM在定位命名实体识别中的模态偏见
Jinlong Ma, Yu Zhang, Xuefeng Bai, Kehai Chen, Yuwei Wang, Zeming Liu, Jun...
2026-02-05
命名实体识别
多模态大语言模型
强化学习
推理优化
视觉定位
用模型预测熵自适应混合软/硬token嵌入,解决离散扩散LLM奖励引导的梯度-可靠性矛盾
Atula Tejaswi, Litu Rout, Constantine Caramanis, Sanjay Shakkottai, Sujay Sanghavi
2026-02-05
奖励引导
对齐
强化学习
扩散语言模型
推理时优化
提出多层稳定框架解决RLHF训练不稳定,结合双软最小评论家与PID自适应KL控制
Dipan Maity
2026-02-05
KL散度控制
PPO改进
RLHF
大语言模型对齐
强化学习
用LLM学习的环境模拟器替代Docker容器,实现无物理执行的软件工程智能体训练与推理
Shuang Sun, Huatong Song, Lisheng Huang, Jinhao Jiang, Ran Le, Zhihao Lv,...
2026-02-04
Docker-free
强化学习
测试时缩放
环境模拟
软件工程智能体
开源全流程后训练框架,用32B模型在SWE-bench Verified上达到70.8%解决率
Huatong Song, Lisheng Huang, Shuang Sun, Jinhao Jiang, Ran Le, Daixuan...
2026-02-04
SWE-bench
代码导航
后训练
强化学习
软件工程智能体
用 Beta 分布动态建模模型能力,自适应分配 RL rollout 预算以优化探索-利用权衡
Zhiyuan Yao, Yi-Kai Zhang, Yuxin Chen, Yueqing Sun, Zishan Xu, Yu Yang,...
2026-02-04
GRPO
LLM 推理
强化学习
数学推理
资源分配
通过强化学习训练评分标准生成器,为DeepResearch报告提供偏好对齐的细粒度奖励信号
Changze Lv, Jie Zhou, Wentao Zhao, Jingwen Xu, Zisu Huang, Muzhao Tian,...
2026-02-04
DeepResearch
人类偏好
奖励建模
强化学习
评估标准
提出 UnifiedReward-Flex,通过上下文自适应层次化推理动态构建个性化奖励模型。
Yibin Wang, Yuhang Zang, Feng Han, Jiazi Bu, Yujie Zhou, Cheng Jin, Jiaqi Wang
2026-02-04
偏好优化
多模态
奖励模型
强化学习
视觉生成
提出广域研究范式,用动态多智能体架构和端到端RL解决大规模并行信息检索任务
Ziyang Huang, Haolin Ren, Xiaowei Yuan, Jiawei Wang, Zhongtao Jiang, Kun Xu,...
2026-02-04
Agent优化
信息检索
多智能体系统
强化学习
知识图谱
用RL自动学习同伦方法的步长和终止策略,统一解决优化/求根/采样等多类问题
Jiayao Mai, Bangyan Liao, Zhenjun Zhao, Yingping Zeng, Haoang Li, Javier...
2026-02-04
优化
同伦方法
强化学习
采样
预测-校正