找到 999 条结果

提出BIS评分筛选MPRM训练rollout,10%数据即可匹配全量性能

Jinyuan Li, Chengsong Huang, Langlin Huang, Shaoyang Xu, Haolin Liu, Wenxuan... 2026-02-05
多模态大语言模型 强化学习 数据选择 视觉推理 过程奖励模型

用散度约束替换PPO的比率裁剪,解决LLM强化学习中训练不稳定和效率低下的问题

Penghui Qi, Xiangxin Zhou, Zichen Liu, Tianyu Pang, Chao Du, Min Lin, Wee Sun Lee 2026-02-05
PPO RLHF 信赖域优化 大语言模型微调 强化学习

通过训练时注入自生成提示解决 GRPO 稀疏奖励下的优势崩塌问题

Baohao Liao, Hanze Dong, Xinxing Xu, Christof Monz, Jiang Bian 2026-02-05
GRPO 大语言模型对齐 强化学习 数学推理 策略优化

对数概率奖励在可验证和不可验证领域均为CoT训练提供统一信号

Ariel Kwiatkowski, Natasha Butt, Ismail Labiad, Julia Kempe, Yann Ollivier 2026-02-05
大语言模型 奖励设计 强化学习 推理优化 链式思维

用LLM学习的环境模拟器替代Docker容器,实现无物理执行的软件工程智能体训练与推理

Shuang Sun, Huatong Song, Lisheng Huang, Jinhao Jiang, Ran Le, Zhihao Lv,... 2026-02-04
Docker-free 强化学习 测试时缩放 环境模拟 软件工程智能体

提出 UnifiedReward-Flex,通过上下文自适应层次化推理动态构建个性化奖励模型。

Yibin Wang, Yuhang Zang, Feng Han, Jiazi Bu, Yujie Zhou, Cheng Jin, Jiaqi Wang 2026-02-04
偏好优化 多模态 奖励模型 强化学习 视觉生成

提出广域研究范式,用动态多智能体架构和端到端RL解决大规模并行信息检索任务

Ziyang Huang, Haolin Ren, Xiaowei Yuan, Jiawei Wang, Zhongtao Jiang, Kun Xu,... 2026-02-04
Agent优化 信息检索 多智能体系统 强化学习 知识图谱