找到 83 条结果

首次系统分析 RLVR 噪声标签机制,提出在线标签精炼方法 OLR。

Shenzhi Yang, Guangcheng Zhu, Bowen Song, Sharon Li, Haobo Wang, Xing Zheng,... 2026-04-07
GRPO RLVR 噪声标签学习 强化学习 推理大模型

SRPO将正确样本路由到GRPO、失败样本路由到SDPO,实现早期效率和长期稳定性的双重优势

Gengsheng Li, Tianyu Yang, Junfeng Fang, Mingyang Song, Mao Zheng, Haiyun... 2026-04-07
RLVR 大语言模型后训练 强化学习 策略优化 自蒸馏

揭示内在奖励的分布锐化机制与不可避免的崩溃,提出外部奖励作为可扩展替代路径

Bingxiang He, Yuxin Zuo, Zeyuan Liu, Shangziqi Zhao, Zixuan Fu, Junlin Yang,... 2026-03-10
LLM推理 RLVR 奖励工程 强化学习 无监督学习

异构LLM智能体共享rollout协作训练,仅用一半计算成本平均提升3.6%

Zhixia Zhang, Zixuan Huang, Xin Xia, Deqing Wang, Fuzhen Zhuang, Shuai Ma,... 2026-03-05
RLVR 多智能体强化学习 异构模型协作 推理能力训练 策略优化

利用 RLVR 导致的推理结构塌缩特征,通过 Min-kNN 距离黑盒检测训练数据

Hongbo Zhang, Yue Yang, Jianhao Yan, Guangsheng Bao, Yue Zhang 2026-02-13
RLVR 会员推断 强化学习 推理模型 数据污染检测