找到 998 条结果

无需标注或真值验证,用LLM下一token概率自蒸馏训练过程奖励模型

Artyom Gadetsky, Maxim Kodryan, Siba Smarak Panigrahi, Hang Guo, Maria Brbic 2026-05-22
LLM-as-a-Judge 强化学习 推理验证 无监督学习 测试时扩展

通过缝合技术将像素空间奖励模型高效转移到噪声潜在空间,实现快速准确的扩散对齐

Hyojun Go, Hyungjin Chung, Prune Truong, Goutam Bhat, Li Mi, Zhaochong An,... 2026-05-21
价值函数 强化学习 扩散模型 模型缝合 生成模型对齐

提出变分策略蒸馏(VPD)框架,通过EM算法让教师与学生协同进化,解决RLVR稀疏奖励问题

Yang Li, Erik Nijkamp, Semih Yavuz, Shafiq Joty 2026-05-21
代码生成 变分推断 大语言模型 强化学习 科学推理

揭示RLVR训练中存在反直觉的不可学习样例,代表模型表征的根本性缺陷。

Yulin Chen, He He, Chen Zhao 2026-05-21
RLVR 大语言模型 强化学习 推理能力 梯度分析

用 9 类任务、9 种奖励的 23K RLVR 数据集和 TMN-Reweight 多任务优化算法,让 30B 模型长上下文能力逼近 R1-0528。

Minxuan Lv, Tiehua Mei, Tanlong Du, Junmin Chen, Zhenpeng Su, Ziyang Chen,... 2026-05-20
GRPO RLVR 后训练 多任务学习 强化学习