找到 232 条结果

用 Instructor–Follower 闭环共进化让指令难度随模型能力自动升级,无需外部教师即可提升开源 LLM 的多约束指令遵循能力

Qingyu Ren, Qianyu He, Jiajie Zhu, Xingzhou Chen, Jingwen Chang, Zeye Sun,... 2026-05-12
GRPO LLM 对齐 强化学习 指令遵循 自我博弈

用语义化评分标准替代教师 logits 的黑箱在线蒸馏框架。

Junfeng Fang, Zhepei Hong, Mao Zheng, Mingyang Song, Gengsheng Li, Houcheng... 2026-05-11
GRPO LLM对齐 强化学习 知识蒸馏 评分标准奖励