找到 998 条结果

用 Instructor–Follower 闭环共进化让指令难度随模型能力自动升级,无需外部教师即可提升开源 LLM 的多约束指令遵循能力

Qingyu Ren, Qianyu He, Jiajie Zhu, Xingzhou Chen, Jingwen Chang, Zeye Sun,... 2026-05-12
GRPO LLM 对齐 强化学习 指令遵循 自我博弈

用语义化评分标准替代教师 logits 的黑箱在线蒸馏框架。

Junfeng Fang, Zhepei Hong, Mao Zheng, Mingyang Song, Gengsheng Li, Houcheng... 2026-05-11
GRPO LLM对齐 强化学习 知识蒸馏 评分标准奖励

通过advisor模型和相位自适应RL,改进进化搜索代理在昂贵评估场景下的策略适应能力

Minghao Yan, Bo Peng, Benjamin Coleman, Ziqi Chen, Zhouhang Xie, Shuo Chen,... 2026-05-11
LLM代理 强化学习 测试时学习 算法发现 进化搜索