找到 448 条结果

提出RLAD框架,通过信任区域比率蒸馏将教师指导嵌入GRPO更新,实现选择性模仿

Zhaoyang Zhang, Shuli Jiang, Yantao Shen, Yuting Zhang, Dhananjay Ram, Shuo... 2026-03-02
GRPO 大语言模型 强化学习 推理增强 知识蒸馏

首个针对软件工程的上下文学习基准,定义四种上下文类型并评估其对代码生成、摘要、审查和补丁评估的影响

Haichuan Hu, Ye Shang, Guoqing Xie, Congqing He, Quanjun Zhang 2026-03-02
上下文学习 代码审查 代码摘要 代码生成 大语言模型

系统研究高效推理训练机制,通过数据、奖励和优化策略实现更短、更准确的推理链生成

Taiqiang Wu, Zenan Zu, Bo Zhou, Ngai Wong 2026-02-25
大语言模型 奖励塑形 强化学习 推理链优化 高效推理