找到 448 条结果

TREK扩展GRPO探索支持,提升数学和Agent性能

Yuanda Xu, Zhengze Zhou, Kayhan Behdin, Jelena Markovic-Voronov, Hejian... 2026-07-08
Agent 大语言模型 强化学习 数学推理 知识蒸馏

研究编码 Agent 训练中的奖励信号设计问题,提出验证器与生成器协同进化的框架

Binghai Wang, Chenlong Zhang, Dayiheng Liu, Jiajun Zhang, Jiawei Chen,... 2026-06-26
Agent 评估 代码生成 大语言模型 奖励设计 强化学习

通过动态选择熵谷层而非最终层,缓解 RLHF 对齐训练对复杂推理任务的负面影响

Xuanming Zhang, Sining Zhoubian, Yuxuan Chen, Tianyi Tang, An Yang, Sean Du,... 2026-06-23
大语言模型 对齐税 层动态分析 推理增强 解码策略

将Python代码基准扩展到12种语言,揭示LLMs的Python过拟合和多语言性能差异

Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko... 2026-06-19
代码生成 基准测试 多语言评估 大语言模型 污染感知评估