找到 121 条结果

研究编码 Agent 训练中的奖励信号设计问题,提出验证器与生成器协同进化的框架

Binghai Wang, Chenlong Zhang, Dayiheng Liu, Jiajun Zhang, Jiawei Chen,... 2026-06-26
Agent 评估 代码生成 大语言模型 奖励设计 强化学习

将Python代码基准扩展到12种语言,揭示LLMs的Python过拟合和多语言性能差异

Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko... 2026-06-19
代码生成 基准测试 多语言评估 大语言模型 污染感知评估