找到 121 条结果

面向科研全流程的数据中心化多智能体框架,在六项基准上取得 SOTA 并开源 27B 模型

Ke Lin, Yilin Lu, Shreyas Bhat, Xuehang Guo, Junier Oliva, Qingyun Wang 2026-03-04
LLM Agent 代码生成 多智能体系统 数据中心化AI 自动化科研发现

首个针对软件工程的上下文学习基准,定义四种上下文类型并评估其对代码生成、摘要、审查和补丁评估的影响

Haichuan Hu, Ye Shang, Guoqing Xie, Congqing He, Quanjun Zhang 2026-03-02
上下文学习 代码审查 代码摘要 代码生成 大语言模型

60,000条轨迹揭示agentic评估存在2-6pp方差,单次运行不可靠

Bjarni Haukur Bjarnason, André Silva, Martin Monperrus 2026-02-10
SWE-Bench agent评估 代码生成 可复现性 统计分析