找到 118 条结果

让15个前沿大模型各管一家足球俱乐部20年,测谁会“经营”而不只是“执行”。

Tianyou Wang, Chongyang Gao, Kezhen Chen, Chen Dong, Yinghao He, Donghan Li,... 2026-08-20
LLM Agent 基准测试 多智能体竞技场 行为能力分解 长程决策

对照实验与配对轨迹分析揭示:技能靠程序锚定而非知识注入起效,检索与调用是失效边界。

Zhiyuan Jiang, Fangrui Huang, Hanwen Xing, Xander Wu, Yipeng Gao, Rui Cao,... 2026-08-19
Agent Skills LLM Agent 实证评测 检索与调用 程序记忆

冻结模型权重,用种群级自然选择进化智能体支架,四大基准平均提升约17分。

Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur, Thai Hoang,... 2026-08-14
LLM Agent 智能体支架搜索 智能体评测 种群进化 自进化智能体

直接感知原始多模态证据,端到端自动完成从数据到可验证论文的科研闭环

Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu 2026-08-14
AI Scientist LLM Agent 多智能体系统 多模态智能体 科学发现

通过任务分解、执行记忆与验证修复,构建可跨后端迁移的长时程智能体框架

Jingsheng Zheng, Xinyuan Fang, Jintian Zhang, Zhengke Gui, Huajun Chen, Ningyu Zhang 2026-08-06
AgentIF-OneDay LLM Agent 任务分解 执行记忆 跨后端迁移

系统综述让代码智能体从软件反馈中持续自我进化的方法与分类框架

Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang 2026-08-06
LLM Agent 代码智能体 强化学习 综述 自我进化