用可自我演化的“程序三元组”图为 LLM 智能体逐步导航
Yuxing Lu, Yicheng Chen, Shanchan Wu, Sercan Ö. Arık
2026-09-09
LLM Agent
图结构
智能体记忆
程序性知识
自演化
CRDT 共享工作区加显式协调层,抑制多智能体弃坑失败并提升质量
Seonglae Cho, Donghyun Lee
2026-08-26
CRDT
LLM Agent
MCP
代码生成
分布式系统
冻结大模型通过三层自指改写自身 Harness 与进化策略,实现持续自我提升
Tailin Zhou
2026-08-21
Agent Harness
Gödel Machine
LLM Agent
冻结模型
智能体自我改进
让15个前沿大模型各管一家足球俱乐部20年,测谁会“经营”而不只是“执行”。
Tianyou Wang, Chongyang Gao, Kezhen Chen, Chen Dong, Yinghao He, Donghan Li,...
2026-08-20
LLM Agent
基准测试
多智能体竞技场
行为能力分解
长程决策
对照实验与配对轨迹分析揭示:技能靠程序锚定而非知识注入起效,检索与调用是失效边界。
Zhiyuan Jiang, Fangrui Huang, Hanwen Xing, Xander Wu, Yipeng Gao, Rui Cao,...
2026-08-19
Agent Skills
LLM Agent
实证评测
检索与调用
程序记忆
让仓库自合成 Issue 并蒸馏项目专属技能,破解 SWE 智能体冷启动
Silin Chen, Han Li, Xiaodong Gu, Yuling Shi, Haibing Guan
2026-08-19
Issue解决
LLM Agent
技能库
自蒸馏
软件工程智能体
冻结模型权重,用种群级自然选择进化智能体支架,四大基准平均提升约17分。
Yifan Zhang, Yutong Dai, Juntao Tan, Luyu Yang, Rishi Mullur, Thai Hoang,...
2026-08-14
LLM Agent
智能体支架搜索
智能体评测
种群进化
自进化智能体
直接感知原始多模态证据,端到端自动完成从数据到可验证论文的科研闭环
Bobo Li, Hao Fei, Tianjie Ju, Mong-Li Lee, Wynne Hsu
2026-08-14
AI Scientist
LLM Agent
多智能体系统
多模态智能体
科学发现
用13个可组合技能在编程助手中端到端生成论文,8.1美元、3.2小时一篇
Zhuoyang Qian, Biao Wu, Yiran Wang, Chris D Yan, Desan Dai, Liangwei Zheng,...
2026-08-13
AI 写作
LLM Agent
智能体系统
自动科研
论文生成
用统一任务协议与自动插桩追踪,对智能体脚手架做全生命周期多维评测
Haoning Wang, Mingxun Zhang, Chenyue Yu, Yingjun Shang, Xia Hu, Guanchu Wang, Na Zou
2026-08-11
Agent Harness
LLM Agent
可观测性
基准测试
工程系统
首个聚焦 LLM 智能体获取阶段隐私泄露的基准,含 1182 个用例
Mingxuan Zhang, Jiahui Han, Dadi Guo, Songze Li, Guanchu Wang, Na Zou,...
2026-08-10
Benchmark
LLM Agent
工具调用
数据最小化
隐私审计
让单一策略同时扮演行动者与环境,内化世界模型以摆脱外部环境依赖。
Zishan Xu, Zhiyuan Yao, Yuxin Chen, Yifu Guo, Zhengxi Lu, Yuquan Lu, Jinyang...
2026-08-07
LLM Agent
Test-time Scaling
世界模型
工具调用
强化学习
通过任务分解、执行记忆与验证修复,构建可跨后端迁移的长时程智能体框架
Jingsheng Zheng, Xinyuan Fang, Jintian Zhang, Zhengke Gui, Huajun Chen, Ningyu Zhang
2026-08-06
AgentIF-OneDay
LLM Agent
任务分解
执行记忆
跨后端迁移
系统综述让代码智能体从软件反馈中持续自我进化的方法与分类框架
Hao Zhou, Haichuan Hu, Ye Shang, Quanjun Zhang
2026-08-06
LLM Agent
代码智能体
强化学习
综述
自我进化
提出评估智能体在长任务流中持续学习与技能演化的动态基准
Tianyi Guan, Yiding Wang, Haotong Yang, Siyuan Cao, Shirui Liu, Yi Hu, Jiaqi...
2026-08-05
LLM Agent
上下文学习
基准评测
持续学习
智能体技能学习
把技能生成建模为顺序编辑过程,用回滚奖励训练技能编辑策略
Junhao Shen, Zhanqiu Zhang, Yiwen Guo, Hong Cheng
2026-08-04
Agent技能生成
GRPO
LLM Agent
强化学习
技能编辑
构建误导知识评测框架MisKnow-Agent,单篇假文档即令54.7%的研究报告采信虚假结论。
Pengyu Zhu, Lijun Li, Longju Yang, Sen Su
2026-07-31
Deep Research Agent
LLM Agent
RAG鲁棒性
可靠性评估
红队测试
把记忆重构为五原语生命周期,以验证式压缩实现线性成本与保真。
Gaurav Dadhich
2026-07-27
LLM Agent
上下文压缩
上下文管理
智能体记忆
检索增强
引导智能体构建平台原生可编辑 DAG 数据流水线,弥合 NL2Pipeline 鸿沟。
Runming He, Zhen Hao Wong, Hao Liang, Zimo Meng, Chengyu Shen, Xiaochen Ma,...
2026-07-22
Claude Code
DAG
LLM Agent
MCP
工作流合成
首个通用医学影像自主多智能体建模框架,以数据条件规划与验证引导搜索,19/20任务超越基线。
Shengyuan Liu, Jia-Xuan Jiang, Boyun Zheng, Cheng Wang, Zipei Wang, Wentao...
2026-07-15
LLM Agent
医学影像
可审计AI
多智能体系统
自主机器学习工程