LLM 稀疏引导多智能体同时学习内部搜索与外部协作
Zi-Bo Qin, Feng-Feng Wei, Tai-You Chen, Wei-Neng Chen
2026-05-04
分布式优化
多智能体系统
大语言模型
群体智能
黑盒优化
用潜空间递归把异构LLM智能体连成环路,以端到端梯度共同优化整个多智能体系统。
Xiyuan Yang, Jiaru Zou, Rui Pan, Ruizhong Qiu, Pan Lu, Shizhe Diao, Jindong...
2026-04-29
多智能体系统
推理时计算扩展
潜空间推理
递归计算
提出 OMC 框架,把多智能体系统抽象为可招聘、可组织、可进化的「AI 公司」,在 PRDBench 上以 84.67% 的成功率超越所有基线 15.48 个百分点。
Zhengxu Yu, Yu Fu, Zhiyuan He, Yuxuan Huang, Lee Ka Yiu, Meng Fang, Weilin...
2026-04-28
AI 智能体组织
任务分解
多智能体系统
异构智能体编排
树搜索
用TAS辩证推理抑制多智能体LLM的角色归因偏差(AOA)
Bobo Li, Rui Wu, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu
2026-04-28
RLHF/RL对齐
可解释性
多智能体系统
推理
认知偏差
构建 PlayEval 基准与 PlayTester 多模态测试代理,提出 PlayCoder 多智能体框架通过"视觉驱动测试+自动修复"闭环修复 GUI 代码的隐性逻辑缺陷。
Zhiyuan Peng, Wei Tao, Xin Yin, Chenhao Ying, Yuan Luo, Yiwen Guo
2026-04-22
GUI 应用
LLM Agent
代码生成
基准测试
多智能体系统
端到端语音模型集成推理与工具调用,任务完成率从34.88%提升至74.57%。
Tianle Liang, Yifu Chen, Shengpeng Ji, Yijun Chen, Zhiyang Jia, Jingyu Lu,...
2026-04-21
LLM智能体
多智能体系统
工具调用
思维链推理
端到端语音对话
用话语树+全局承诺+多agent迭代精炼,把论文变成结构清晰的演示稿。
Tarik Can Ozden, Sachidanand VS, Furkan Horoz, Ozgur Kara, Junho Kim, James...
2026-04-16
RST理论
多智能体系统
自动文档生成
论文转演示稿
话语分析
AiScientist通过文件总线协议和分层团队实现长期ML研究自动化
Guoxin Chen, Jie Chen, Lei Chen, Jiale Zhao, Fanzhe Meng, Wayne Xin Zhao,...
2026-04-15
多智能体系统
状态持久化
自动化研究
论文复现
长期工程
发现CUA在良性指令下因环境威胁存在严重安全漏洞,多智能体系统加剧此问题。
Xuwei Ding, Skylar Zhai, Linxin Song, Jiate Li, Taiwei Shi, Nicholas Meade,...
2026-04-15
任务分解
多智能体系统
安全评估
环境嵌入威胁
计算机使用代理
多智能体SDD流水线加入相位级上下文锚定钩子,缓解幻觉API与架构违规
Pardis Taghavi, Santosh Bhavani
2026-04-15
LLM软件工程Agent
SWE-bench
上下文锚定
多智能体系统
工具增强验证
在纽约市导航多智能体仿真中,蓝队与红队通过KTO迭代对抗训练,揭示LLM可学会有选择的信任与欺骗,但仍高度脆弱。
Aarush Sinha, Arion Das, Soumyadeep Nag, Charan Karnati, Shravani Nag,...
2026-04-15
KTO
LLM智能体
多智能体系统
对抗对齐
欺骗与信任
提出多智能体框架追踪数据集演化谱系,揭示结构冗余和基准污染
Yu Li, Xiaoran Shang, Qizhi Pei, Yun Zhu, Xin Gao, Honglin Lin, Zhanping...
2026-04-14
后训练数据
多智能体系统
数据污染
数据谱系
数据集演化
首个应用层 AI 智能体编排操作系统,支持 12 拓扑与 8 模块质量保障
Varun Pratap Bhardwaj
2026-04-09
LLM操作系统
多智能体系统
智能体编排
模型路由
设计契约
首个评估LLM自主发现软件bug能力的游戏基准,30个游戏124个bug,最优模型仅发现48.39%
Shufan Jiang, Chios Chen, Zhiyang Chen
2026-04-08
LLM代理
基准评测
多智能体系统
自主bug发现
质量保证
基于多智能体架构的学术文献发现与深度理解平台,支持跨源检索、知识图谱构建和自动化评审
Komal Kumar, Aman Chadha, Salman Khan, Fahad Shahbaz Khan, Hisham Cholakkal
2026-04-08
多智能体系统
大语言模型
文献发现
知识图谱
研究自动化
首个评估 AI 智能体在动态冲突信息环境中维护正确信念能力的基准
Haonian Ji, Kaiwen Xiong, Siwei Han, Peng Xia, Shi Qiu, Yiyang Zhou, Jiaqi...
2026-04-07
AI 基准测试
信息融合
动态推理
多智能体系统
通过微尺度合成数据集使MLE任务的轨迹级在线强化学习成为现实
Yuhang Zhou, Lizhu Zhang, Yifan Wu, Jiayi Liu, Xiangjun Fan, Zhuokai Zhao, Hong Yan
2026-04-07
合成数据
多智能体系统
强化学习
智能体
机器学习工程
提出LLMA-Mem记忆框架,揭示多智能体系统中团队规模与终身学习的非单调扩展关系
Shanglin Wu, Yuyang Luo, Yueqing Liang, Kaiwen Shi, Yanfang Ye, Ali Payani, Kai Shu
2026-04-07
LLM智能体
协作学习
多智能体系统
终身学习
记忆机制
多智能体RL系统,首次在3场Codeforces现场赛中击败所有人类选手夺冠
DeepReinforce Team, Xiaoya Li, Xiaofei Sun, Guoyin Wang, Songqiao Su, Chris...
2026-04-06
GRPO
LLM推理
多智能体系统
强化学习
竞技编程
自主多智能体进化框架用于开放性发现
Ao Qu, Han Zheng, Zijian Zhou, Yihao Yan, Yihong Tang, Shao Yong Ong, Fenglu...
2026-04-03
LLM智能体
多智能体系统
开放性发现
自主智能体
进化算法