将LLM多智能体推理从个体层面提升到集群层面,通过神经符号融合实现可扩展、校准良好的群体动态模拟
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
用MARL训练的多智能体系统,4B模型匹敌671B单智能体的广域信息检索能力
首个从长篇科学文本自动生成出版级科学插图的智能体框架与评测基准
提出多智能体框架MEnvAgent,自动构建多语言可验证开发环境,提升软件工程任务的可扩展性。
提出Vibe AIGC范式,用多智能体编排取代单模型生成
将多智能体辩论的推理能力蒸馏到单个LLM,提升推理效率
用两个协作智能体自动构建平衡评测基准并生成可执行评测流程,压缩85%冗余样本、降低77%评测成本
面向多智能体讨论的上下文学习方法
👍 4通过学习动态上下文生成器,解决多LLM讨论中的不一致性问题,提升20%-50%性能
通过四元组抽象动态创建专用子智能体,实现复杂长周期任务的自动化编排。
提出广域研究范式,用动态多智能体架构和端到端RL解决大规模并行信息检索任务
通过解耦KV缓存为共享基缓存和低秩适配器缓存,实现多LoRA智能体系统的内存与计算双重优化
通过策略拍卖扩展小型智能体
👍 5提出基于拍卖的多智能体路由框架SALE,让小型智能体竞标任务,实现成本降低35%且性能超越最大智能体
用多智能体框架将参考图像的抽象隐喻逻辑迁移至新主题,实现真正的创意转译而非像素复制
多智能体协作自动生成出版级学术插图,包含方法图与统计图
使用过程奖励扩展多智能体系统
👍 8通过AI反馈的逐动作过程奖励训练多智能体,解决信用分配和样本效率问题
多智能体框架将自然语言描述转化为可执行、可交互的AI Town游戏场景
首个协作编程基准揭示AI智能体存在'协调诅咒',协作比单干成功率低30%
提出原位自进化范式,通过工具动态合成与优化,使智能体在无监督开放环境中自主提升能力。
首个将学术rebuttal写作重构为证据驱动规划任务的多智能体系统
训练无关的多智能体框架,通过想象、粗筛、精筛三阶段跨模态推理实现组合式图像检索