将多智能体协调建模为在线策略学习问题,通过可审计的策略图动态优化技能、模型和拓扑选择
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
提出共享推理枢纽让多智能体协作交换中间推理过程,提升长周期任务性能
用多智能体+双桥一致性框架在百镜头量级实现角色一致的长视频换脸/风格化重制
基础协议:面向智能体社会的协调层
👍 82面向智能体社会的图优先协调协议,统一身份、组织、价值与审计。
多智能体辩论+3D首帧接地,从一句话生成完整可播短剧。
五机制多智能体自主科研管线,在ARC-Bench上超AI Scientist v2 54.7%
用服务端 HTTP GET 日志自动重建读集,为并发 LLM 智能体实现乐观并发控制。
Agent Bazaar 框架,用 REINFORCE++ 训练 9B 模型实现多智能体市场对齐。
冻结LLM权重,用四智能体+可训练知识图谱的闭环系统让代码生成越用越强。
首个端到端联合优化设计者与执行者的自动多智能体强化学习框架。
首篇将 LLM 多智能体系统全生命周期串成 LIFE 四阶段的统一综述
LLM驱动的多智能体预测框架,分宏观与微观双视角合成预测
剖析工业智能体竞赛的评测设计,揭示排行榜饱和、公私榜失配与评分公式脆弱性
将引用幻觉检测从二分类重定义为12码细粒度分类,提出四模块级联多智能体检测器。
训练免费框架,让多智能体在测试时三尺度协同进化。
提出三层协同演化框架,让多智能体研究系统按用户偏好积累经验并越用越好。
提出在线审计框架,每步对展开中的多智能体轨迹判CONTINUE/ALARM
用共形预测为多智能体失败轨迹生成连续错误区间,支撑可回滚的错误归因
提出 Ctx2Skill 框架,用多智能体自博弈从长技术上下文中自动挖掘自然语言技能,在 CL-bench 上显著提升 GPT-4.1/5.1/5.2 的上下文学习能力。
双层多智能体框架,闭合式自演化技能库,专攻大规模结构化网页抽取