提出不确定性感知多智能体框架,让 LLM 编码代理像人类开发者一样识别指令缺失并主动提问。
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
终端代理足以实现企业自动化
👍 98简单的终端代理通过直接API交互可实现高效企业自动化
通过并行分析多条执行轨迹,将智能体经验归纳蒸馏为可跨模型、跨任务迁移的技能文件
用计算图视角统一LLM工作流优化,按结构确定时机分类77篇文献并提出评估协议
将多轮 Agent rollout 解耦为独立 HTTP 服务,提升 RL 训练的可扩展性和可维护性
通过多类型记忆结构和多智能体协作,实现长对话中自适应检索与用户理解
首个可运行的金融工具使用基准,760工具+295题+合规评估
首个针对工具使用智能体的步骤级人类标注基准,揭示当前模型在中性步骤区分上的核心瓶颈
用LLM编码代理自动翻译RL环境,4级验证保等价。
首个多模态多源个性化记忆问答基准 ATM-Bench,SGM 显著优于传统 DM。
HCAPO:用 LLM 自身做后视评分,把稀疏终局奖励拆解到关键步骤上。
分布感知检索模型DARE,23M参数在R包检索上超越SOTA 17%
提出双层架构Mozi,通过治理控制平面和状态化技能图将LLM代理转变为可靠的药物发现协同科学家
面向科研全流程的数据中心化多智能体框架,在六项基准上取得 SOTA 并开源 27B 模型
EMPO²用自我生成记忆与混合RL增强LLM智能体探索与泛化能力
首个通用Agent系统评测:5架构×5模型×6基准的全因子实验
深度研究中的文本排序方法再审视
👍 7系统评估文本排序方法在深度研究Agent中的效果,发现BM25+重排序优于大模型嵌入
通用 LLM 智能体的测试时扩展基准测试
👍 10揭示通用LLM智能体存在性能退化与测试时扩展瓶颈
通过显式提供环境先验信息,让 LLM 智能体学会最优的成本-不确定性权衡
首个配对评估Agent Skill效果的基准,覆盖87任务18配置