首个系统性评测工具集成推理智能体在工具失败场景下动态重规划与异常恢复能力的基准
标签:
全部
强化学习
扩散模型
大语言模型
基准测试
视频生成
视觉语言模型
世界模型
GRPO
多模态大模型
知识蒸馏
LLM智能体
多智能体系统
智能体
多模态学习
流匹配
具身智能
图像生成
基准评测
代码生成
LLM Agent
检索增强生成
注意力机制
机器人操作
多模态大语言模型
视频理解
可解释性
数学推理
图像编辑
多模态
机器人学习
RLVR
自监督学习
长上下文
后训练
Transformer
工具使用
对比学习
数据合成
视觉-语言-动作模型
推理加速
工具调用
LoRA
多模态推理
RAG
计算机视觉
LLM评估
信息检索
视觉推理
评测基准
高效推理
参数高效微调
扩散语言模型
自蒸馏
综述
Flow Matching
3D重建
模型压缩
自回归生成
持续学习
自回归模型
通过外部执行结构和内部推理策略的协同进化,实现LLM Agent系统的自适应优化
通过意图推断和gap分数路由探测,让智能体理解用户查询背后的隐含信息需求
提出TASTE方法自动生成困难且覆盖广泛工具使用模式的Agent评测任务
通过动态建模搜索边界来减少代理式搜索中的过度搜索,同时保持推理准确性
用于多模态智能体推理的智能体探索策略优化
👍 93通过工具调用重采样解决思考-行动差距,提升智能体推理能力
推进大型多模态模型中的创造性物理智能
👍 21提出MM-CreativityBench基准和affordance-grounded对齐方法,提升LMM在视觉环境中的创造性工具改用能力
提出生成式记忆策略,让LLM智能体学会何时需要记忆辅助以及如何生成任务相关指导
提出模型自适应工具必要性,发现 LLM 工具调用存在知而不行差距
自动化智能体评估的实证研究
👍 3用评估技能+六阶段流水线让 Claude 自动为任意 agent 生成可执行的评估代码
图像库引用协议+ODE把Qwen3-VL平均提升14.1个百分点
让LLM直接用grep/bash搜索原始语料,在多个基准上击败传统稀疏/密集检索器
通过构建4K实体/15万可供性知识库与1.4万任务,系统揭示LLM在部件级创造性工具重用上的根本性短板
首个系统评测 Agent-as-a-Judge 的基准,带工具访问 F1 平均涨 13 点。
用三 Agent 架构与四阶段训练流水线,让 30B 模型在深度搜索与研究任务上比肩百亿参数大模型。
用种子驱动的程序化生成构建无限科学数据仓库与可验证问答基准
评估统一数字智能体在复杂任务中组合视觉、搜索和编码能力的基准测试
提出HDPO强化学习框架,解耦准确率与工具效率奖励,教会多模态智能体Metis“何时不用工具”。
SkillX:为智能体自动构建技能知识库
👍 35通过分层技能表示和自动化构建流程,让LLM智能体高效复用经验
过程验证的多模态智能体基准,评估视觉扩展与知识扩展的协同能力。