找到 364 条结果

提出两阶段基准,量化LLM智能体在技能选择与执行中普遍存在的过度授权问题

Shawn Li, Chenxiao Yu, Han Wang, Wei Yang, Ryan Rossi, Franck Dernoncourt,... 2026-05-12
基准测试 工具选择 技能层 智能体安全 最小特权原则

首个由学生真实学术任务驱动的OpenClaw学术级智能体评测基准

Junjie Yu, Pengrui Lu, Weiye Si, Hongliang Lu, Jiabao Wu, Kaiwen Tao, Kun... 2026-05-05
OpenClaw 基准测试 大语言模型 学术任务 智能体评测

提出HIL-BENCH基准与ASK-F1指标,量化智能体在信息缺失时主动求助的判断力

Mohamed Elfeki, Tu Trinh, Kelvin Luu, Guangze Luo, Nathan Hunt, Ernesto... 2026-05-05
人机协作 可验证奖励强化学习 基准测试 智能体评估 选择性升级

把视觉规划重构为单步图像编辑任务EAR,配合AMAZE基准系统评估前沿模型的推理能力。

Zhimu Zhou, Yanpeng Zhao, Qiuyu Liao, Bo Zhao, Xiaojian Ma 2026-04-30
图像编辑 基准测试 扩散模型 空间推理 视觉规划

首个跨六系统、评估 GUI 区域与元素功能理解及交互结果预测的大规模基准

Hongxin Li, Xiping Wang, Jingran Su, Zheng Ju, Yuntao Chen, Qing Li, Zhaoxiang Zhang 2026-04-29
GUI智能体 人机交互 功能理解 基准测试 视觉语言模型

25,000+ 次实验揭示 LLM 智能体执行工作流却不会科学推理

Martiño Ríos-García, Nawaf Alampara, Chandan Gupta, Indrajeet Mandal, Sajid... 2026-04-23
AI for Science LLM智能体 基准测试 科学推理 认知评估

构建 PlayEval 基准与 PlayTester 多模态测试代理,提出 PlayCoder 多智能体框架通过"视觉驱动测试+自动修复"闭环修复 GUI 代码的隐性逻辑缺陷。

Zhiyuan Peng, Wei Tao, Xin Yin, Chenhao Ying, Yuan Luo, Yiwen Guo 2026-04-22
GUI 应用 LLM Agent 代码生成 基准测试 多智能体系统