找到 364 条结果

提出全模态智能体基准OmniGAIA和原生全模态基础智能体OmniAtlas

Xiaoxi Li, Wenxiang Jiao, Jiarui Jin, Shijian Wang, Guanting Dong, Jiajie... 2026-02-27
基准测试 多模态 工具使用 推理 智能体

提出四维可靠性度量体系,揭示前沿模型能力提升远快于可靠性改善

Stephan Rabanser, Sayash Kapoor, Peter Kirgis, Kangheng Liu, Saiteja Utpala,... 2026-02-19
AI Agent 可靠性评估 基准测试 安全关键系统 模型评估

提出SAW-BENCH基准测试,评估多模态模型在第一人称视角下的空间情境感知能力

Chuhan Li, Ruilin Han, Joy Hsu, Yongyuan Liang, Rajiv Dhawan, Jiajun Wu,... 2026-02-19
具身智能 基准测试 多模态基础模型 情境感知 空间推理

首个阿片类药物危机图学习基准,涵盖5个数据集,系统评估图学习方法在真实场景中的表现。

Tianyi Ma, Yiyang Li, Yiyue Qian, Zheyuan Zhang, Zehong Wang, Chuxu Zhang, Yanfang Ye 2026-02-19
图学习 基准测试 异构图 超图 阿片类药物危机