找到 60 条结果

面向长会话智能体的记忆评测基准,揭示所有系统依赖推理崩塌。

Seokwon Jung, Alexander Rubinstein, Arnas Uselis, Sangdoo Yun, Seong Joon Oh 2026-05-13
DAG知识图谱 LLM智能体 依赖推理 记忆系统 评测基准

首个平行语音-文本多语言提示数据集,揭示SLLMs在口语指令下的真实能力

Maike Züfle, Sara Papi, Fabian Retkowski, Szymon Mazurek, Marek Kasztelnik,... 2026-03-11
口语提示 多语言 指令跟随 评测基准 语音大模型

373条人工构建查询+人类搜索轨迹,评估搜索智能体深度与广度能力

Yutao Zhu, Xingshuo Zhang, Maosen Zhang, Jiajie Jin, Liancheng Zhang,... 2026-02-10
人机搜索行为 信息检索 大语言模型 搜索智能体 评测基准

用两个协作智能体自动构建平衡评测基准并生成可执行评测流程,压缩85%冗余样本、降低77%评测成本

Shuai Zhang, Jiayu Hu, Zijie Chen, Zeyuan Ding, Yi Zhang, Yingji Zhang, Ziyi... 2026-02-05
具身智能 多智能体系统 自动化评估 视觉语言模型 评测基准