找到 62 条结果

同一模型经不同语言接口自博弈对打,实力与策略系统性偏移,英语最强、希伯来语最弱。

Bobby Cheng, Adam Gaber, Zhengyuan Liu, Catherine Arnett, Omer Goldman,... 2026-08-27
LLM评估 多语言NLP 文本博弈环境 智能体评测 自博弈

提出ReMEMBER,以上下文缺口为条件检索并精炼历史证据,提升流式摘要记忆召回

Hyangsuk Min, Hwanjun Song 2026-08-11
LLM评估 基准构建 检索增强生成 流式对话摘要 长上下文记忆

构建覆盖15个领域433项技能的数据智能体综合评测基准

Zhaoyan Sun, Shan Zhong, Daizhou Wen, Jiaxing Han, Guoliang Li, Ying Yan,... 2026-07-03
LLM评估 任务生成 基准测试 技能提取 数据智能体

首个评估AI端到端自主科学研究能力的基准,40任务10领域揭示当前系统距可靠重发现差距巨大

Wanghan Xu, Shuo Li, Tianlin Ye, Qinglong Cao, Yixin Chen, Hengjian Gao,... 2026-06-08
LLM评估 基准测试 科学研究评估 端到端任务 自主研究代理