找到 364 条结果

由1000余位专家贡献、覆盖7大专业领域的1346道开放性长程任务评测基准,并配套提出ShotJudge校准式自动评判框架。

Xue Liu, Xin Ma, Yuxin Ma, Yongchang Peng, Duo Wang, Zhoufutu Wen, Ge Zhang,... 2026-04-06
LLM评测 专家级任务 基准测试 开放域生成 提示工程

首个覆盖17种语言、3400张数字+拍照文档的多语言解析基准,揭示开源模型在拍照与非拉丁脚本上大幅崩塌

Zhang Li, Zhibo Lin, Qiang Liu, Ziyang Zhang, Shuo Zhang, Zidun Guo, Jiajun... 2026-04-03
VLM评测 基准测试 多语言OCR 文档解析 真实场景

提出MYPHONEBENCH框架,评估手机代理在完成任务时的隐私行为

Zhengyang Tang, Ke Ji, Xidong Wang, Zihan Ye, Xinyuan Wang, Yiduo Guo, Ziniu... 2026-04-02
Agent安全 GUI交互 基准测试 手机代理 隐私评估

构建30个物理论文复现任务,评估AI智能体端到端科研复现能力,发现最佳系统仅34%正确率

Shi Qiu, Junyi Deng, Yiwei Deng, Haoran Dong, Jieyu Fu, Mao Li, Zeyu Li,... 2026-03-31
代码智能体 基准测试 物理研究 科学AI 论文复现