找到 364 条结果

首个评估大模型从复杂上下文中学习新知识能力的基准,当前最强模型仅解决23.7%任务。

Shihan Dou, Ming Zhang, Zhangyue Yin, Chenhao Huang, Yujiong Shen, Junzhe... 2026-02-05
上下文学习 基准测试 大语言模型评估 长上下文推理

提出950道高难度多轮幻觉基准,揭示前沿LLM仍存在约30%+的幻觉率

Dongyang Fan, Sebastien Delsad, Nicolas Flammarion, Maksym Andriushchenko 2026-02-05
事实性评估 基准测试 多轮对话 大语言模型 幻觉评测

首个针对日语金融语言理解的基准,揭示主流LLM在隐式意图识别和术语抽取上的系统性短板

Xueqing Peng, Ruoyu Xiang, Fan Zhang, Mingzi Song, Mingyang Jiang, Yan Wang,... 2026-02-03
基准测试 大语言模型评估 日语处理 语用学 金融NLP

首个评估视觉指令(草图/箭头)驱动图像编辑能力的分层基准,揭示现有模型在因果推理上的瓶颈

Huanyu Zhang, Xuehai Bai, Chengzu Li, Chen Liang, Haochen Tian, Haodong Li,... 2026-02-03
图像编辑 基准测试 多模态交互 视觉指令 评估框架