找到 364 条结果

研究揭示 LLM 判别器在评估研究问题新颖性时存在严重不可靠性,与人类专家判断存在系统性偏差。

Soumitra Sinhahajari, Navonil Majumder, Soujanya Poria 2026-06-10
LLM-as-Judge 人工对齐 基准测试 研究问题生成 科学创新性评估

首个评估AI端到端自主科学研究能力的基准,40任务10领域揭示当前系统距可靠重发现差距巨大

Wanghan Xu, Shuo Li, Tianlin Ye, Qinglong Cao, Yixin Chen, Hengjian Gao,... 2026-06-08
LLM评估 基准测试 科学研究评估 端到端任务 自主研究代理

提出GENEB基准评估40个基因组模型在100任务上的表现,揭示聚合排名的不稳定性

Daria Ledneva, Mikhail Nuridinov, Denis Kuznetsov 2026-06-08
基准测试 基因组学 基础模型 模型比较 评估协议

首个通用指令式音频编辑综合评估基准,覆盖7种模态和6级复杂度

Ziyang Ma, Ruiqi Yan, Ruiyang Xu, Jie Fang, Zhikang Niu, Yi-Wen Chao,... 2026-06-08
基准测试 多模态 指令跟随 评估范式 音频编辑