找到 364 条结果

构建405道自然科学实验预测任务,揭示LLM在实验结果预测与可靠性校准上的双重缺陷

Udari Madhushani Sehwag, Elaine Lau, Haniyeh Ehsani Oskouie, Shayan Shabihi,... 2026-04-14
LLM评估 基准测试 实验预测 校准评估 科学发现

用 3021 道菜、5.27 张/菜的多视角图,系统评测 29 个视觉语言模型在精细分类、营养估计与饮食 VQA 三大任务上的真实能力。

Song Jin, Juntian Zhang, Xun Zhang, Zeying Tian, Fei Jiang, Guojun Yin, Wei... 2026-04-14
Chain-of-Thought VQA 基准测试 多视角 细粒度识别