找到 364 条结果

首个游戏开发基准测试,评估LLM智能体在复杂多模态游戏开发任务中的表现

Wayne Chi, Yixiong Fang, Arnav Yayavaram, Siddharth Yayavaram, Seth Karten,... 2026-02-12
Godot引擎 基准测试 多模态理解 智能体评估 游戏开发

提出FactCheck基准,系统评估LLM在知识图谱事实验证中的能力、RAG效果与多模型共识策略

Farzad Shami, Stefano Marchesin, Gianmaria Silvello 2026-02-12
RAG 事实验证 基准测试 多模型集成 大语言模型

基于真实论文构建的生物学实验推理基准,评估LLM因果推理能力

Junting Zhou, Jin Chen, Linfeng Hao, Denghui Cao, Zheyu Wang, Qiguang Chen,... 2026-02-06
基准测试 大语言模型 实验推理 生物信息学 科学评估