找到 364 条结果

300个程序化视觉推理任务+可验证奖励评分器,让视觉生成成为可训练、可验证、可优化的推理媒介

Junxiang Xu, Ruisi Wang, Fanyi Pu, Maijunxian Wang, Ran Ji, Tongxi Zhou,... 2026-08-27
交错生成 原生视觉推理 可验证奖励 基准测试 强化学习

让15个前沿大模型各管一家足球俱乐部20年,测谁会“经营”而不只是“执行”。

Tianyou Wang, Chongyang Gao, Kezhen Chen, Chen Dong, Yinghao He, Donghan Li,... 2026-08-20
LLM Agent 基准测试 多智能体竞技场 行为能力分解 长程决策

首个逐级撤除人类方法指导、评测AI自主科研能力的跨领域项目级基准

Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang,... 2026-08-19
AI for Science 基准测试 大模型评测 智能体框架 自主科研智能体