← 前一天
2026-08-20
后一天 → 今日

让15个前沿大模型各管一家足球俱乐部20年,测谁会“经营”而不只是“执行”。

Tianyou Wang, Chongyang Gao, Kezhen Chen, Chen Dong, Yinghao He, Donghan Li,...
LLM Agent 基准测试 多智能体竞技场 行为能力分解 长程决策

循环语言模型在组合式工具调用上优势显著,自适应推理带来更优的计算-性能权衡

Andrei Cristian Popescu, Haitz Sáez de Ocáriz Borde, Pietro Liò
AI Agent 工具调用 循环Transformer 测试时计算 自适应推理