← 返回 2026-08-20

FM-Bench:竞争智能体长程管理能力基准 FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents

Tianyou Wang, Chongyang Gao, Kezhen Chen, Chen Dong, Yinghao He, Donghan Li, Wangcheng Xu, Hongjiu Zhang, Chi Li 📅 2026-08-19 👍 20 2026-08-25 18:30
LLM Agent 基准测试 多智能体竞技场 行为能力分解 长程决策

让15个前沿大模型各管一家足球俱乐部20年,测谁会“经营”而不只是“执行”。

前置知识

LLM Agent 与工具调用

大模型智能体通过调用预定义工具(函数)与环境交互:读取状态、执行动作、推进时间。本文中每个决策点都是一个全新对话,智能体通过 26 个模式化工具(如 get_squad、make_transfer_offer、invest、advance)操作俱乐部,每个决策点有 30 次查询、10 次谈判动作的预算,轮次软上限 40。

整个基准的交互形态就是“读—行动—advance”的工具调用循环,理解工具接口与预算约束是看懂实验设计和行为指标的入口。

长视野决策与累积后果

指动作影响跨越数百步、数年才显现的序贯决策问题:早期错误会复利式放大,青训、设施等慢回报投资必须与眼前收益权衡,且表现按季逐段累积而非一次结算。本文一个 episode 约 340–400 个决策点、20 个游戏年、4800 场模拟比赛。

论文的核心主张是“短视野基准测不出管理能力”,终局意识、信用分配等六项行为能力的定义全部源于长视野属性,短会话中这些问题根本不存在。

反适应环境(counter-adaptive environment)

环境会对智能体暴露出的策略做出反应:本文中报价被拒绝会抬高卖方隐藏要价,与同一俱乐部重复交易触发加价(连便宜货也加),谈判刷屏触发冷却期。因此没有固定策略能持续最优,赢家策略也会因使用而衰减。

它是 Arena 赛道(冠军在 10 个模型间轮换)与 solo 赛道(前四名王朝固化到第 20 年)差异的机制根源,也是“价格发现全军覆没”这一关键分析的背景。

确定性引擎与种子(seed)

整个世界(选秀池、球员成长、比赛、谈判随机数)都由种子确定性生成:RNG 以 (domain, entity, day) 为计数器,无墙钟依赖。同一种子下唯一变量是智能体的决策;结果文件盖上引擎 commit、参数哈希与全套旋钮即可位级重放。

确定性是评测方法论的基石——跨模型可比、可审计、行为指标可通过对已记录 run 的位级重放挖掘,而非事后主观解读。

Spearman 秩相关系数

衡量两组排名单调关系的非参数统计量 $r_s \in [-1,1]$:+1 表示顺序完全一致,-1 完全相反。本文用 $r_s$ 把六项行为指标与最终得分关联,例如终局意识 $r_s=-0.58$、闲置现金比 $r_s=-0.50$、续约提前量 $r_s=+0.45$。

六能力分解的所有结论都以该系数呈现,且论文用“逐种子符号是否一致”作为证据强度标准(如 token 花费在所有记法下都不显著),读结果表必须理解这一点。

密封投标与隐藏要价

信息不完全市场机制:买方看不到卖方愿意接受的最低价,报价以密封方式提交并按规则清算。本文转会冲突按一价密封投标解决、清算价不披露,被拒后隐藏要价上升,构成对“估值校准”的持续压力测试;oracle 的特权正是直接读出真实接受阈值。

价格发现能力(oracle 每笔成交 1.0 次报价 vs 模型中位 30 次)的测量与分析完全建立在该机制上,理解它才能判断“学不会市场价格”是模型缺陷还是信号缺失。

研究动机

当前对大模型智能体的评测都只覆盖了“管理”的半个定义。第一类是有界任务:SWE-bench、WebArena、OSWorld、AgentBench、ToolBench 等测试模型在短视野内正确选择和排序工具调用,环境是静止的,错误很少复利累积。第二类把单一维度推到极端:Terminal-agent、UltraHorizon 等把执行拉长到数百步,但追逐的是静止世界里的固定交付物;游戏环境(TextWorld 系)奖励反应技能而非经济规划;商业模拟如 Vending-Bench(自动售货机)、CoffeeBench、StockBench、YC-Bench 能跑数月到数年的模拟时间,但“环境不反击”——市场不会因智能体的行为而改变,StockBench 甚至只是回放智能体无法推动的真实行情。竞争维度上,Arena 式排名(Chatbot Arena)让模型两两投票但彼此从不交互,Cattle Trade 与 Vending-Bench Arena 只覆盖单会话或 3 个模型。换言之,没有任何基准同时满足真实管理的四个定义性要求:重要状态永久隐藏、动作后果跨年累积、环境对暴露的行为反适应、战绩与财务纪律被联合评判。

本文的目标是本文的目标是构造一个完整度量“管理能力”的基准 FM-Bench:让一个 LLM 智能体在确定性的 20 游戏年足球经理环境中经营一家俱乐部——用与其他 15 家俱乐部完全相同的固定预算选秀组建 25 人阵容、买卖球员、谈判合同、投资设施与青训、排兵布阵,并接受一个可以解雇它的董事会的考核。具体目标有四:(1) 全程由确定性机制计算评分,逐季荣誉直接累积进总分,没有任何 LLM 评审或人工评分;(2) 提供两条赛道——每个模型对冻结脚本世界的 solo 赛道测绝对能力,15 个前沿模型加脚本锚在同一个共享世界中竞争 20 年的 Arena 赛道测竞争表现;(3) 把标量排行榜分解为可解释的行为能力剖面,回答“为什么排在这里”而不只是“排在哪里”;(4) 校准出可解释的参照系:底部三个免费脚本锚、顶部一个只多给信息不给权限的 oracle、以及六名人类首玩玩家。

与已有工作不同的是,本文的独特切入有三点。其一是概念操作化:把“管理”定义为长视野 × 竞争智能体 × 组织存活的交集,并为四个抽象要求各配一个具体游戏机制、针对性能力和校准旋钮(Table 1),使“测管理”从口号变成可复现的工程。其二是记忆设计:每个决策点都是全新对话,聊天历史不跨点保留,唯一的跨点状态是智能体自己写的 notebook——“决定给未来的自己留什么”因此本身成为被测能力,而不是由脚手架用截断、摘要或检索隐式决定(那会把分数部分归功于 harness 而非模型)。其三是参照系校准:底部有 random(乱做)、idle(不做)、heuristic(纪律严明的盲脚本管理)三个免费确定性锚,顶部有特权只是“读取真实隐藏状态、仍走同一 26 工具接口与预算”的 oracle 脚本,人类玩家构成第三方参照;据作者所知,这也是首次让 15 个前沿模型在同一持续 20 年的经济体中作为竞争者被评测。

核心方法

直觉上,FM-Bench 把足球经理游戏的决策层整体剥离出来交给 LLM:一个确定性引擎逐日模拟世界,只在“决策点”暂停等待输入。一个 run 是 16 队职业联赛中的 20 个赛季(每年 360 天、30 轮双循环),任一时刻约 470 名球员存活,20 年累计约 2000 名球员,无任何真实球员姓名以杜绝记忆泄漏。技术路线上,每季有 13 个定时决策点(季前董事会、夏窗开启/截止、阵容锁定、三个月度报告、冬窗开启/截止、季中评估、季末结算、青训报到),外加约 6 个/季的事件触发点(收到报价、合同到期、主力重伤、董事会警告、破产预警等),完整 run 中位 374 个决策点(341–390)。每个决策点时钟冻结,引擎推送统一数据包:一屏状态摘要(联赛排名、积分、赛季目标、现金、工资比、董事会信心、伤病、下一场、开放窗口、警告)、自上次以来的全部事件收件箱(19 类事件、需处理项标红)、在途报价、智能体最近 10 次状态变更动作、以及它的 notebook;智能体用 26 个工具做任意多轮“查询—行动”,最后调用 advance 让世界推进到下一站。最终分数逐季累积成一个复合分,全程无 LLM 评审。

核心创新是把“管理的四个定义性要求”逐条机制化为可校准的具体机制(Table 1)。隐藏信息:球员真实能力、潜力与 traits(伤病倾向、成长率、衰老起点)对所有人隐藏——包括持有者自己;球探只返回带永久个人偏差的区间,估值校准成为跨季统计推断,而赛季数据、合同、财务保持精确。累积后果:青训与设施投资多年后才见效,破产与信心崩溃复利恶化但可恢复,每季荣誉直接进入总分。反适应市场:被拒报价抬高隐藏要价、重复交易抬价、谈判轰炸触发冷却,固定策略必然衰减。多目标压力:董事会按随阵容强度缩放的赛季目标联合评判战绩与财务。评分设计同样关键:$S_{\text{raw}} = 18\ln(1+\max(H,0)/60) + 10\,\mathrm{sign}(VA)\ln(1+|VA|/40) + 6\ln(1+\max(M,0)/80)$,三通道对数压缩且不封顶;提前结算折价 $\rho = 0.8(t/T)^{1.5}$ 只乘正部,使“被提前解雇止损”永远不优。与已有工作的本质区别在于:环境会反击、关键状态永久隐藏、记忆是被测对象、分数完全由机制计算而非裁判评判。

方法步骤详情

完整流程五步。第一步开局:所有俱乐部是相同空壳(声望 70、38,000 座球场),从共享 50 模板池、1 亿信用预算中独立选秀 25 人(各队选中可重复、互不干扰),未花预算加 500 万补贴成为期初现金。第二步循环:引擎逐日模拟,仅在决策点暂停;“不行动”是保守而非致命——报价 10 天后过期、阵容战术持续生效、最多 10 条常设指令(如“高于 2 倍估值的报价自动接受”)在站间自动执行,但被刻意做得太弱,无法替代逐站判断。第三步站内行动:12 个查询工具(get_squad、get_transfer_market、get_finances 等)花 30 次查询预算;11 个动作工具(make_transfer_offer、offer_contract、list_player、release_player、promote_youth、invest、set_lineup、set_tactics 等)花 10 次谈判预算;2 个免费 notebook 工具(append_note / rewrite_notes);最后 advance 结束本站。第四步评分:$H$ 为累计荣誉分(冠军 +100、前四 +20,通道参数对 0 封底);$VA$ 为最近三季按 4%/年折现的净值均值减去同种子第 0 天基线(净值 = 现金 + 阵容值×0.8 流动性折扣 + 在建设施×0.5 − 未付转会费负债;超过年工资单 3 倍的现金按 0.3 计的“反囤积”折扣);$M$ 为三季折现平均阵容值作低权重稳定项;被解雇或破产触发至多 3 次有上限复活、第 $k$ 次按 $0.8^k$ 折价。第五步行为分析:对通过位级重放验证(30/30 零漂移)的结果日志挖掘六指标——终局意识(17–20 年减 2–16 年的慢回报行动率)、信用分配(季末现金/净值比)、主动控制(续约提前月数中位)、价格发现(每笔成交报价次数)、记忆策展(季末 notebook 的 TF-IDF 余弦相似度)、计算效率(每百万 token 得分)。

技术新颖性

技术新颖性有四层。(1) 机制层面:四个需求不是提示词修饰,每个都有针对性能力与校准杠杆;校准只在免费脚本锚上做、在任何计分 run 前冻结,且须同时保持四条判据——阶梯单调(random < idle < heuristic < oracle)、区分度、oracle 上限为正、不饱和。(2) 评分层面:附录 I 证明四条性质——无“提前退出止损”套利(Proposition A.1)、通道单调性(A.2)、公允价转会对 VA 通道中性(A.3,$\Delta N = -p + \lambda v < 0$)、收益递减(A.4:第 $k$ 个冠军值 $18\ln\frac{60+100k}{60+100(k-1)}$,即 17.7、8.7、5.9…分),并给出 ≈145 的宽松上界说明基准不会饱和。(3) 评测设计层面:oracle 的特权只是信息而非权限,第一次把“信息优势值多少分”量化(95.54 vs 90.94);记忆契约把 harness 差异清零,使模型间唯一差异是“它选择写了什么”。(4) 分析层面:从 outcome 排行榜走向行为级分解(呼应 AgentAtlas 的主张),且诚实报告失败指标——警告暴露、青训收成因分种子符号不稳被弃用并保留在记录中。

How a run works
Figure 1: How a run works

实验结果

核心发现可分五块。(1) Solo 排行榜(3 种子均值):claude-fable-5 以 90.94±5.20 居首,达到特权 oracle(95.54±4.68,可读全部隐藏真值)的约 95%,约为宽松上界 145 的三分之二,说明量表不饱和;kimi-k2.6 88.49±0.15 是全场最稳(种子间波动 0.15 分),gpt-5.6-terra 86.66、gpt-5.6-sol 86.40 紧随;claude-haiku-4.5 仅 36.90±22.73。脚本锚 heuristic 17.05、idle −0.90、random −17.21;15 个模型全部完成 20 年,而盲脚本锚在其 9 次 run 中 7 次中途出局。规模、价格、厂商都不预测名次:开源 kimi-k2.6 压过两个 GPT 旗舰,token 花费与名次在任何记法下都不相关。(2) 时间动态:第 5 年的分数差仅 17.2 分、与最终排序的秩相关只有 0.19,第 15 年才升至 0.78;deepseek-v4-pro 第 5、10 年都领跑却最终第 12,赢家第 5 年仅列第 5——短视野评测会得出不同的结论。(3) Arena(seed 7 单一世界):claude-fable-5 76.26、muse-spark-1.1 62.47、deepseek-v4-pro 52.09;脚本锚 t≈2.6 年最先出局,两个最弱模型耗尽 4 次复活;联赛冠军在 10 个不同模型间轮换(卫冕冠军仅 2/19 次连庄,总冠军只拿 4 次),与 solo 赛道前四名霸榜至第 20 年形成对照,直接隔离出反适应市场的作用;gemini-3-flash 第 5 年领跑积分榜却最终第 13。(4) 六能力剖面:终局意识 $r_s=-0.58$(赢家把慢回报投资从 2.4 降到 0.8 次/季,gemini-3.5-flash 反而升到 3.3、第 19 年还在建设施)、信用分配 $r_s=-0.50$(赢家闲置现金比 80% vs claude-haiku-4.5 的 196%、全场中位 90%)、主动控制 $r_s=+0.45$(赢家提前中位 18 个月续约、最后一刻续约仅 4%,claude-opus-4.8 中位 10 个月、20% 最后一刻)。价格发现全军覆没:oracle 每笔成交 1.0 次报价,模型中位 30 次、最好 9 次、最差 73 次(单种子达 133),数百次被拒报价教会不了任何模型市场的真实价格;记忆呈两极失败——gpt-5.6-sol 相似度 0.91(只增不删的档案堆),claude-sonnet-5 0.20 与 qwen3.7-max 0.23(每季彻底重写),赢家 0.39 居中。Token 花费跨度 7 倍(28M–194M)但 $r_s=-0.19$、p>0.38。(5) 人类对照:6 名首玩玩家 4 人被解雇出局(全部低于 heuristic 锚),完成者 74.64 与 59.95,最强者也比 claude-fable-5 低 16 分、只与最差模型梯队相当;但人类会推导不变规则、中途修订失败策略、自建外部工具——恰是模型缺失的能力。

The four demands
Table 1: The four demands
The Solo track results
Table 2: The Solo track results
The six first-play human runs
Table 3: The six first-play human runs
The roster: 15 frontier LLM seats plus one scripted anchor, July 2026
Table 5: The roster: 15 frontier LLM seats plus one scripted anchor, July 2026
The five competence levers
Table 6: The five competence levers
Per-model profiles over the three seeds
Table 7: Per-model profiles over the three seeds
Solo season snapshots (seed 1)
Table 8: Solo season snapshots (seed 1)
Arena season snapshots (seed 7, one shared world)
Table 9: Arena season snapshots (seed 7, one shared world)
The 26-tool interface
Table 10: The 26-tool interface
The decision-stop calendar
Table 11: The decision-stop calendar
The four memory layers
Table 12: The four memory layers
One 20-year run, by the numbers
Table 13: One 20-year run, by the numbers
Per-season solo trajectories for all 15 models in four channels
Figure 2: Per-season solo trajectories for all 15 models in four channels
Credit assignment
Figure 3: Credit assignment
Proactive control
Figure 4: Proactive control
Capability matrix over the 15 solo models, six axes
Figure 5: Capability matrix over the 15 solo models, six axes
Arena trajectories, all 16 seats
Figure 6: Arena trajectories, all 16 seats
Final score per model, mean with standard deviation over the three seeds
Figure 7: Final score per model, mean with standard deviation over the three seeds
Transfer offers per season, solo track
Figure 8: Transfer offers per season, solo track
Transfer offers per season in the Arena
Figure 9: Transfer offers per season in the Arena
Season-by-season cumulative API cost vs. composite score, solo track
Figure 10: Season-by-season cumulative API cost vs. composite score, solo track
Memory-curation regimes on the solo track
Figure 13: Memory-curation regimes on the solo track
Compute allocation
Figure 14: Compute allocation
The asset channels behind Figure 6
Figure 15: The asset channels behind Figure 6
查看结构化数据
任务指标本文基线提升
Solo 赛道:20 年俱乐部管理(15 模型对脚本世界,3 种子) 最终复合分 $S_{final}$(均值±标准差) claude-fable-5:90.94 ± 5.20 特权 oracle 95.54±4.68;纪律脚本 heuristic 17.05±12.34;idle −0.90;random −17.21 达到 oracle 的约 95%、比 heuristic 高约 74 分;15/15 模型完成全程而盲锚 9 run 中 7 次出局
Arena 赛道:15 模型 + 脚本锚共享一个 20 年世界(seed 7) 最终复合分 $S_{final}$ claude-fable-5:76.26(0 次死亡,完成全程) 第二名 muse-spark-1.1 62.47;脚本锚 0.13(t≈2.6 年被解雇);末两位耗尽 4 次复活 领先第二名 13.79 分;但联赛冠军在 10 个模型间轮换,solo 前十只有部分在 Arena 保持前列
价格发现(solo 转会市场) 每笔完成签约的报价次数(越低越好) claude-fable-5:9 次(全场最佳) oracle 1.0 次;模型中位 30 次;最差 gemini-3.5-flash 73 次(单种子最高 133) 仍比 oracle 差 8 倍;没有任何模型从数百次被拒中学到隐藏接受阈值
对人首玩玩家(同一 20 年赛道) $S_{final}$ claude-fable-5:90.94(solo 三种子均值) 6 名首玩人类:最好 74.64(10 小时、394 站),最差 −3.78;4/6 被解雇 领先最佳人类 16 分;前沿模型位于未经训练的人类与 oracle 之间
种子稳定性 3 种子 $S_{final}$ 标准差 kimi-k2.6:0.15(全场最稳) claude-haiku-4.5:22.73(最不稳);另有 4 个模型摆动超过 20 分 说明均值接近的模型实际风险迥异,单种子榜单不可靠

局限与改进

作者明确承认的限制:solo 只有 3 个种子,足以显示相邻模型不可分、模型间离散度差异巨大,但不足以对任意一对模型做推断性比较(4 个模型种子间摆动超 20 分);Arena 是单一 seed-7 世界、无误差条,几分之内的座次应视为平手,多世界聚合的排名方法留作未来工作;solo 的 15 个对手是纪律严明的手写脚本,不建模自适应对手经理(Arena 才是对抗补全,而非写实声明);构念效度上 FM-Bench 只在一个域实例化长视野管理,四需求虽是领域通用设计目标,但排名向其他长视野设置的迁移未经验证;行为指标是相关性的,$n=15$ 的系数只是指示性的,警告暴露指标分种子符号不稳(+0.45/+0.07/−0.78)被证明受混杂。我自己的观察:(1) 单模型单次 Arena 的运气方差可能不小,一两笔关键转会的成败会级联放大;(2) 固定 prompt 与 harness 可能系统性偏爱某些工具调用与输出风格;(3) 六能力缺因果证据(notebook 消融、计划注入未做);(4) 人类样本仅 6 人且均为首玩,“模型强于人”的结论强度有限;(5) 论文披露早期曾流传一个混入旧 run 数据的 token 汇总文件,提醒 token 类结论须以重算清单为准。

独立分析的弱点

独立分析的弱点:(1) 统计功效不足——15 模型 × 3 种子加单次 Arena,对相邻名次几乎无分辨力,而“规模、价格、厂商不预测顺序”这类结论建立在单点估计上,改进方向是加种子、跑多个 Arena 世界并做排名聚合。(2) 价格发现失败可能部分是接口问题:被拒只返回“被拒”,没有梯度信息,模型要在隐藏阈值附近盲搜,几乎不可辨识;改进方向是提供市场行情统计工具或报价区间提示,把“估值校准”与“信号提取”两种失败分开测。(3) 行为指标都按整 run 汇总,掩盖策略时间演化(如赢家 solo 的 9 次报价全部集中在前两季、Arena 中却变为 4.6 次/季),可加时间窗分析。(4) 域单一:足球经理的估值—合同—建设结构与公司经营、供应链仍有距离,“管理能力”的普适性声明需要第二个域复刻验证。(5) 成本结构:一次 run 18–191 美元、数小时到数天,学术复现与快速迭代门槛高,可提供缩短版赛道做廉价筛查。(6) 记忆指标用 TF-IDF 对措辞敏感,“0.35 附近最佳带”是经验值,换成语义嵌入可能改变模型排名;论文自己也把它列为未来工作。

未来方向

作者提出的方向:(1) 人机协作测量——人类与模型的行为剖面接近互补(人类会从机制推导不变规则如“一律签满 5 年”、中途修订失败策略、自建外部工具;模型在这些地方系统性缺失),由于两种模式分数同尺,“人+agent 配对是否超过任一单方、增益来自哪项能力”是可直接测量的实验;(2) 多 Arena 世界的排名聚合方法;(3) notebook 消融与计划注入等因果探针,把六能力从相关升级为因果;(4) 用语义嵌入复现 notebook 相似度;(5) Open Track 的 HMAC 签名持续评测。基于本文成果可延伸的:(1) 把六项行为指标作为过程奖励或 RL 目标做微调,检验“管理行为”能否被直接优化,而不只是被选择;(2) 利用确定性引擎做机制消融——分别关闭反适应加价、隐藏信息或荣誉通道,量化每个需求对总分与排序的贡献,回答“哪个需求最能把模型分开”;(3) 把四需求模板移植到公司经营、医院、供应链等域,验证构念迁移;(4) 针对价格发现失败,在 agent 框架里加入显式贝叶斯估值模块(先验 + 被拒更新)再测,分离“模型缺乏市场先验”与“在线学习失败”两种假说;(5) 用 Arena 生态研究多 agent 经济中的策略共适应与联盟行为。

复现评估

复现条件整体良好。代码开源(github.com/Analogy-AI/fm-bench):确定性引擎(计数器 RNG 以 (domain, entity, day) 为键、固定每日相位序、无墙钟),284 项测试套件含 golden-hash 行为守卫、全工具路径位级重放、崩溃恢复等价、AST 真值隔离、观察审计与校准回归;20 年模拟单核 76 秒即可跑完,脚本锚与校准套件在笔记本上免费重跑。每个结果文件盖引擎 commit、参数哈希、分数版本与全套旋钮;计分世界用盐化种子(HMAC-SHA256),回合结束后公开,开放赛道提交需 HMAC 签名并由服务器重放校验;全部 run 的逐轮 transcript、挖掘脚本与数据随仓库发布,30 次重放零漂移,若干中断 run 从 fsync 的动作日志无损续跑。难点在 LLM 侧:solo 一跑消耗 24M–194M token、18–191 美元、需数小时到数天,完整复刻 45 次 solo run + Arena + 人类研究需要数千美元与数周;闭源模型的模型 ID、温度与推荐推理配置随 provider 演化,位级保证只在日志层面成立。总体判断:环境与脚本锚复现容易(笔记本级),模型侧结果复现中等偏难但全程可审计。