FM-Bench:面向竞争智能体长时程管理的基准
FM-Bench: A Benchmark for Long-Horizon Management with Competing Agents
摘要
语言模型智能体现在能够可靠地执行有界任务。但它们能否在长时程中维持有效决策——即动作具有累积后果、环境会回应其选择的情形——在很大程度上仍未被测量。FM-Bench(Football Management Benchmark)正是测量这一点。一个LLM智能体通过26个工具和约340到400个决策停顿运营一家足球俱乐部20个游戏年。它在与所有对手相同的预算下组建阵容、交易球员、谈判合同、投资设施与青训、排定首发,并接受可以解雇它的董事会的问责,同时一个确定性引擎把每一年累积为唯一的最终分数,无需LLM裁判或人类评分员。单人赛道让15个前沿模型各自对抗一个冻结的脚本世界,而竞技场(Arena)把相同模型外加一个脚本锚点放进同一个共享的20年世界;据我们所知,这是该规模上的首次正面对抗评估。我们测量分数背后的六种行为能力。跨三个种子,全部15个模型都完成了每个时程,而盲测脚本基线在它们自己的大多数时程中消亡;claude-fable-5以平均分登顶单人榜,并赢得Arena,尽管冠军头衔在十个模型间轮转。规模、价格和厂商都不能预测排序;排序要到时程后期才稳定;而表现最好的首次游玩人类只落在模型榜的底部。区分模型的是管理行为而非计算量。得分更高的模型会在末期减少慢回报投资、让现金保持投资而非闲置,并在截止日前很早就开启续约,而token开销与结果无关。没有模型能从数百次被拒出价中学到市场的隐藏价格,自管理记忆以两种相反模式失效:只增不减的存档,或每个赛季重写的计划。代码见https://github.com/Analogy-AI/fm-bench。
