论文

KellyBench:长时程序贯决策基准

KellyBench: A Benchmark for Long-Horizon Sequential Decision Making

智能体系统Agent任务评测长程任务评测

摘要

语言模型正在饱和那些目标狭窄的程序性任务基准。但它们正越来越多地被部署在目标开放的长时程、非平稳环境中。本文提出KellyBench,一个用于评估体育博彩市场中序贯决策的环境。智能体被置于2023-24赛季英超联赛的序贯模拟中,任务是最大化其长期资金增长。它们可获得详细的历史数据,包括高阶统计、首发阵容和公开赔率。要想成功,它们必须构建机器学习模型、识别公开市场中的优势(edge),并随环境随时间变化而调整。我们发现,在五个随机种子下,所有被评估的前沿模型在整个赛季中平均都是亏损的。表现最好的模型平均收益为-8%,许多模型在多个种子下出现破产(ruin)。为评判策略成熟度,我们使用人类专家评分量表给每个模型打分,发现其方法与人类基线相比并不成熟;Claude Opus 4.6的量表得分为26.5%,这意味着仍有巨大改进空间。KellyBench已作为开放访问的API端点提供:https://openreward.ai/GeneralReasoning/KellyBench。

KellyBench:长时程序贯决策基准:论文配图
图 1:KellyBench 上的模型性能。 KellyBench 要求模型开发 2023/24 赛季英超联赛的机器学习投注策略,目标是最大限度地提高长期资金增长。没有模型能够在 5 个种子中获得平均回报。模型也无法调整策略来应对失败。出于显示目的,初始资金标准化为 10 万英镑。