论文

评估预测智能体的策略推理能力

Evaluating Strategic Reasoning in Forecasting Agents

智能体系统Agent任务评测

摘要

预测基准能产生准确率排行榜,却很少揭示为什么一些预测者比另一些更准确。我们提出Bench to the Future 2(BTF-2),包含1,417道回溯预测(pastcasting)题目和一个冻结的1,500万文档研究语料库,智能体在其中可离线地进行可复现的研究与预测,产生完整的推理轨迹。BTF-2能够检测0.004 Brier分数的准确率差异,并可区分各智能体在研究与判断方面的差异化优势。我们构建了一个比任何单一前沿智能体准确0.011 Brier分数的预测器,并用它在没有事后偏差的情况下评估智能体的策略推理。我们发现,更优的预测器的主要差异在于它对自身盲点的事前剖析(pre-mortem)和对黑天鹅事件的考量。专家级人类预测者发现,前沿智能体最主要的策略推理缺陷在于:评估政治和商业领袖的动机、判断他们兑现既定计划的可能性,以及对制度过程的建模。

评估预测智能体的策略推理能力:论文配图
图 1:前三位前沿代理和 SOTA 预报员的校准曲线 (N=1367N=1367)。虚线对角线表示完美校准。 SOTA 预报器表现出明显更好的校准,紧密跟踪对角线。 Brier 分数在括号内。