论文
评估预测智能体的策略推理能力
Evaluating Strategic Reasoning in Forecasting Agents
摘要
预测基准能产生准确率排行榜,却很少揭示为什么一些预测者比另一些更准确。我们提出Bench to the Future 2(BTF-2),包含1,417道回溯预测(pastcasting)题目和一个冻结的1,500万文档研究语料库,智能体在其中可离线地进行可复现的研究与预测,产生完整的推理轨迹。BTF-2能够检测0.004 Brier分数的准确率差异,并可区分各智能体在研究与判断方面的差异化优势。我们构建了一个比任何单一前沿智能体准确0.011 Brier分数的预测器,并用它在没有事后偏差的情况下评估智能体的策略推理。我们发现,更优的预测器的主要差异在于它对自身盲点的事前剖析(pre-mortem)和对黑天鹅事件的考量。专家级人类预测者发现,前沿智能体最主要的策略推理缺陷在于:评估政治和商业领袖的动机、判断他们兑现既定计划的可能性,以及对制度过程的建模。
