论文

ForecastBench-Sim:仿真世界预测基准

ForecastBench-Sim: A Simulated-World Forecasting Benchmark

模型评测基准与评测资源

摘要

面向通用AI系统的预测基准通常继承真实世界的约束:结果结算缓慢、尾部事件罕见——反事实问题难以评分。我们介绍ForecastBench-Sim——建立在Freeciv(以文明系列为原型的回合制策略游戏)游戏rollout上的仿真世界预测基准。预测者收到固定世界报告(当前游戏状态的结构化快照)——回答关于隐藏未来状态的问题;基准随后继续仿真并为预测评分。因为世界被仿真——同一设定可生成任意时间视界的连续或二元预测问题——为条件或因果问题配对干预世界——以及罕见或破坏性结果的已结算示例。我们描述基准管线、问题族、评分协议与发布工件——并报告来自模型评估与匿名人类试点的验证切片。ForecastBench-Sim旨在补充真实世界预测基准——为研究动态世界状态下的概率推理提供受控、即时可结算的任务。

ForecastBench-Sim:仿真世界预测基准:论文配图
图 1:ForecastBench-Sim 评估受控模拟世界中隐藏的未来状态的预测。向预报员显示固定报告;未来的回合将被保留,直到模拟继续进行并评分。相同的机制还支持针对条件或因果问题的配对保存游戏干预。