论文

作为未来事件预测基础设施的智能体时间机器

Agentic Time Machine as an Infrastructure for Future-Event Forecasting

智能体系统Agent任务评测

摘要

预测未来事件是大语言模型(LLM)智能体的关键挑战——横跨选举、货币政策到金融市场等领域。但评估该任务的进展面临效率与环境保真间的根本权衡。真实评估基准 suffer 固有的慢反馈回路——而既有回溯重放通常把智能体限制在静态、预冻结的数据库——牺牲实际部署的环境保真。为解决——我们介绍智能体时间机器(TM)——经过滤截止后内容近似重构任意选定过去时间网页状态的基础设施。利用该评估基础设施——我们进一步提出规划者-求解者-聚合者多智能体框架——把每个问题拆成多样分析角度——并行收集证据——并把结果组合为单一预测。实验表明TM下的离线分数与真实FutureX分数强相关——验证TM为预测智能体评估提供快速可靠沙箱。在TM下评估的FutureX-Past与Polymarket上——我们的框架在强闭卷、工具增广与自一致性基线中取得最高分。在官方FutureX真实排行榜上——我们的系统连续四周取得最佳平均排名——含5月第一周第一。截至6月17日——它还在FutureX官方八周总排行榜上排名第一。

作为未来事件预测基础设施的智能体时间机器:论文配图
图 4:我们的规划器-求解器-聚合器多智能体预测框架概述,以最佳影片提名问题为例进行说明。