论文

WorldReasoner:评估智能体是否基于有效证据预测事件

WorldReasoner: Evaluating Whether Language Model Agents Forecast Events with Valid Reasoning

智能体系统Agent任务评测

摘要

预测现实事件需要在不完整且受时间限制的信息下推理,单看最终答案准确率无法区分预测与记忆训练事实、伪造引用或无依据因果叙述。WorldReasoner提供已知最终结果的预测问题与模拟预测日期,只允许使用该日期之前的证据,再评估提交的概率、引用和可选因果事件图。框架分别衡量结果质量、引用来源质量和相对于事后参考图的推理质量。智能体构建流程从14,141篇文章生成345项已解决任务,事件图覆盖8,087个提取事件。在六种受控配置中,符合时间限制的检索最能改善预测准确性,因果图改善关键事件恢复;正确且使用因果图的预测更能依据关键事件和相关来源,但智能体仍难把证据转化为校准概率。