论文

LEAF:事件增强预测的活基准

LEAF: A Living Benchmark for Event-Augmented Forecasting

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地应用于现实世界的预测任务,但评估其真正的预测能力仍然受到 预训练 数据污染和自动搜索中的前瞻泄漏的影响。现有的基准要么依赖静态上下文,将评估限制在狭窄的环境中,要么无法审核辅助文本事件以防止未来的信息泄漏。为了建立严格的评估范式,我们提出了 LEAF,这是事件增强预测任务的第一个实时基准,包括趋势、事件和时间序列预测。 LEAF 将递归检索代理系统与双代理交叉验证相结合,以收集全面、相关且时间对齐的辅助上下文。由 47 名领域专家对 500 项任务进行的全面审核表明,我们的管道将未来的信息泄漏率从 8.6% 抑制到 1.6%。在我们的基准上对 16 个前沿专有和开放权重模型进行广泛评估后,我们发现 LLM 可以有效地从已验证的事件中提取信号,以促进趋势和事件预测。