论文

基于语言信念序贯贝叶斯更新的智能体预测

Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs

智能体系统Agent 架构与控制循环

摘要

我们推出了 BLF(贝叶斯语言预测器),这是一种二元预测代理系统,可在 ForecastBench 基准测试中实现最先进的性能。该系统建立在三个想法之上。 (1) 贝叶斯语言信念状态:一种将数值概率估计与自然语言证据摘要相结合的半结构化表示,由大语言模型在迭代工具使用循环的每一步进行更新。这与将所有检索到的证据附加到不断增长的上下文中的常见方法形成鲜明对比。 (2) 分层多试验聚合:运行 $K$ 独立试验,并使用 logit 空间收缩与数据相关先验将它们组合起来。 (3) 分层校准:使用分层先验进行 Platt 缩放,避免了对基本率倾斜的源的过度收缩极端预测。在 ForecastBench 排行榜的 400 个回测问题上,BLF 的表现优于所有顶级公开方法,包括 Cassi、GPT-5、Grok~4.20 和 Foresight-32B。消融研究表明,结构化信念状态与网络搜索访问一样有影响力,并且收缩聚合和分层校准都提供了显着的额外收益。此外,我们开发了一个强大的回测框架,泄漏率低于1.5%,并使用严格的统计方法来比较不同的方法,同时控制各种噪声源。

基于语言信念序贯贝叶斯更新的智能体预测
图 6:在 Brier 指数方面与 FB A ∪ \cup B 上的外部方法和基线进行比较,按整体、市场和数据集划分。误差线:95% 引导 CI。有关数值,请参阅表 12。