论文

LEAP:面向大语言模型概率预测的似然提取与聚合

LEAP: Likelihood Elicitation and Aggregation for LLM-based Probabilistic Forecasting

上下文与知识上下文工程

摘要

基于LLM的预测系统在金融市场和体育赛事等现实世界任务上得到了改进,这主要是通过更强大的搜索和工具使用来实现的。许多系统仍然要求LLM一起阅读所有收集到的证据并得出最终预测。我们将这种设计称为整体预测。它可能会掩盖单个证据项目如何影响结果并消除竞争结果的不确定性。我们提出了 LEAP(概率预测的似然诱导和聚合),它重新组织了在预测阶段如何使用收集的证据。 LEAP 分别检查每个证据项,并得出描述其对目标影响的可能性参数。然后,显式先验和确定性概率模型将这些可能性组合成后验分布。该过程支持连续、单选择和多选择预测,同时保留可重复的证据贡献。我们构建了一个涵盖预测、信息查找和浏览任务的基准,并在我们自己的代理循环和多个代理 CLI 框架上评估 LEAP。考虑到相同的证据,LEAP 改进了模型中的大多数预测和校准指标,并且在先前访问、推理预算和聚合的受控比较下仍然更强。

LEAP:面向大语言模型概率预测的似然提取与聚合:论文配图
图1 单石基数在不透露哪些证据是答案的情况下,会令人信服地错误。LEAP披露了证据层面的支持,并通过概率更新将其结合起来,使预测可以审计。