论文

事件预测中语言模型与先验的能力门控融合

Competence-Gated Pooling of Language Models and Priors for Event Forecasting

模型推理推理验证与自校正

摘要

在混合预测中,语言模型通常是多种信号之一。系统可能已存在市场、群体或统计预测,需判断该模型是否提供有用信息或应被忽略。其相关目标并非独立模型准确率,而是相对能力,即模型在现有外部预测基础上的边际价值。在Brier损失下,我们分析了模型分歧何时能提升外部预测,并推导出使用领域特定而非全局池化权重带来的收益。随后引入一种能力门控机制,该机制从已解决的结果中估计领域级源权重,对不确定估计进行收缩以趋近全局权重,并重新校准池化预测。在2,357个已解决的二元问题和五个语言模型上,该门控机制将主要外部基准的Brier损失从0.0771降至0.0732,并在多个控制条件下显著优于全局预测组合。该提升在泄漏控制下仍显著,且在针对池化结构集的泄漏安全时间序列先验下表现稳定,FRED数据也提供了独立证据。相比之下,该门控机制在官方ForecastBench市场子集上未带来显著提升,主要服从市场预测。在四个Qwen模型上,语言模型的言语置信度无法可靠识别其优于外部预测的情况,而基于结果估计的能力则支持更优的回避决策。这些结果提供了一种基于可测量边际价值的模型选择实用方法。

事件预测中语言模型与先验的能力门控融合:论文配图
图2:模型价值取决于外部预测的强度。(a)在主要样本池中,能力门控将外部基线的Brier分数从0.0771改善至0.0732,p=0.001。(b)在实时市场子集中,全局混合与能力门控均未显著优于市场预测,p分别为0.19和0.42。这与外部预测已足够强时选择让渡判断的策略相符。