论文
事件预测中语言模型与先验的能力门控融合
Competence-Gated Pooling of Language Models and Priors for Event Forecasting
摘要
在混合预测中,语言模型通常是多种信号之一。系统可能已存在市场、群体或统计预测,需判断该模型是否提供有用信息或应被忽略。其相关目标并非独立模型准确率,而是相对能力,即模型在现有外部预测基础上的边际价值。在Brier损失下,我们分析了模型分歧何时能提升外部预测,并推导出使用领域特定而非全局池化权重带来的收益。随后引入一种能力门控机制,该机制从已解决的结果中估计领域级源权重,对不确定估计进行收缩以趋近全局权重,并重新校准池化预测。在2,357个已解决的二元问题和五个语言模型上,该门控机制将主要外部基准的Brier损失从0.0771降至0.0732,并在多个控制条件下显著优于全局预测组合。该提升在泄漏控制下仍显著,且在针对池化结构集的泄漏安全时间序列先验下表现稳定,FRED数据也提供了独立证据。相比之下,该门控机制在官方ForecastBench市场子集上未带来显著提升,主要服从市场预测。在四个Qwen模型上,语言模型的言语置信度无法可靠识别其优于外部预测的情况,而基于结果估计的能力则支持更优的回避决策。这些结果提供了一种基于可测量边际价值的模型选择实用方法。
