论文

能力反成负担?更强的语言模型在最关键处做出更差的预测

Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most

模型评测模型能力评测

摘要

我们记录了LLM在预测问题上的逆缩放现象,这些问题的底层时间序列呈超线性增长并带有状态切换的尾部风险,这一结构在金融和流行病学中很常见。在这些任务上,越强的模型给出的分布预测越差。该模式出现在我们发布的无污染模拟世界基准ForecastBench-Sim(FBSim)上——在与线性对照匹配的合成SIR疫情预测中——并在COVID-19、麻疹、房地产市场与恶性通胀等真实数据集上得到复现。分位数分解显示,失败集中于上尾:更强的模型为追踪激进的增长外推而将上尾上移,而下尾保持不动。对Llama-3.1的同族研究表明,模型规模与后训练各自独立地促成这一效应。领域知识并不能可靠地挽救校准。这种逆缩放在LLM预测基准常见的单阈值指标上并不显现,这会在相同输出上逆转能力-准确性关系的符号。采用常规切点的单阈值评分会漏掉上尾代价;包含尾部的评分则在同样输出上逆转能力-准确性关系的符号。我们建议LLM预测评估在有界二元阈值指标之外,同时采用连续(且无界)的准确性度量。

能力反成负担?更强的语言模型在最关键处做出更差的预测:论文配图
图 1:根据连续的适当评分规则(红色),能力更强的模型在两个不相关的领域中产生更差的预测。这种逆缩放不会出现在基于阈值的正确评分规则(蓝色)上。上图:FBSim,汇总。底部:疫苗接种前的麻疹。这两个系列均以最远的预测范围显示。