论文
能力反成负担?更强的语言模型在最关键处做出更差的预测
Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most
摘要
我们记录了LLM在预测问题上的逆缩放现象,这些问题的底层时间序列呈超线性增长并带有状态切换的尾部风险,这一结构在金融和流行病学中很常见。在这些任务上,越强的模型给出的分布预测越差。该模式出现在我们发布的无污染模拟世界基准ForecastBench-Sim(FBSim)上——在与线性对照匹配的合成SIR疫情预测中——并在COVID-19、麻疹、房地产市场与恶性通胀等真实数据集上得到复现。分位数分解显示,失败集中于上尾:更强的模型为追踪激进的增长外推而将上尾上移,而下尾保持不动。对Llama-3.1的同族研究表明,模型规模与后训练各自独立地促成这一效应。领域知识并不能可靠地挽救校准。这种逆缩放在LLM预测基准常见的单阈值指标上并不显现,这会在相同输出上逆转能力-准确性关系的符号。采用常规切点的单阈值评分会漏掉上尾代价;包含尾部的评分则在同样输出上逆转能力-准确性关系的符号。我们建议LLM预测评估在有界二元阈值指标之外,同时采用连续(且无界)的准确性度量。
