论文

QuantSightBench:使用预测区间评估 LLM 定量预测

QuantSightBench: Evaluating LLM Quantitative Forecasting with Prediction Intervals

模型评测基准与评测资源

摘要

预测已成为不确定性下推理的自然基准。然而,现有的 大语言模型 评估仍然仅限于简单格式的判断任务,例如二元或多选题。然而,在实践中,预测的范围要广泛得多。在经济、公共卫生和社会人口统计等领域,决策取决于对连续数量的数值估计,这是当前基准无法捕捉到的能力。评估此类估计需要一种使不确定性明确且可测试的格式。为此,我们提出预测区间作为自然且严格的接口。它们需要尺度意识、置信水平的内部一致性以及对连续结果的校准,这使得它们成为比数值预测的点估计更合适的评估格式。为了评估这种能力,我们引入了新的基准 QuantSightBench,并在多种设置下评估前沿模型,评估经验覆盖范围和区间锐度。我们的结果显示,11 个评估的前沿和开放权重模型都没有达到 90% 的覆盖率目标,表现最好的 Gemini 3.1 Pro (79.1%)、Grok 4 (76.4%) 和 GPT-5.4 (75.3%) 都落后至少 10 个百分点。校准在极端程度下急剧下降,揭示了所有评估模型的系统性过度自信。