论文

正确的评分规则如何塑造 LLM 预测

How Proper Scoring Rules Shape LLM Forecasting

模型评测模型行为与机制分析

摘要

本文评估了奖励函数选择如何影响 LLM 预测器的性能和行为。我们比较了五种适当的评分规则作为已解决的现实世界事件的二元预测的训练目标。尽管这些规则在真实概率报告方面具有相同的理论动机,但所得模型在校准、概率使用以及偏差、信息和噪声的估计概况方面有所不同,在总体准确性和辨别力方面差异较小。 Brier 训练模型具有最低的观察到的 Brier 分数和最高的 AUC-ROC,而对数训练的模型具有最高的观察到的对数分数和最低的校准误差。具有相似总体性能的模型也可以通过偏差、信息和噪声的不同组合来达到该性能。因此,正确的评分规则不需要与训练目标互换。奖励选择不仅可以影响 LLM 的预测效果,还可以影响其预测误差的结构。