论文
校准概率预测的可验证奖励
Verifiable Rewards for Calibrated Probabilistic Forecasting
摘要
具有可验证奖励的强化学习原则上可以训练经过校准的概率预测器,因为正确的评分规则(例如 Brier 分数)是仅根据结果计算的,并且通过真实概率将期望最小化。在实践中,它会降低校准效果,而现有的补救措施可以解决认知不确定性,即模型的置信度伴随着可验证的正确或错误答案。我们研究随意预测,其中预测本身就是输出,标签是一个随机结果,以 NFL 比赛中获胜概率作为测试平台,并以博彩市场为参考。奖励已实现的每场比赛结果是失败的,因为单一结果是一个嘈杂的目标,并且政策梯度破坏了思想链。我们引入了可验证的、无标签的奖励,根据过去的结果估计的状态条件经验获胜率,消除了标签噪声,并且我们通过直接预测或梯度掩码使梯度远离推理,因此它不会被破坏。仅使用此奖励进行训练,无需人工标签或监督 微调,7B 模型通过直接预测达到博彩市场的校准,并且比零样本前沿模型校准得更好。该前沿模型和表格估计器达到与该模型相同的 Brier 分数,将市场剩余的小优势识别为超出其共享输入的实时游戏信息。掩盖梯度,而不是放弃思想链,保留了预测所依据的推理,而普通的思想链训练会破坏这种推理。