论文
从标记概率到校准置信度:数学问答的实证研究
From token probabilities to calibrated confidence: An empirical study of mathematical question answering
摘要
大语言模型 (LLM) 的置信度估计旨在估计生成的答案正确的概率,而校准则使这些估计与经验准确性保持一致。先前的工作表明,词元概率通常过于自信,我们研究这些容易获得的信号是否仍然可以为数学问题回答提供经过良好校准的置信度估计。我们将单遍估计器与多遍估计器进行比较,单遍估计器重用原始生成的词元概率,多遍估计器通过验证或随机前向传递获得额外的置信信号。虽然单个标记概率可能高度饱和,但我们发现在整个序列上聚合标记概率可以捕获正确代和错误代之间微小但一致的差异,从而产生信息更丰富的置信度估计。多遍方法可以产生校准的置信度估计。我们研究了两种这样的方法:通过重新提示进行自我验证,包括成本较低的原位变体,以及蒙特卡罗辍学,它从随机前向传播的变化中获得信心。我们进一步评估了两种事后校准方法,普拉特缩放和等渗回归,这两种方法都大大减少了域内校准误差。然而,它们的数据效率随着数据集难度的不同而变化,并且校准映射通常在数据集和模型之间不对称地传输。