论文
在语言模型中引入人为的不确定性
Inducing Artificial Uncertainty in Language Models
摘要
在安全关键型应用中,语言模型应该能够用有意义的概率来表征其不确定性。许多不确定性量化方法需要监督数据;然而,对于经过大量抓取数据训练的 大语言模型 来说,找到合适的看不见的挑战性数据变得越来越困难。如果模型对其预测始终(且正确)有信心,则不确定性量化方法可能会始终高估新数据和不熟悉数据的置信度。因此,寻找表现出足够不确定性的数据来训练高性能模型的监督不确定性量化方法可能具有挑战性,并且随着 LLM 数据集饱和,难度也会增加。为了解决这个问题,我们首先介绍在语言模型中引入人工不确定性的问题,然后研究在训练时没有挑战性数据的情况下在简单的数据上引入人工不确定性的方法。我们使用经过训练来识别原始模型上的人工不确定性的探针,并发现这些经过人工不确定性训练的探针在识别真实不确定性方面优于未经人工不确定性训练的探针,在硬数据上实现了显着更高的校准,而在简单数据上的性能损失最小。