论文
估计语言模型输出分布中的尾部风险
Estimating Tail Risks in Language Model Output Distributions
摘要
语言模型的能力越来越强,并且正在人口规模上快速部署。因此,这些模型的安全性变得越来越重要。幸运的是,对齐方面的进步显着降低了有害模型输出的可能性。然而,当模型一天被查询数十亿次时,甚至会发生罕见的最坏情况行为。当前的安全评估侧重于捕获产生有害输出的输入的分布。这些评估忽略了模型的概率性质及其尾部输出行为。为了衡量这种尾部风险,我们提出了一种有效估计任何输入查询的有害输出概率的方法。我们不是从目标模型中进行简单的暴力采样(有害输出可能很少见),而是通过创建目标模型的不安全版本来实施重要性采样。这些不安全的版本通过使有害输出更有可能实现样本高效估计。在衡量误用和错位的基准上,这些估计值与使用 10-20 倍更少样本的暴力蒙特卡罗估计值相匹配。例如,我们可以仅用 500 个样本来估计有害输出的概率约为 10^-4。此外,我们发现这些危害性估计可以揭示模型对模型输入扰动的敏感性并预测部署风险。我们的工作表明,准确的罕见事件估计对于安全评估来说既关键又可行。代码可在 https://github.com/rangell/LMTailRisk 获取