论文
通过适当的评估来估计语言模型中的罕见事件
Estimating Rare Events in Language Models with Proper Evaluation
摘要
量化语言模型中罕见故障的风险,例如由对抗性分布变化或超大规模部署引发的故障,需要估计对于随机采样而言太小的概率。虽然最近的工作已经正式确定了低概率估计,但现有管道在最罕见的情况下仍然脆弱:估计者可能会遭受零估计崩溃或系统偏差,并且标准评估损失可能会变得不稳定或与不对称安全成本不匹配。在这项工作中,我们引入了梯度激活自适应多级分割(GA-AMLS),它将罕见事件蒙特卡罗方法应用于语言模型的连续激活空间。具体来说,GA-AMLS 使用基于梯度的 MCMC 内核来导航激活空间,消除输入空间搜索的零估计崩溃,并用显式重尾激活先验下的条件采样替换先前激活空间估计器的独立假设。我们还提出了 Shifted-Power Bregman (SPB) 损失,这是一种适当的评分规则,对于零估计仍然是有限的,并在低估和高估惩罚之间提供可调的不对称性。在小型 Transformer 模型上的实验揭示了偏差-方差权衡:GA-AMLS 在对称评估下实现了最低损失,相对于跨模型大小的最强基线减少了平均对数空间平方误差,而具有高估偏差的方法在不对称惩罚下占主导地位。我们的研究结果强调,估算器的选择应该与部署环境相匹配。更广泛地说,我们的工作将激活空间建立为语言模型中稀有事件估计的易于处理的域,从而避免了离散输入空间搜索的脆弱性。