论文

LLM 分布外对齐失效监测器的基准测试与改进

Benchmarking and Improving Monitors for Out-Of-Distribution Alignment Failure in LLMs

模型评测安全与风险评测

摘要

大语言模型 (LLM) 的许多安全和对齐故障都是由于分布外 (OOD) 情况而发生的:模型开发人员无法预见的异常提示或响应模式。我们系统地研究了 LLM 监控管道是否可以通过引入称为分布失调 (MOOD) 的基准来检测这些 OOD 对齐失败。对于在大量安全数据集上训练的现成模型来说,很难找到真正 OOD 的故障。我们通过在 MOOD 中包含一个受限制的训练集(用于训练我们自己的监视器)以及七个在训练分布之外的不同对齐失败的测试集来回避这一问题。使用 MOOD,我们发现防护模型(安全分类器)通常无法泛化 OOD。为了解决这个问题,我们建议将防护模型与 OOD 检测器相结合。我们测试了四种类型的 OOD 检测器,发现结合马氏距离的防护模型和基于困惑的 OOD 检测器可以将召回率从 39% 提高到 45%。我们还为结合了防护模型和 OOD 检测器的监视器建立了跨模型尺度的积极缩放趋势;我们发现,将 OOD 检测纳入监控可实现比使用参数多 20 倍的保护模型更高的召回增益。我们的工作表明,OOD 检测应该是 LLM 监控的重要组成部分,并为进一步研究这一重要问题奠定了基础。

LLM 分布外对齐失效监测器的基准测试与改进
图 5:在某些 MOOD 测试集上额外训练防护模型时,OOD 失准召回率得到改善。我们在括号中显示了相对于基线 Gemma 2 9B 防护模型的召回率的增加以及绝对召回率。前七行每行对应于向训练数据添加一个测试数据集。当对上述任何模型检测到的对话进行并集时,“并集”行测量每个测试数据集的召回率。 “除一个之外的所有”行测量在除每列评估集之外的所有测试数据集上训练的防护模型的召回率。我们比较这两种设置,以隔离数据多样性对 OOD 泛化的影响,发现多样性有助于泛化仅某些类型的对齐失败。请参阅正文了解更多详细信息。