论文

对齐预测:根据训练数据预测错位

Alignment Forecasting: Predicting Misalignment From Training Data

模型评测安全与风险评测

摘要

在具有狭窄缺陷的数据上训练语言模型有时会使模型出现广泛的偏差。从表面上检查数据通常并不能确定它是否会出现,而今天只有在训练后,通过审核生成的模型才能发现它。为了补充事后审计,我们引入了对齐预测:在训练之前预测对齐失败的任务。给定目标模型、微调数据集以及欺骗或阿谀奉承等故障模式,预测器会输出微调将有意义地增加该故障模式的概率。为了衡量对齐预测的进展,我们引入了 ALIGNMENTFORECASTBENCH,这是一个涵盖 17 个目标模型、32 个数据集和 16 个故障模式的 5,000 多个预测问题的基准。直接提示的前沿模型在 ALIGNMENTFORECASTBENCH 上表现不佳。因此,我们提出了一个预测支架,其中大语言模型读取数据集并评估它将模型推向不当行为的强度和范围,并且一个简单的学习模型将该评级与故障模式的基本率和目标模型的先验趋势结合起来。这种预测远远高于偶然性,并且击败了针对任务进行微调的模型,并且简单的预测器允许查看较弱的模型在对相同数据进行微调后的表现。它的信号还标记了前沿模型分类器错过的有问题的训练示例。在大多数情况下,从 UltraChat 等真实的训练后数据中过滤出这些示例,可以在我们的多项选择评估中产生更加一致的模型,尽管开放式对话的好处尚不清楚。在预测能够可靠地指导实践中的训练数据管理之前,还需要取得更多进展,但我们的结果表明,在 SFT 设置中,在训练之前预测许多对齐失败是可以处理的。