论文

通过针对探针的训练进行对齐而不失去可监控性

Alignment via Training Against Probes Without Losing Monitorability

模型训练偏好优化

摘要

模型通常根据观察到的输出、使用演示、偏好数据或奖励信号进行调整。这些目标奖励看起来一致的反应。能力更强的模型可能会学会在不内化预期行为的情况下满足这些要求,例如在训练期间假装遵守规定。当目标是根据模型内部而不是输出来定义时,这种肤浅的合规性可能会更加困难。因此,我们研究探针引导的微调,使用检测模型激活中不需要的属性的探针作为直接训练信号。我们评估每层不同数量探针的线性和非线性探针,跨越两个对准目标:无害和诚实。我们发现,针对训练期间不更新的探针进行训练是一个很容易利用的目标,而不断更新的探针可大大减少危害性并提高诚实性,同时保留实用性。与 DPO 和推理时间引导相比,探针引导的微调实现了更好的安全性与实用性的权衡,同时对于越狱和消除攻击具有更强的鲁棒性。此外,这些概念在微调后保持线性编码,这意味着我们的方法不会丢失监督。因此,针对探针的训练提供了一种塑造模型所代表的内容而不仅仅是其输出内容的方法,随着模型更好地使其输出看起来一致,这可能变得越来越重要。