论文

反思对齐方式的转变超越通过 微调 植入的行为

Introspecting Alignment Shifts Beyond Behaviors Implanted Through Fine-Tuning

模型评测评测方法与指标

摘要

微调 使源模型能够获取目标域中所需的功能和行为,同时保留其大部分通用能力。然而,这种适应过程也会降低源模型中存在的对齐属性。最近的研究表明,大语言模型 可以使用基于 LoRA 的模块(称为内省适配器 (IA))进行训练,以描述 微调 引起的行为变化。然而,现有的研究主要考虑这样的设置:在明确设计用于植入特定行为的数据集上对模型进行微调,然后要求模型解释植入的行为。这与实际部署场景不同,在实际部署场景中,错位不一定是故意植入的,而只是作为副作用而出现。为了弥补这一差距,我们制定了一个新颖的问题设置,其中内省的目标不一定是通过 微调 明确植入的行为,而是可能作为意外副作用出现的对齐变化,并且我们为此设置构建了一个数据集。此外,为了增强对内部模型变化的敏感性,我们提出了 Delta-Aware Introspection Adapter (DAIA),这是一种新颖的机制,旨在显式处理基础模型激活和 微调 引起的激活差异。我们的实证评估表明,内省学习可以推广到看不见的微调模型和安全类别,并且 DAIA 通常优于现有的 IAs。