论文

基于能量校准的多适配器表示干预

Multi-Adapter Representation Interventions via Energy Calibration

模型推理解码与生成控制

摘要

表示干预已成为一种在不修改模型权重的情况下将大语言模型对齐到期望行为的有前景范式。现有方法通常对所有输入统一施加固定的干预。然而我们发现,合适的干预方向与强度在不同样本之间差异很大,这种不加区分的干预会导致良性输入上通用能力的退化。为应对这些挑战,我们提出基于能量校准的多适配器表示干预(MARI)。具体而言,我们引入一种竞争式多适配器机制,其中专门化的专家捕捉非线性修正模式,并为不同样本自适应地确定合适的干预方向与强度。此外,我们设计了基于能量的门控模块,利用内部传播动力学来区分适用于干预的输入。跨多样模型家族与参数规模的大量实验表明,MARI取得了最先进的对齐性能。我们的方法显著提升了TruthfulQA、BBQ与安全基准上的表现,同时在MMLU与ARC等任务上保持甚至提升了通用能力。代码发布于 https://github.com/V1centNevwake/MARI。

基于能量校准的多适配器表示干预:论文配图
图 3:MARI 的管道。 MARI 集成了一个基于能量的门,利用传播动力学来区分适用于干预的输入和良性输入。不适用的输入绕过干预(回落到冻结的基本模型),而适用的输入由熵路由器引导至 KK 竞争专家之一,以进行精确的输入自适应转向。