论文

HeadEdit:通过冻结的输出投影矩阵校准语言模型行为

HeadEdit: Calibrating Language Model Behavior Through the Frozen Unembedding Matrix

模型推理解码与生成控制

摘要

对齐并不能消除语言模型中的行为错误。模型仍然可能拒绝善意的请求,调用不必要的工具,或者屈服于虚假的用户声明。当前的方法将此类错误作为计算问题来减轻,并且很少探索所需的行为是否已经编码在模型的表示中。由于观察到即使生成的 logits 产生了不需要的行为,行为相关信息仍然可以从最终隐藏状态线性解码,我们引入了 HeadEdit,这是一种无梯度方法,可以通过非嵌入矩阵来校准模型行为。 HeadEdit 从配对完成中提取低秩行为子空间,并使用其中每个提示的坐标来生成词汇范围的校正,从而实现隐式自适应引导,而无需手动指定目标标记或参数更新。 HeadEdit 改进了三个任务和三个模型系列的所有九个实验设置,推理开销可以忽略不计,并且一般功能没有系统性损失。它还揭示了与基于梯度的对齐的联系。 HeadEdit 的低维表示部分预测了偏好调整如何改变未见提示的输出logits。从模型中学习到的子空间也可以在调优后重复使用,从而提高性能,而无需重新提取或重新调优。这些结果表明,HeadEdit 提供了一种实用、轻量级且可解释的方法来通过非嵌入矩阵来校准模型行为。