论文

语言模型的上下文线性激活控制

Contextual Linear Activation Steering of Language Models

模型训练模型编辑与遗忘

摘要

线性激活控制是一种强大的方法,可以激发 大语言模型 的功能并使用有限的标记数据来专门化其行为。虽然有效,但现有方法通常对所有标记应用固定的引导强度,导致不同输入提示的引导质量不一致。在这项工作中,我们引入了上下文线性激活转向(CLAS),这是一种动态调整线性激活转向以适应上下文相关的转向强度的方法。在 11 个转向基准和四个模型系列中,它始终优于标准线性激活转向,并且在标记数据有限的设置中匹配或超过 ReFT 和 LoRA 的性能。因此,我们建议 CLAS 作为一种可扩展、可解释且准确的方法,用于专业化和指导 大语言模型。