论文
大语言模型 的非线性干预
Non-linear Interventions on Large Language Models
摘要
干预是理解大语言模型(LLM)内部表征最具代表性和广泛使用的方法之一。然而,现有的干预方法仅限于基于线性表示假设的线性干预,使得沿着非线性流形编码的特征超出了它们的范围。在这项工作中,我们介绍了一种自然延伸到非线性表示特征的一般干预公式,以及进一步实现对缺乏直接输出签名的隐式特征的干预的学习过程。我们验证了拒绝旁路引导的框架,通过干预管理拒绝的非线性特征,它比线性基线更精确地引导模型。