论文
语言模型控制的圆柱表示假设
The Cylindrical Representation Hypothesis for Language Model Steering
摘要
转向是一种广泛使用的控制 大语言模型 的技术,但其效果往往不稳定且难以预测。现有的理论解释主要基于线性表示假设(LRH)。虽然 LRH 假设概念可以正交化以实现无损控制,但这种理想化映射在实际表示中失败,并且无法解释观察到的转向的不可预测性。通过放松 LRH 的正交性假设,同时保留线性表示,我们表明重叠的概念贡献自然会产生样本特定的轴正交结构。我们将其形式化为圆柱表示假设(CRH)。在 CRH 中,中心轴捕捉了概念缺失和存在之间的主要区别,并驱动概念生成。周围的法线平面通过确定轴激活目标概念的难易程度来控制转向灵敏度。在这个平面内,只有特定的敏感部门强烈促进概念激活,而其他部门可以抑制或延迟它。虽然可以从差异向量中可靠地识别周围的法向平面,但敏感扇区却不能,从而在扇区级别引入了内在的不确定性。这种不确定性为为什么即使使用一致的方向转向结果也经常波动提供了原则性解释。我们的实验验证了圆柱形结构的存在,并证明 CRH 提供了一种有效且实用的方法来解释实际环境中的模型转向行为:https://github.com/mbzuai-nlp/CRH。