论文

组合多语言和行为属性指导

Compositional Multilingual and Behavioral Attribute Steering

模型推理解码与生成控制

摘要

本研究检验了 大语言模型 中语言和行为控制的引导向量的组合性。着眼于语言、越狱和简洁性,我们研究了属性引导向量的加法 无需训练 组合是否可以在来自两个模型系列和两个尺寸尺度的四个指令调整模型中保留每个属性的预期引导效果。我们发现单属性引导对于所有三个属性都是可靠的,但只有在干预层和引导强度的适当组合内,抽象行为(越狱、简洁)有利于中间层,而语言有利于早期层。我们证明,当每个属性向量被注入到其自己的最佳性能层时,两个属性向量的加法组合成功地同时控制这两个属性,并且这部分扩展到三个同时组合的属性,解决了 无需训练 组合的先前工作留下的不一致问题。我们进一步分析这些转向向量的几何特性,发现它们在残差流中近似正交,与其组合行为一致。