论文

ORBIT:无需训练 通过正交子空间旋转的多属性行为指导

ORBIT: Training-Free Multi-Attribute Behavioral Steering via Orthogonal Subspace Rotation

模型推理解码与生成控制

摘要

语言模型广泛应用于助理环境中,其中控制行为属性通常至关重要。激活控制在推理时修改隐藏状态表示,提供可以在运行时切换的轻量级 无需训练 机制。然而,现有的方法主要集中于一次控制单个属性。当必须同时控制多个属性时,每个属性引导向量的简单求和会受到范数不平衡和方向抵消的影响,而基于分类器的方法则需要在属性集发生变化时进行重新训练。我们引入了 ORBIT(基于正交旋转的干预技术),这是基于旋转的转向到多属性设置的 无需训练 扩展。我们的方法通过奇异值分解从每个属性引导平面构造一个联合子空间,并在该子空间内向组合目标方向应用单个保模旋转。自适应每个词元门控识别每个位置哪些属性需要校正,并且可选的附加增强可以增强初始投影较弱的属性。我们还引入了 TraitFactory,这是一种新的多属性基准,重点关注行为倾向而不是表面风格。我们在 TraitFactory 和 ToneBank 上跨三个模型(Llama-3.2-3B、Qwen-2.5-7B、Llama-3.1-8B)评估 ORBIT,同时引导多个属性,结果表明它比现有的 无需训练 基线实现了更强、更平衡的多属性引导,同时更好地保持了输出一致性。