论文
关于偏好对齐生成的引导向量的限制
On the Limits of Steering Vectors for Preference-Aligned Generation
摘要
引导向量已成为一种有前途的受控文本生成方法,提供可解释的 无需训练 机制来塑造模型输出。然而,它们的实际普遍性仍然知之甚少。我们从三个维度研究转向向量泛化的局限性:特征表达性、任务转移和多特征组合。使用 PLUME 写作个性化基准,我们提取一系列偏好的引导向量,并在两个开源模型(Qwen2.5-7B-Instruct 和 Llama3.1-8B-Instruct)的摘要和电子邮件写作任务中评估它们。我们发现,不同特征的转向效果差异很大。我们进一步表明,当从正面和负面风格示例中提取的向量转移到下游写作个性化任务时,引导有效性可能会降低。最后,我们比较了组成多个引导向量的常用方法,发现随着添加更多向量,所有方法的特征表达都会显着下降,并且需要在一致性和可表达性之间进行权衡,需要根据设置进行超参数调整。综上所述,我们的结果表明,引导向量作为偏好对齐的通用工具面临着有意义的限制。