论文
YaPO:面向领域适配的可学习稀疏激活转向向量
YaPO: Learnable Sparse Activation Steering Vectors for Domain Adaptation
摘要
通过激活干预来转向(steering)大语言模型(LLM),已成为对齐与个性化的轻量微调替代方案。近期关于Bi-directional Preference Optimization(BiPO)的工作表明,可以直接以DPO方式从偏好数据学习稠密转向向量,从而控制真实性、幻觉与安全行为。然而,由于神经元多语义性,稠密转向向量常纠缠多个潜在因子,限制了其在文化对齐等需要区分相近价值与行为(如中东各文化之间)的细粒度场景中的有效性与稳定性。本文提出Yet another Policy Optimization(YaPO),一种免参考(reference-free)方法,在稀疏自编码器(SAE)的潜空间中学习稀疏转向向量。通过优化稀疏编码,YaPO产生解耦、可解释且高效的转向方向。实证表明,与稠密转向基线相比,YaPO收敛更快、性能更强、训练更稳定。除文化对齐外,YaPO还泛化到一系列对齐相关行为,包括幻觉、财富渴求、越狱与权力渴求。重要的是,YaPO保留通用知识,在MMLU上无可测退化。总体而言,我们的结果表明YaPO为LLM的高效、稳定、细粒度对齐提供了通用配方,在可控性与领域适配上有广泛应用。相关代码与数据已公开发布。
