论文
价值观作为风格:通过单向混合将价值观从语义中解脱出来,实现低损害 LLM 指导
Values as Style: Disentangling Values from Semantics with One-Way Mixing for Low-Damage LLM Steering
摘要
价值导向应该改变大语言模型的规范优先事项,同时保留其答案背后的场景、事实和任务限制。传统的激活编辑通常会改变两者。我们在冻结残差状态上引入了一种可编辑的语义-值接口,具有单向语义到值的路径,可以在上下文中进行值识别。停止梯度阻止通过该途径的反馈;交换一致性、主题去混杂和去相关性鼓励选择性代码。在推理时,编辑值代码会产生残余增量,同时保持语义代码固定。在两个指令调整的主干上,该接口改进了语义保留并减少了可比较值对齐时的良性拒绝。匹配的混合门控消融将表征学习与选择性编辑激活分开,并且维度匹配的探针建立了改进的代码选择性。与 LLaMA-3.1-8B 上的验证选择提示相比,该方法实现了可比较的对齐(0.750 与 0.748)、更高的 BERTScore(0.938 与 0.923)以及更少的矛盾(5.1% 与 7.6%)。人类评级和跨分类控制为低伤害价值引导提供了补充证据。