论文

考虑维度串扰的多价值引导与多元LLM对齐

Spillover-Aware Multi-Value Steering for Pluralistic LLM Alignment

模型推理解码与生成控制

摘要

激活引导通过向隐藏状态添加学习方向来控制推理时的 LLM 行为,但现有方法一次只能处理一个概念。多元化的协调,不同的利益相关者需要不同的价值重点,需要同时引导多个维度。我们表明,朴素的转向会产生巨大的溢出效应:针对一个值的影响会渗透到其他值中。这与因果推理中的处理与溢出分解类似。我们追踪转向方向的几何纠缠(由其 Gram 矩阵捕获),并从激活范数惩罚目标中导出零成本校正,该目标精确地解耦每个方向的贡献。我们的端到端管道不需要微调,不需要奖励模型,也不需要手动提示工程:仅给出领域问题,它会自动发现价值维度,提取方向,诊断纠缠,并应用正确的转向。在气候话语方面,修正将净转向效果从 +5.9% 提高到 +14.0%,验证了超过 100,000 个成对判断。

考虑维度串扰的多价值引导与多元LLM对齐:论文配图
图 2:探测(左)和对比(右)方向基中估计的因果雅可比行列式 𝐌\mathbf{M}。黑色方块标记对角线条目。表现良好的 𝐌\mathbf{M} 将显示强正对角线和弱非对角线;相反,所有条目都是 O⁡(10−2)O(10^{-2}) ,没有明确的对角线结构。