论文

路径分叉处:大语言模型道德推理的局部化校准控制

Where Paths Split: Localized, Calibrated Control of Moral Reasoning in Large Language Models

模型推理解码与生成控制

摘要

大语言模型在不同 setting 下常显示异质道德偏好。我们研究在保持通用能力的同时,推理时向目标伦理框架引导的方法。我们提出收敛-分叉路由(Convergent-Divergent Routing):追踪并编辑transformer块内部伦理框架相关通路先收敛后分叉的最小分支点。在这些位置门控非目标分支可阻断下游传播而不动上游计算。我们发现仅此干预即可增强目标伦理框架的推理。为实现细粒度控制,我们把共同空间模式(Common Spatial Patterns)适配到残差流,为每个分支点层提取一对区分功利主义与义务论框架的方向。随后引入双Logit校准:一个闭式的最小L2范数更新,在该二维子空间内移动残差,使方向投影对齐用户指定的偏好权重。真实道德困境上的实验显示,该方法可靠实现偏好校准并大体保持通用能力,超越近期基线且提供可解释机制。

路径分叉处:大语言模型道德推理的局部化校准控制:论文配图
图 1:功利主义和义务论之间的二元控制示例。 (αU,αD)(\alpha_{U},\alpha_{D}) 表示功利主义和义务论的权重。