论文
转向几何:在 LLM 转向空间中验证人类价值几何
Steering Geometry: Validating Human Value Geometry in LLM Steering Space
摘要
随着 大语言模型 (LLM) 越来越多地部署在对齐敏感的环境中,激活引导已成为 微调 方法(例如 RLHF、DPO)的轻量级推理时间替代品,用于行为控制。然而,现有的工作通常验证孤立行为的转向,从而不清楚转向向量是否编码连贯的语义结构或仅仅利用特定于行为的快捷方式。我们研究 LLM 转向向量的潜在几何形状是否反映了人类价值观和道德中理论指定的结构。使用 Schwartz 的基本人类价值观理论作为我们的主要细粒度框架,我们引入了涵盖 20 个人类价值观的 26K 样本基准,并分析了跨不同模型系列和规模的分布驱动方法(例如 CAA、SphericalSteer、ODESteer)和以行为为中心的方法(例如 COLD-Steer、BiPO)。我们发现分布驱动的方法恢复了与理论预测一致的人类价值拓扑(Spearman $ρ$ 高达 0.51,$p < 10^{-13}$)。相比之下,以行为为中心的方法实现了可比的转向性能,但与期望值几何形状几乎没有相关性。几何保真度随着模型规模的增加而提高,但在指令调整后会下降。最后,更好的几何对齐还可以实现更符合人类一致性的价值观转移:正确引导一个价值观可以提升兼容的价值观并抑制相反的价值观。代码和数据可在以下网址获取:https://github.com/DeepRCL/Steering_Geometry。