论文

值的几何:语言模型中道德偏好对齐的任务向量组合

Geometry of Values: Task Vector Composition for Ethical Preference Alignment in Language Models

模型优化模型合并

摘要

大型语言模型 (LLM) 越来越多地部署在必须权衡道德价值观冲突的应用程序中,但即使是强大的模型也会在不同语言之间表现出隐藏的偏见和脆弱的指令遵循。我们引入了包含 12,000 个双选项困境实例的数据集,涵盖成对的三个价值冲突:诚实与正义、正义与自治、自治与诚实,以及印地语、阿拉伯语、西班牙语和中文的翻译,以探讨跨语言行为。 GPT-5-mini 的基准测试表明,在没有给出任何政策的情况下,它在所有五种语言中始终支持诚实而不是自治。 Llama-3.2-1/3B 模型表现出强烈的第一选择偏差;然而,普通微调和直接偏好优化微调都可以有效消除这种偏差,将准确度提高到 98% 以上。为了将数据集中学习相关性的影响与抽象值解耦,我们提出了一种基于任务向量转移的实验,在计算价值偏好方向的任务向量后,我们将其相对于一般指令遵循向量进行正交化。我们的实验表明,该方法可以有效地隔离特定价值偏好的方向,可以成功地用于进行任务算术以获得相反立场的模型。