论文

DVMap:基于高共识人口统计—价值映射的细粒度多元价值对齐

DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping

模型训练强化学习

摘要

当前的大语言模型(LLM)通常依赖粗粒度的国家标签进行多元价值对齐。然而,这种宏观层面的监督往往掩盖一国内部的价值异质性,导致对齐松散。我们认为,解决这一局限需要从国家标签转向多维人口统计约束,后者能够识别出价值偏好可预测且高共识的群体。为此,我们提出DVMap(高共识人口统计—价值映射),一个细粒度多元价值对齐框架。在该框架中,我们首先提出人口统计原型抽取策略,从世界价值观调查(WVS)构建包含56,152个样本的高质量价值对齐语料库,严格保留在相同人口统计特征下价值偏好一致的受访者。在该语料库之上,我们引入结构化思维链(CoT)机制,显式引导LLM推理人口统计与价值之间的关联。随后,我们采用组相对策略优化(GRPO)实现价值分布的自适应锚定。为严格评估泛化能力,我们进一步建立了包含21,553个样本的三重泛化基准(涵盖跨人口统计、跨国家和跨价值)。实验结果表明,DVMap有效学习到从人口统计到价值的流形映射,展现出强泛化性与鲁棒性。在跨人口统计测试中,Qwen3-8B-DVMap达到48.6%的准确率,超过先进的开源LLM DeepSeek-v3.2(45.1%)。源代码与数据集见https://github.com/EnlightenedAI/DVMap。

DVMap:基于高共识人口统计—价值映射的细粒度多元价值对齐:论文配图
图 2:DVMap 框架概述。 (a) 数据构建:利用“WVS Wave 7”,我们首先根据我们的“人口原型”策略提取高共识映射。其次,我们在 Inglehart-Welzel 文化地图 Haerpfer 等人的指导下进行“国家抽样”。 (2022)。第三,我们按照Pileggi(2024)进行“问题处理”。通过这些步骤,我们构建了高质量的“人口价值一致性语料库”并建立了“三重概括评估基准”。 (b) 人口价值调整:政策模型“πθ*\pi_{\theta}^{*}”在“结构化 CoT”的指导下,生成与价值相关的“推出”。奖励机制根据这些输出分配“奖励”,然后用于计算政策“优化”的“相对优势”。 (c) 人口价值推论比较:在“让父母感到自豪”的问题上(举例),未经训练的LLM错误地认为自己的非宗教信仰和高等教育意味着拒绝家庭期望。相比之下,DVMap认识到,在中国儒家文化背景下,她的个人独立与孝敬父母的传统目标和谐共存。请注意,真实偏好不作为输入提供;它们专门用于评估和可视化。