论文

VALUEFLOW:迈向大语言模型中多元化且可引导的价值对齐

VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models

模型评测评测方法与指标

摘要

使大语言模型(LLM)与人类价值观的多样谱系保持对齐仍是一项核心挑战:基于偏好的方法往往无法捕捉更深层的动机原则。基于价值的方法提供了更有原则的路径,但仍存在三个缺口:价值提取常忽略层级结构;评估只检测价值是否存在,而不测量经校准的强度;LLM在受控强度下的可引导性仍了解不足。为解决这些局限,我们提出VALUEFLOW,首个覆盖提取、评估与引导并具备校准强度控制的统一框架。该框架整合三个组件:(i)HIVES,一个捕捉理论内与跨理论价值结构的层级价值嵌入空间;(ii)价值强度数据库(Value Intensity DataBase,VIDB),一个大规模价值标注文本资源,其强度估计来自基于排序的聚合;(iii)一个基于锚点的评估器,通过将模型输出与VIDB面板进行排序比较,为输出产生一致的强度分数。利用VALUEFLOW,我们开展了覆盖十个模型与四种价值理论的综合大规模研究,识别出可引导性中的不对称性以及多价值控制的组合规律。本文建立了评估与控制价值强度的可扩展基础设施,推进LLM的多元化对齐。

VALUEFLOW:迈向大语言模型中多元化且可引导的价值对齐
图40:在非西方价值体系(佛教伦理)下的可操控性。利用源自佛教伦理话语的价值条目(如 mindfulness(正念)、non-attachment(不执着)、karma(业)、impermanence(无常)),我们构建了一个领域特定的价值—强度数据库,并在多个模型上评估可操控性。所得的强度变化表现出清晰且方向一致的行为,表明该框架可以自然地扩展到主流西方理论之外的文化特定或领域专门的价值体系。