论文
VALUEFLOW:迈向大语言模型中多元化且可引导的价值对齐
VALUEFLOW: Toward Pluralistic and Steerable Value-based Alignment in Large Language Models
摘要
使大语言模型(LLM)与人类价值观的多样谱系保持对齐仍是一项核心挑战:基于偏好的方法往往无法捕捉更深层的动机原则。基于价值的方法提供了更有原则的路径,但仍存在三个缺口:价值提取常忽略层级结构;评估只检测价值是否存在,而不测量经校准的强度;LLM在受控强度下的可引导性仍了解不足。为解决这些局限,我们提出VALUEFLOW,首个覆盖提取、评估与引导并具备校准强度控制的统一框架。该框架整合三个组件:(i)HIVES,一个捕捉理论内与跨理论价值结构的层级价值嵌入空间;(ii)价值强度数据库(Value Intensity DataBase,VIDB),一个大规模价值标注文本资源,其强度估计来自基于排序的聚合;(iii)一个基于锚点的评估器,通过将模型输出与VIDB面板进行排序比较,为输出产生一致的强度分数。利用VALUEFLOW,我们开展了覆盖十个模型与四种价值理论的综合大规模研究,识别出可引导性中的不对称性以及多价值控制的组合规律。本文建立了评估与控制价值强度的可扩展基础设施,推进LLM的多元化对齐。
