论文

大模型具有价值观吗?量化分析与价值对齐框架

Do LLMs Have Values? A Quantitative Analysis and Alignment Framework for Values in Large Language Models

模型评测模型行为与机制分析

摘要

大模型越来越多处理复杂主观任务,将其意图与行为对齐人类价值成为重要科学挑战。当前努力受行为悖论困扰:微小措辞变化会使其不可预测地摇摆,却又顽固忽略纠正固有偏见的明确指令。为理解并安全引导这些潜在主观偏好,我们围绕三个问题研究。第一,模型是否存在内在价值体系?将106个模型每个15万次查询的响应和9.5万份人类调查画像投影到共同社会学空间后,作者从经验上认为存在,但它们不反映人类多样性,而集中于高度理想化的价值核心。第二,如何量化?我们提出先验—环境—认知PEC框架,将价值表达数学定义为参数权重等内在倾向、用户提示等外部语境、思维链等内部推理的共同结果。第三,如何向目标对齐?利用PEC诊断建立自适应“对齐处方”,不盲目进行耗资源训练,而识别各维度最小有效干预,从零成本提示到定向参数更新。广泛实证验证支持该方法确认价值表达、量化变化,并较盲目训练实现更高效精准引导,同时不损害通用能力。

大模型具有价值观吗?量化分析与价值对齐框架:论文配图
图 1:LLM 价值研究拟议框架概述,解决三个核心问题。 Q1 通过在 95,000 个人类查询数据和 150K LLM 查询中连接 WVS、Schwartz 价值理论和 LLM 响应,调查 LLM 是否具有内在价值,揭示了高级 LLM 中的具体价值核心。 Q2 引入了 PEC 框架,该框架首次通过先验、环境和认知三个维度对 LLM 价值表达进行数学量化,从而实现结构化诊断报告,精确识别每个维度上的价值偏差。 Q3 利用 PEC 框架得出的诊断结果为每个 LLM 生成有针对性的“调整处方”,建议多个级别的调整干预措施,以有效引导 LLM 价值偏好达到所需目标。