论文
大模型具有价值观吗?量化分析与价值对齐框架
Do LLMs Have Values? A Quantitative Analysis and Alignment Framework for Values in Large Language Models
摘要
大模型越来越多处理复杂主观任务,将其意图与行为对齐人类价值成为重要科学挑战。当前努力受行为悖论困扰:微小措辞变化会使其不可预测地摇摆,却又顽固忽略纠正固有偏见的明确指令。为理解并安全引导这些潜在主观偏好,我们围绕三个问题研究。第一,模型是否存在内在价值体系?将106个模型每个15万次查询的响应和9.5万份人类调查画像投影到共同社会学空间后,作者从经验上认为存在,但它们不反映人类多样性,而集中于高度理想化的价值核心。第二,如何量化?我们提出先验—环境—认知PEC框架,将价值表达数学定义为参数权重等内在倾向、用户提示等外部语境、思维链等内部推理的共同结果。第三,如何向目标对齐?利用PEC诊断建立自适应“对齐处方”,不盲目进行耗资源训练,而识别各维度最小有效干预,从零成本提示到定向参数更新。广泛实证验证支持该方法确认价值表达、量化变化,并较盲目训练实现更高效精准引导,同时不损害通用能力。
