论文

价值对齐中的个性化、角色扮演与预测

Personalization, Personas, and Forecasting in Value Alignment

模型评测模型能力评测

摘要

LLM的行为可能以多种方式受人类身份条件化:它们可能被要求适应用户、扮演特定人群,或预测人们会如何回答涉及价值观的问题。我们利用世界价值观调查(WVS)检验这些设定是否可以互换。我们在13个语言-国家切片的101个源自WVS的问题上评估GPT-5.4、Claude Sonnet 4.6、Gemini 2.5 Flash和Qwen3-235B,将仅语言基线与用户国家、角色国家及第三人称提示进行比较。在21,008条模型响应记录中,提示设定是文化对齐的一阶决定因素:国家线索常常大幅改变答案,但并非所有改变都朝向与匹配人群响应分布一致的方向。对四个被测托管模型中的三个而言,第三人称预测产生最强的方向性对齐,而个性化与角色扮演则较弱或较不稳定。对齐收益集中在宗教性、性别角色和工作导向的物质价值观等显著价值维度上,而制度信任和与民主相关的问题仍然困难。这些结果表明,在文化价值观引导中,提示设定并非表面化的选择;它会同时改变模型行为和所测得的对齐。

价值对齐中的个性化、角色扮演与预测:论文配图
图 1:本文测试的四种提示条件的示例。这是一个真实的示例,显示了 GPT-5.4 提供的响应,并强调了条件相关的方向对齐中最常见的趋势。为了清晰起见,WVS 问题文本已被简化。