论文

《大语言模型--扩展版》情景化探寻文化价值观

Scenario-based Probing and Steering Cultural Values in Large Language Models--Extended Version

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 可以跨文化背景部署,但通常反映从训练数据继承的同质化值。对文化一致性的评估通常依赖于调查式问题的直接提示,这经常引起中立或安全一致的反应,并且无法捕获潜在的模型偏好。我们提出了一个框架,用于沿着世界价值观调查(WVS)的两个 Inglehart-Welzel 轴探索和引导 LLM 中潜在的文化表征。通过将社会价值问题转化为基于场景的行为困境,我们提取 词元级 概率来测量隐含价值并应用激活引导,可选地与国家条件提示相结合,以在无需重新训练的情况下改变模型行为。在三个开源 LLM 和四种目标文化中,我们发现可操纵性存在显着差异,并识别出潜在的纠缠,其中沿着一个文化维度的干预会导致另一个文化维度的转变。这种耦合反映了人类 WVS 数据中的相关性,并且在激活、提示和混合转向中持续存在。尽管一般任务性能在很大程度上得以保留,但它限制了与轴无关的对齐。