论文

相同的价值观,不同的语言?从多语言探索到引导LLM走向中国社会价值观

Same Values, Different Languages? From Multilingual Probing to Steering LLMs Toward Chinese Social Values

模型推理解码与生成控制

摘要

随着大语言模型(LLM)日益融入人类社会,使其与多元化的社会价值观保持一致已成为当务之急。然而,LLM 是否在不同语言中表现出一致的价值偏好仍有待探索,特别是对于基于文化的价值观,这些价值观比以安全为中心的原则更抽象、更难以评估和调整。我们通过中国社会价值观 (CSV) 来调查这个问题,这是一个植根于中国文化的价值体系,涵盖国家、社会和个人层面的 12 美元维度。我们构建了 C-Voices,这是第一个全面的 CSV 多语言对比探针数据集,包含六种语言的 86,400 个基于困境的实例,每个实例将 CSV 一致的操作与价值冲突的替代方案配对。基于 C-Voices 的对比探针,我们提出了一种无 微调 的值向量引导方法,该方法从隐藏状态差异中导出值方向,并在推理过程中选择性地干预值敏感层。对六种语言的实验表明,面向 CSV 的偏好依赖于模型且对语言敏感,相同的困境会在不同语言中引发不同的反应。我们的方法实现了有效的 CSV 引导,支持价值向量的跨语言传输,并推广到现有的 FLAMES 和 ValuePrism。