论文

通过 大语言模型 中的潜在激活指导实现文化价值调整

Cultural Value Alignment Via Latent Activation Steering in Large Language Models

模型评测模型行为与机制分析

摘要

大语言模型 (LLM) 经常表现出同质化的文化观点。虽然世界价值观调查 (WVS) 为绘制人类价值观提供了黄金标准,但在 WVS 上直接提示 LLM 往往无法访问模型的潜在文化深度,从而导致安全拒绝或中立反应。在这里,我们提出了一个用于文化评估和干预的通用框架,从抽象查询过渡到基于场景的行为探索。通过提取 300 个情境困境中的隐式标记概率,我们绕过表面对齐来映射 LLM 文化价值的潜在坐标。我们进一步引入激活转向,以在前向传递过程中改变这些内部对齐,而无需重新训练。在多个 LLM 中,我们发现适应性存在显着差异,并揭示了一种一致的潜在纠缠现象,即沿一个文化维度的干预会引起另一个文化维度的转变。这些结果表明,文化价值观被编码为耦合结构,限制了精确对齐。这项工作为文化引导建立了一个计算高效的框架,突出了使用 LLM 导航全球价值时的结构复杂性。