论文

引导 LLM 文化本地化的一代

Steering LLMs for Culturally Localized Generation

模型评测模型行为与机制分析

摘要

LLM 在全球范围内部署,但产生的响应偏向于具有丰富训练数据的文化。现有的文化本地化方法(例如提示或 后训练 对齐)是黑匣子,难以控制,并且无法揭示失败是否反映了知识缺失或启发不佳。在本文中,我们使用机械可解释性来揭示和操纵 LLM 中的文化表征来解决这些差距。利用稀疏自动编码器,我们识别可解释的特征,这些特征对文化显着信息进行编码并将其聚合到文化嵌入(CuE)中。我们使用 CuE 来分析未指定提示下的隐性文化偏见,并构建白盒指导干预措施。在多个模型中,我们表明基于 CuE 的引导增加了文化 忠实性,并引发了比单独提示更罕见的长尾文化概念。值得注意的是,基于 CuE 的转向是对黑盒定位方法的补充,当应用于提示增强输入时会带来收益。这也表明模型确实受益于更好的启发策略,并且不一定缺乏长尾知识表示,尽管这在不同文化中有所不同。我们的结果既提供了对 LLM 中文化表征的诊断洞察,也提供了引导所需文化的可控方法。