论文
LLM 中跨语言事实一致性的推理时间引导
Inference-Time Steering for Cross-Lingual Factual Consistency in LLMs
摘要
尽管 大语言模型 (LLM) 表现出出色的多语言流利性,但其内部知识表示仍然不成比例地偏向于高资源语言。这导致跨语言的事实不一致,他们仅根据提示语言改变经验答案分布。我们研究是否可以在推理时减轻这些偏差,迫使英语提示的模型像用目标语言(德语、西班牙语、保加利亚语)进行查询一样回答,并评估四种干预策略:零样本上下文引导(角色提示)、通过对比激活添加(CAA)进行内部表征操纵,以及通过基于基准派生的事实数据和概念概括数据进行训练的直接偏好优化(DPO)进行轻量级权重修改。为了评估一致性,我们策划了一个多语言事实数据集以及一个新颖的泛化基准,其中包含基于文化的查询,以确定事实干预是否转移到更广泛的以目标为中心的偏好。 Gemma 3 12B Instruct 上的实验揭示了促使成为最强整体干预、平衡功效、安全性和域外泛化的角色。虽然 CAA 会产生急剧的不一致基准变化,但它对配置敏感,并且存在知识退化的风险。基于 DPO 的适配器可提供永久性的增益,但增益范围较小且可转移性较差。这些发现表明,跨语言不一致至少部分是一个选择问题,并且简单的上下文干预可能优于更具侵入性的方法,以实现稳健、可转移的对齐。