论文

通过共识驱动的偏好优化缓解 LLM 中的跨语言文化不一致

Mitigating Cross-Lingual Cultural Inconsistencies in LLMs via Consensus-Driven Preference Optimisation

模型训练偏好优化

摘要

尽管其功能令人印象深刻,但多语言 大语言模型 (MLLM) 在提示语言更改时经常表现出不一致的行为。虽然这种适应通常是可取的,但当用户的身份被明确定义时,它就会成为严重的失败。例如,给定一个固定的英国角色和一个关于文学的模糊日常知识查询,提示的语言经常会覆盖系统角色——产生英语的莎士比亚,但西班牙语的塞万提斯。为了有力地量化这种跨语言文化不一致,我们引入了 Singleton Fleiss 的 $κ_S$,这是一种在数学上对幻觉有弹性的度量。为了缓解这一问题,我们提出了跨语言文化一致偏好优化(C-3PO),这是一个共识驱动的协调框架。与未对齐模型相比,C-3PO 的 $κ_S$ 绝对增加了 0.13 点,始终优于强提示和表示引导基线,同时保留了明确的用户身份、文化中立性和内在文化知识。实证评估表明,这种不一致对印度尼西亚语和波斯语等资源较低的语言产生了不成比例的影响。最后,中间层的早期解码表明,随着前向传递表征的稳定,MLLM 隐式地将输出个性化为提示语言的刻板文化。