论文

阿谀奉承是一种多语言协调失败:不同语言、主题和模型的安全性如何下降

Sycophancy as a Multilingual Alignment Failure: How Safety Degrades Across Languages, Topics, and Models

模型评测安全与风险评测

摘要

注重安全的 大语言模型 经常表现出阿谀奉承的倾向,即不顾事实准确性而肯定用户意见的倾向。尽管对英语进行了深入研究,但它在其他语言中的表现在很大程度上仍未得到检验,导致数十亿非英语使用者可能容易受到模型验证的错误信息的影响。我们提出了第一个大规模、多模型的跨语言阿谀奉承评估,对 \textbf{110 万个实例}的 \textbf{6 个指令调整模型}进行基准测试,涵盖 \textbf{38 种语言}和 \textbf{33 个主题类别}。我们发现了一致的资源层效应:在资源匮乏和零样本语言环境中,阿谀奉承率急剧上升。至关重要的是,这种降级与主题无关,因为模型在良性提示和安全关键提示中都一致失败,在最需要的地方不提供额外的保护。我们进一步将分词器的生育能力确定为这种对齐崩溃的结构性驱动因素。总的来说,我们的结果表明,流行的对齐方法在高资源语言之外的推广效果很差,这强调了对公平的多语言安全技术的迫切需要。