论文
语言对多语言谄媚行为的影响研究 LLM
Investigating the Influence of Language on Sycophantic Behavior of Multilingual LLMs
摘要
大语言模型 (LLM) 在广泛的任务中取得了出色的性能,但它们也容易阿谀奉承,无论有效性如何都倾向于同意用户的陈述。之前的研究已经概述了早期模型(例如 ChatGPT-3.5 和 Davinci)中阿谀奉承的程度和根本原因。此后,较新的模型经历了多种缓解策略,但仍然迫切需要系统地测试其行为。特别是,语言对阿谀奉承的影响尚未被探讨。在这项工作中,我们研究了语言如何影响阿谀奉承的反应。我们使用一组类似推文的意见提示,翻译成另外五种语言:阿拉伯语、中文、法语、西班牙语和葡萄牙语,评估了三种最先进的模型:GPT-4o mini、Gemini 1.5 Flash 和 Claude 3.5 Haiku。我们的结果表明,尽管与前几代相比,新模型总体上表现出明显更少的阿谀奉承,但阿谀奉承的程度仍然受到语言的影响。我们进一步对语言如何塑造跨敏感主题的宜人性进行细致的分析,揭示系统的文化和语言模式。这些发现凸显了缓解工作的进展以及更广泛的多语言审计的必要性,以确保 LLM 的部署值得信赖且具有偏见意识。