没有普遍的礼貌:使用 PLUM 语料库对 LLM 的礼貌效果进行跨语言、多模型研究
No Universal Courtesy: A Cross-Linguistic, Multi-Model Study of Politeness Effects on LLMs Using the PLUM Corpus
摘要
本文探讨了大语言模型(LLM)对不同程度的礼貌和不礼貌的用户提示的响应。 Brown 和 Levinson 的礼貌理论以及 Culpeper 的不礼貌框架构成了在三种语言(英语、印地语、西班牙语)、五种模型(Gemini-Pro、GPT-4o Mini、Claude 3.7 Sonnet、DeepSeek-Chat 和 Llama 3)以及用户之间的三种交互历史(原始、礼貌和不礼貌)之间进行的实验的基础。我们的样本由 22,500 对各种类型的提示和响应组成,使用八因素评估框架对五个礼貌级别进行评估:连贯性、清晰度、深度、响应性、上下文保留、毒性、简洁性和可读性。研究结果表明,模型的表现很大程度上受到语气、对话历史和语言的影响。虽然礼貌的提示可将平均响应质量提高约 11%,而不礼貌的语气会使平均响应质量恶化,但这些影响在不同语言和模型中既不一致也不普遍。英语最好用礼貌或直接的语气,印地语最好用恭敬和间接的语气,西班牙语最好用自信的语气。在这些模型中,Llama 对语气最敏感(11.5% 范围),而 GPT 对对抗性语气更稳健。这些结果表明,礼貌是一个影响 LLM 行为的可量化计算变量,尽管其影响取决于语言和模型,而不是普遍的。为了支持可重复性和未来的工作,我们还发布了 PLUM(言语礼貌水平,多语言),这是一个公开的语料库,包含 1,500 个经过人类验证的提示,涵盖三种语言和五个礼貌类别,并提供了对源自礼貌理论的六个可证伪假设的正式补充分析,并根据数据集进行了实证评估。