论文

大语言模型文化禁忌安全中的“知识-行为差距”

The "Knowledge-Behavior Gap" in Cultural Taboo Safety of Large Language Models

模型评测基准与评测资源

摘要

文化禁忌安全对于部署 大语言模型 (LLM) 至关重要,因为文化不敏感的输出可能会造成冒犯甚至社会危害。然而,现有的文化基准主要评估文化知识或价值观偏见,而忽略了LLM是否能够识别和尊重文化禁忌,尤其是当禁忌隐含在看似无害的问题中时。此外,文化禁忌是隐性的,并且依赖于背景,因此对可靠的评估提出了独特的挑战。为了解决这些差距,我们引入了 \textbf{CulShield},这是第一个致力于评估和提高 LLM 的文化禁忌安全性的公共基准。 CulShield 涵盖 77 个国家和地区,包含超过 2,020 项禁忌。它根据显性知识和隐性行为评估模型。在几个先进的 LLM(例如 GPT-4o-mini、Gemini-2.5-pro)上进行的实验揭示了明显的“知识-行为差距”:模型在交互过程中通常无法应用已知的禁忌。我们进一步表明,语言环境的变化可以显着影响 LLM 的文化禁忌安全。代码和数据可在此处访问:https://github.com/hedyHe/CulShield。