论文
没有一个模型能够捕获所有危害:跨安全场景的内容审核基准测试
No One Model Catches Every Harm: Benchmarking Content Moderation Across Safety Scenarios
摘要
大语言模型 (LLM) 越来越多地部署在现实世界的应用程序中,但它们仍然容易生成有害内容。从绕过安全过滤器的对抗性越狱到逃避检测的隐性仇恨,这些模型带来的风险范围不断扩大。虽然专用内容审核器和通用 LLM 都被用作安全层,但哪种模型最适合哪种类型的有害内容的问题仍然没有答案。我们提出了迄今为止对 LLM 安全功能最全面的评估,系统地测试了 \textbf{11} 数据集的 \textbf{53} 模型,我们将这些数据集分为四个不同的类别。我们在仅提示和提示响应设置下的评估揭示了关键的盲点:在一个类别中领先的大型前沿模型明显落后于其他类别的较小的专业替代模型,并且所有模型系列中现实世界的对话安全性在很大程度上仍未得到解决。这些发现挑战了仅靠规模就能确保安全的假设,并为社区提供了一个用于明智模型选择的结构化框架。