论文
AICompanionBench:面向AI伴侣安全的LLM即裁判基准
AICompanionBench: Benchmarking LLMs-as-Judges for AI Companion Safety
摘要
随着 Replika 和 Character.AI 等人工智能配套平台的迅速发展,人们对不安全的人机交互的担忧也日益加剧。这项研究引入了 AICompanionBench,据我们所知,这是第一个公开的人类与人工智能同伴对话的基准数据集,并标注了细粒度的安全风险类别。该数据集包含从 Reddit 收集的 2,123 个真实世界的 Replika 对话,并通过人类与人工智能协作进行注释,涵盖九个类别:性行为、反社会行为、身体攻击、言语攻击、药物滥用、自残和自杀、控制、操纵和无伤害。使用这个基准,我们在大语言模型作为法官的框架下评估了 20 个最先进的开源和闭源大语言模型,以检测不安全的交互。结果显示,模型性能存在巨大差异,更强大的模型实现了较高的整体准确性,但仍然难以应对诸如操纵等细微类别,以及被错误地识别为有害的良性对话。我们的研究结果表明,虽然当前的大语言模型可以有效地检测明确的有害内容,但它们在识别隐性不安全互动方面仍然有限。总的来说,我们的工作为人工智能陪伴安全研究提供了一个新的基准数据集,并提供了使用大语言模型监控人工智能陪伴系统的见解。该数据集可公开获取:https://github.com/anonymousresearcher2026/AICompanionBench/blob/main/AICompanionBench.xlsx
