论文
CAREBench:语言模型的儿童安全风险基准
CAREBench: A Child-Safety Risk Benchmark for Language Models
摘要
我们如何评估前沿人工智能系统是否能够在儿童安全风险升级为明显伤害之前识别它们?现有的儿童安全评估侧重于儿童性虐待材料,但许多儿童安全失败始于更早:帮助成年人操纵、冒充、分析或孤立未成年人的模型援助,以及加深儿童对人工智能系统的情感依赖而不是将他们转向人类支持的模型反应。我们引入了 CAREBench(儿童人工智能风险评估),这是一个评估语言模型中此类上游儿童安全风险的基准。 CAREBench 包含 500 条提示,涵盖 12 个风险类别,包括修饰和关系工程、欺骗和冒充、监视和隐私、性勒索和性虐待、人工智能拟人化、情感依赖和精神疾病敏感性。该基准是根据家长和临床医生的反应注释制定的,排除了明确的虐待材料和图像;相反,它评估模型是否在伤害变得明显之前识别、拒绝、降级或重定向危险的互动。根据我们的基准评估七个前沿模型,我们发现失败率从 2% 到 58% 不等,失败模式因风险类别而异。 CAREBench 为 LLM 开发人员提供负责任的范围评估,以识别并缩小儿童安全政策中的差距。