论文

好奇心时代遇上人工智能时代:大语言模型 中的儿童安全基准

The Age of Curiosity Meets the Age of AI: Benchmarking Child Safety in Large Language Models

模型评测基准与评测资源

摘要

儿童越来越多地接触到 大语言模型 (LLM),这可能会使他们面临发育不适当或需要年龄敏感的安全、指导和界限的反应。现有的 LLM 安全评估主要侧重于一般有害内容的避免,并没有明确针对面向儿童的安全。我们推出了 KIDBench,这是一个使用基于发展心理学的 LLM-as-a-Judge 评分标准来评估 7-11 岁儿童的 LLM 安全性的基准。 KIDBench 包含十个类别的真实子查询,具有单轮提示和多轮儿童演员模拟。我们比较了没有儿童背景的无提示提示、建议儿童说话的隐式提示提示和明确的年龄指示。隐式提示比无提示的分数提高了 8.6-46.8%,而显性年龄比隐式提示的分数提高了 9.9-30.4%。跨语言和文化评估显示,不同语言和国家背景下的安全行为参差不齐。多圈模拟显示峰值质量在 1-5 等级上下降了高达 0.959 点。我们还引入了儿童安全评估器 KIDGuardLlama 和儿童安全响应模型 KIDLama。代码、数据和评估资源可在 https://github.com/MichiganNLP/kidbench 上获取。