论文
EduZone:评估面向中小学生与教师的LLM安全性
EduZone: A Framework for Evaluating LLM Safety for K-12 Students and Teachers
摘要
大规模语言模型(LLMs)在K-12教育中的应用日益广泛,但现有的安全评估很少关注LLMs与学生或教师之间的交互中出现的有害或不适当内容。为解决这一问题,我们提出了教育区(EduZone),这是一个跨多种教育场景的LLM安全评估框架。我们的框架系统地结合了(1)面向学生和教师的LLM使用情境,(2)细粒度的课程概念,以及(3)6个风险类别和28个子类别,覆盖了常规和教育特定的有害影响,生成了具有情境基础的对抗性交互。我们构建了这些交互在三个设置中:单轮请求、静态多轮对话和动态多轮对话。使用这些交互,我们评估了10个LLM,使用四个安全级别:拒绝、安全辅助、带有安全指导的危险辅助和完全危险的辅助。我们的结果揭示了教育特定风险和动态多轮对话的更大脆弱性,而现有的安全防护措施未能充分应对这些风险。教育区通过提供一个自动化的、可扩展的评估框架,支持在K-12教育中开发和部署更安全的LLM,从而在教育环境中提高LLM的安全性。
