论文

SHAPE:统一教育的安全性、帮助性和教学法 LLM

SHAPE: Unifying Safety, Helpfulness and Pedagogy for Educational LLMs

模型评测基准与评测资源

摘要

大语言模型(LLM)在教育场景中得到了广泛的探索。我们发现了当前教育 LLM(教学越狱)中的一个严重漏洞,学生使用答案诱导提示来引出解决方案,而不是支架式指令。为了实现系统化学习,我们通过知识掌握图来统一和形式化安全、有益和教学行为,并引入 SHAPE,这是一个包含 9,087 个学生问题对的基准,用于评估对抗压力下的辅导行为。我们提出了一种图增强的辅导管道,该管道可以从查询中推断出先决条件概念,识别掌握差距,并通过显式门控在指导和解决问题之间生成路线。多个 LLM 的实验表明,我们的方法在两种教学越狱设置下显着提高了安全性,同时在相同的评估协议下保持了接近天花板的有用性。我们的代码和数据可在 https://github.com/MAPS-research/SHAPE 获取