论文
AIriskEval-edu Demo:教学讲解中教学风险的审计
AIriskEval-edu Demo: Auditing of Pedagogical Risks in Educational Explanations
摘要
我们提出AIriskEval-edu Demo,一个审计教学讲解的教学质量并提供可解释审计结果的平台。该平台依据一份覆盖教学风险五个维度的评分准则评估讲解:事实准确性、深度与完整性、聚焦性与相关性、学生层面的适切性,以及意识形态偏见。对每个维度,它返回一个二元判定和置信度分数。检出的风险还包含自然语言理由,并且除深度与完整性外还附有定位的证据片段。该平台通过外部API集成GPT-5.5,以及一个在消费级GPU上运行的自托管Llama 3.1 8B评估器。本地评估器在AIriskEval-edu上微调,该数据集包含带风险与可解释性标注的K-12教学讲解。平台以两种模式运行:在AI模式下,两个评估器评估在六种模拟教师画像下生成并存储的讲解,每种画像代表一种不同的教学行为与潜在风险;在人工模式下,本地评估器实时审计用户撰写的讲解。本地评估器在多数报告指标上优于GPT-5.5,为教育机构提供了一种将受审内容保留在自身基础设施内的实用方式。
