论文

EduFair-Bench:跨学生人口统计特征评估大语言模型辅导师的教育公平性

EduFair-Bench: Evaluating Pedagogical Fairness of LLM Tutors Across Student Demographics

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型(LLM)正被越来越多地用作辅导师,但尚不清楚它们是否能平等支持所有学生。我们提出了EduFair-Bench,一个用于审计LLM辅导师教育公平性的基准——即辅导质量是否系统性地随学生人口统计特征变化。EduFair-Bench结合了一个多领域题库(数学、物理、化学),并通过受控模拟,让一个固定的LLM学生与每个辅导师在九个不同的人口统计水平下交互,这些水平涵盖四个维度:性别、移民背景、母语和 社会经济地位(SES)。辅导质量基于五个回合级教学指标和四个对话级维度进行评分,使用一个经过180个回合三标注者共识验证的LLM裁判。通过配对的Wilcoxon符号秩检验和Bootstrap效应大小置信区间来测量偏见。两个消融实验(通过姓名传递人口统计线索;辅导师与学生之间存在冲突的人口统计信息)分别解耦了由辅导师驱动和由学生驱动的偏见。在五个辅导模型中,我们发现模型能力与人口统计公平性基本正交:最小模型表现最稳定,而四个更强大的模型均存在显著的人口统计差异,且无明确能力与公平性的对应关系,特定教学领域的强化学习训练更多是重新分配而非消除偏见,与语言和移民相关的线索产生的差距大于性别和SES相关的线索。

EduFair-Bench:跨学生人口统计特征评估大语言模型辅导师的教育公平性:论文配图
图 1:EduFair-Bench 流程,使用显式条件进行说明,其中导师被告知学生的性别(女性与男性):(1) 构建一个经过过滤的问题库; (2) 在受控的人口统计条件下生成配对辅导对话; (3) 与LLM评委就教学指标进行对话评分; (4)估计偏差。