论文

隐式和显式人口统计信号在基于大型语言模型的学生评估中的作用

The Role of Implicit and Explicit Demographic Signals in Large Language Model-based Student Assessment

模型评测鲁棒性、公平性与可信度评测

摘要

大型语言模型现在在学生评估中很常见,但我们对学生人口统计数据如何影响其使用知之甚少。有时,考虑学生的人口统计数据可能是必要的 - 例如,为了提高教育水平较低的用户的可读性。然而,它也有可能成为歧视的原因,例如,当给社会经济背景较低的学生分配较低的分数时。我们设置受控提示来测试 1) 显性人口统计效应,即我们直接提及人口统计详细信息,以及 2) 隐性效应,即我们使用对话历史记录作为人口统计信号。我们在三项任务中测试这些设置:论文自动评分、形成性反馈和元语言问答。我们在这些任务上测试了六位最先进的大语言模型。在显式和隐式情况下,模型都会获取人口统计线索,并可以相应地改变其评分、反馈和答案。我们发现,当明确提及这些内容时,大语言模型经常根据教育水平调整反馈的可读性。另一方面,隐性条件会产生不可预测的偏差,例如在回答问题时,来自较低教育水平的回答会得到较低的情绪分数。我们的结果提供了大语言模型对教育评估任务的人口敏感性的明确证据。