论文

识别 LLM 中的高置信度社交偏见,以获取值得信赖的会话辅导代理

Identifying High-Confidence Social Biases in LLMs for Trustworthy Conversational Tutoring Agents

模型评测鲁棒性、公平性与可信度评测

摘要

对话式辅导代理已被证明可以提高学习参与度和学生成绩,并且 大语言模型 (LLM) 越来越多地在这些系统中使用,以提供可扩展的个性化反馈。然而,LLM 可能会延续或放大刻板的社会偏见,在教育环境中带来特殊的风险。在本研究中,我们在对话辅导场景中评估 LLM,以识别高置信度的社会偏见,即模型无法识别辅导对话中的偏见判断,同时保持对评估的强烈信心的情况,可能会影响他们的推理和向学习者提供的反馈。我们提出了一种新的数据集生成方法,通过重新生成学生与人工智能导师的交互并引入从基准数据集导出的受控偏差轮流,可以在自然教学条件下进行偏差评估。使用这些数据,我们评估了多个 LLM 检测刻板偏见的能力,并通过计算和人工评估分析其反应背后的置信度和推理。我们发现,在对话辅导环境中,偏见检测比基于基准的评估更具挑战性,而且最先进的 LLM 对他们对刻板偏见陈述的错误评估过于自信。此外,模型信心强烈影响推理和反馈,突出了基于 LLM 的辅导代理过度自信和偏见行为的风险。最后,我们讨论了影响、缓解考虑因素和未来研究的方向。