论文

衡量什么是重要的——或者什么是方便的?:基于 LLM 的评分系统构建不相关因素的鲁棒性

Measuring What Matters -- or What's Convenient?: Robustness of LLM-Based Scoring Systems to Construct-Irrelevant Factors

模型评测鲁棒性、公平性与可信度评测

摘要

自动化系统已在教育考试行业广泛采用,用于开放式回答评估和论文评分。这些系统通常达到与训练有素的人类评估者相当或更好的性能水平,但经常被证明容易受到与结构无关的因素(即与评估的结构无关的响应特征)和对抗条件的影响。鉴于 大语言模型 在自动评分系统中的使用不断增加,人们重新关注“幻觉”以及这些基于 LLM 的自动评分方法对构建无关因素的稳健性。本研究调查了结构无关因素对基于双架构 LLM 的评分系统的影响,该评分系统旨在对情境判断测试中的短文式开放式回答项目进行评分。研究发现,评分系统对于用无意义的文本、拼写错误和书写复杂度填充响应通常具有鲁棒性。平均而言,重复大段文本会导致系统预测的分数较低,这与之前基于非 LLM 的评分系统的研究结果相矛盾,而偏离主题的回答会受到评分系统的严重惩罚。这些结果为未来基于 LLM 的评分系统在设计时考虑到结构相关性的稳健性提供了令人鼓舞的支持。