论文

多模型 LLM 简答评分的可靠性、有效性和诊断证据

Reliability, validity, and diagnostic evidence for multi-model LLM short-answer scoring

模型评测模型能力评测

摘要

大语言模型 (LLM) 越来越多地用于或提议用于教育评分,但单模型和单次评估为评估使用提供的证据有限。简答评分需要有关可靠性、有效性、严重性、诊断价值和失败案例的证据。本研究评估了用于简答题评估的重复多模型 OCG-PRES 指导的 LLM 评分。该分析使用了 996 个 SciEntsBank 回复。 GPT、DeepSeek 和Qianwen 分别使用五个 OCG-PRES 维度对三个独立运行中的每个响应进行评分:概念覆盖率、关系准确性、推理完整性、矛盾控制和领域相关性。根据官方二元和五类标签评估分数,并根据答案长度、Jaccard 关键字重叠、TF-IDF 余弦相似度和组合的传统逻辑模型与非 LLM 基线进行比较。所有模型的重复运行可靠性都很高,其中 GPT 的 ICC(3,k) = 0.977、DeepSeek 的 ICC(3,k) = 0.992、Qianwen 的 0.981。 DeepSeek 在运行过程中是最稳定的。 GPT 显示出最强的 AUC 官方标签对齐(0.909),而Qianwen 则更严格,在固定阈值 = 3.0 规则下具有更高的精确度,但召回率较低。 OCG-PRES 评分遵循五个官方类别的预期诊断模式,并且在 AUC 和 F1 方面优于所有非 LLM 基线。重复的多模型 OCG-PRES 评分为 LLM 辅助简答评分提供了可靠性、有效性和诊断证据。研究结果支持谨慎、基于证据的使用作为评分支持工具,而不是替代人类判断。