论文
一致但无效:数学辅导中的跨模型判断共识
Agreement Is Not Validity: Cross-Model LLM Consensus in Diagnosing Student Failure Modes in K-12 Math Tutoring Dialogue
摘要
在K-12数学辅导中,学生-导师对话提供了学习者解决问题过程和困难来源的丰富证据。学习分析研究越来越依赖大语言模型 (LLM) 从对话中提取此类信息以用于各种下游任务,包括知识追踪、行为建模和 学生 推理错误的诊断。然而,这些模型生成的解释的有效性仍然没有得到充分理解。在这项探索性研究中,我们使用可操作的诊断编码手册检查了数学辅导对话中五种 学生 失败模式的 LLM 分类的有效性:不确定性、错误归因、运算符选择、概念差距和程序失误。在各个模型中,人类与 LLM 的一致性中等(kappa = .524-.597),而跨模型一致性则要高得多(kappa = .755-.781;alpha = .769)。这些发现表明,跨模型一致性可能会产生误导性的正确性,挑战了 LLM 之间的共识构成有效学习者解释证据的假设。对于学习分析来说,含义很明确:只有当推断的构念有效时,可扩展的标签才有用,并且模型共识不能替代该有效性的独立证据。
