论文

生成-评估一致性:LLM赋能自适应测评的必要效度准则

Generative-Evaluative Agreement: A Necessary Validity Criterion for LLM-Enabled Adaptive Assessment

模型评测评测方法与指标

摘要

当同一个LLM既生成测评题目、又模拟学生作答、再对其评分时,验证循环是自指的。我们提出生成-评估一致性(GEA),一个衡量LLM评分函数能否复原其生成函数被指示产生的技能水平的效度准则。在对两阶段自适应测评的GEA首次直接测量中,模型仅复原约一半的预期方差(r = 0.698),并存在系统性正向偏差。对于语法上可验证的技能,GEA较高(r > 0.7),而对设计层技能接近于零;低技能高估会抬高路由阈值附近的分数。我们认为细粒度、按技能分解的评分量表是所提出的增强GEA的主要机制,并概述了互补的缓解措施。

生成-评估一致性:LLM赋能自适应测评的必要效度准则:论文配图
图 3:校准曲线:观察到的平均技能作为真实熟练程度的函数。误差条显示 ±1\pm 1 SD。虚线对角线代表完美的校准。曲线在低技能水平时位于对角线上方(高估),并在高水平时收敛。