论文
生成-评估一致性:LLM赋能自适应测评的必要效度准则
Generative-Evaluative Agreement: A Necessary Validity Criterion for LLM-Enabled Adaptive Assessment
摘要
当同一个LLM既生成测评题目、又模拟学生作答、再对其评分时,验证循环是自指的。我们提出生成-评估一致性(GEA),一个衡量LLM评分函数能否复原其生成函数被指示产生的技能水平的效度准则。在对两阶段自适应测评的GEA首次直接测量中,模型仅复原约一半的预期方差(r = 0.698),并存在系统性正向偏差。对于语法上可验证的技能,GEA较高(r > 0.7),而对设计层技能接近于零;低技能高估会抬高路由阈值附近的分数。我们认为细粒度、按技能分解的评分量表是所提出的增强GEA的主要机制,并概述了互补的缓解措施。
