论文
在不使用生成时间概率信号的情况下预测 LLM 作为法官难度评估中与人类评分者的分歧
Predicting Disagreement with Human Raters in LLM-as-a-Judge Difficulty Assessment without Using Generation-Time Probability Signals
摘要
使用 大语言模型 (LLM) 自动生成教育材料变得越来越普遍,但为此类材料分配难度级别仍然需要大量的人力。因此,LLM-as-a-Judge 引起了人们的关注,但与人类评分者的分歧仍然是一个重大挑战。我们提出了一种方法来预测哪些 LLM 生成的难度评级可能与人类评级者不一致,以便可以将此类案例发送以进行重新评级。与之前的方法不同,我们的方法不依赖于生成时概率信号,这些信号必须在评级生成期间收集,并且通常很难在 LLM 之间进行比较。相反,利用难度是序数尺度的事实,我们使用单独的嵌入空间(例如 ModernBERT),并根据评级集的几何一致性来识别分歧候选者。使用 GPT-OSS-120B 和 Qwen3-235B-A22B 对基于英语 CEFR 的句子难度评估进行的实验表明,与基于概率的基线相比,该方法在预测与人类评分者的分歧方面取得了更高的 AUC。