论文
LLM 推理轨迹中的认知片段实现了可解释的人类物品难度预测
Cognitive Episodes in LLM Reasoning Traces Enable Interpretable Human Item Difficulty Prediction
摘要
预测人类项目难度是教育评估的核心,可靠的估计支持公平性和有效的测试构建。现有的方法通常依赖于昂贵的人工校准或项目级文本表示,提供了关于使项目变得困难的认知过程的有限证据。我们认为,难度不仅应被视为项目文本的属性,而且还应被视为项目引起的解决问题负担的可观察结果。大型推理模型 (LRM) 通过推理轨迹提供可扩展的过程证据,但此类证据必须结构化以支持可解释的建模。为此,我们引入了 Epi2Diff(Episode to Difficulty),这是一个将 LRM 推理轨迹映射到基于认知的情节序列的框架。这些事件将跟踪片段分组为功能性问题解决状态,从而可以通过推理规模、工作量分配和状态转换来对难度进行建模。 Epi2Diff 提取紧凑的情节动态特征并将其与语义项目表示相结合以进行人类难度预测。对四个真实世界人类难度数据集的实验表明,Epi2Diff 始终优于强大的基线,包括微调的小语言模型、LLM 上下文学习和监督 LLM 适应。在 SAT 派生的分类基准上,Epi2Diff 比受监督的 LLM 微调 基准实现了 8.1% 的平均相对增益。进一步的分析表明,更难的项目会引发更努力、迭代和以实施为中心的事件动态,而不仅仅是更长的反应。这些结果表明,LRM 推理轨迹中的认知事件为人类项目难度提供了预测性和可解释的过程表示,为推理模型的教育测量提供了新的视角。