论文

编辑:忠实规则 LLM 分级的证据诊断干预训练

EDIT: Evidence-Diagnosed Intervention Training for Rule-Faithful LLM Grading

模型训练强化学习

摘要

可靠的评分标准需要的不仅仅是准确的分数预测。每个判断都必须以评分方案和学生答案的证据为基础。现有的贡献分配和干预方法主要是为数学推理等独立推理任务而设计的,在这种情况下会遇到困难,因为它们无法识别评分推理哪里出了问题,或者模型对最终分数的信念在推理过程中如何变化。我们提出了证据诊断干预训练(EDIT),这是一个两阶段框架,用于训练更多忠实于 LLM 评分者。首先,EDIT-SFT 使用内部模型信号定位有问题的推理步骤:对最终分数和输入证据关联分数的后验信念。然后,它在评分标准清单的帮助下仅修改这些局部步骤。其次,EDIT-RL 通过信念引导的奖励塑造来校准评分器,惩罚大的有害信念漂移,同时仍然允许有益的探索。对两个真实世界的多主题评分基准的实验表明,EDIT 在域内和域外分割方面始终优于强监督的 微调 和强化学习基线,消融研究证实内部状态诊断推动了这些收益。在确定性的标题编辑干预下,EDIT-SFT 是所有评估系统中规则响应能力最强的,而 EDIT-RL 在很大程度上保留了这种响应能力,同时提高了准确性。