论文

超越分数预测:基于 LLM 的论文评分和通过强化学习与 Rubric 奖励生成反馈

Beyond Score Prediction: LLM-Based Essay Scoring and Feedback Generation via Reinforcement Learning with Rubric Rewards

模型训练强化学习

摘要

大语言模型(LLM)已广泛应用于自动论文评分(AES)和自动反馈生成(AFG)。然而,现有研究主要依赖于即时工程或监督微调,而关于强化学习(RL)后训练和反馈质量自动评估的系统研究仍然有限。我们提出了 RLAES,这是一个统一的 LLM 框架,通过 RL 联合优化论文评分和反馈生成。为了使反馈质量可测量、可解释并可用于训练,我们引入了基于 Rubric 的反馈评估 (RFE),这是一个基于论文的反馈评估框架,由 166 个细粒度的二进制评估项目和一个 LLM 作为评委。在 RFE 的基础上,我们提出了自适应门控反馈优化 (AGFO),它可以在 RL 期间按需激活基于规则的反馈奖励,减少评估开销,同时提高反馈质量。我们还提出相邻对比推理(ACR),通过明确对比相邻分数水平来改进序数分数校准。实验结果表明,RFE 框架捕获了论文反馈的一致性,表现出强大的成对判别能力,并且与专家偏好紧密一致。在 ASAP 基准上,RLAES-AGFO 在基于 LLM 的方法中实现了最佳评分性能(QWK = 0.803),同时保持了与 GPT-5.5 相当的反馈质量,并避免了仅评分 RL 下观察到的反馈退化。代码和数据集可在 https://github.com/hellomuyi/RLAES 上公开获取。