论文
超越基于参考的评估:语法错误纠正元评估的奖励模型
Beyond Reference-Based Evaluation: Reward Models for Meta-Evaluation of Grammatical Error Correction
摘要
基于参考的语法错误纠正 (GEC) 指标(例如 M$^2$ 和 ERRANT)假设参考集枚举了所有有效编辑,因此通常会惩罚语法和保留含义但措辞不同的更正。我们引入 RM-EVAL,这是一种根据 SEEDA 的人类偏好数据进行训练的奖励模型,作为无参考元评估器,可以在全序列和部分序列级别上预测类似人类的质量判断。除了评估之外,我们还表明,相同的奖励模型可以用作学习信号,通过奖励引导文本生成 (RGTG) 来改进 GEC 生成,从而保持基本 GEC 模型冻结并执行在线奖励驱动解码。在 SEEDA 中,RM-EVAL 与人类排名达成了高度一致,RGTG 在奖励和外部验证方面取得了一致的收益,展示了一个无需依赖黄金参考即可评估和增强 GEC 系统的统一框架。