论文
CSRP:通过具有效率感知奖励的强化学习进行中文文本校正的思想链推理
CSRP: Chain-of-Thought Reasoning for Chinese Text Correction via Reinforcement Learning with Efficiency-Aware Rewards
摘要
基于 大语言模型 (LLM) 的中文语法错误校正 (CGEC) 系统面临两个关键挑战:通用模型缺乏针对细微语法区别的专门语言先验,并且具有最大似然估计的监督 微调 (SFT) 无法针对以精度为中心的指标进行优化,从而导致系统性过度校正。我们提出了 CSRP,一个三阶段框架,通过在 590 万个平衡样本上的持续 预训练 (CPT) 逐步构建校正能力,以内化领域知识,具有明确错误推理的思想链 SFT 以实现诊断透明度,以及具有新颖的效率感知奖励的组相对策略优化,可明确惩罚不必要的编辑。在 NACGEC 基准上,CSRP 实现了最先进的性能,达到 50.99 $F_{0.5}$ 和 57.17 精度,大大优于之前的最佳结果,同时有效减轻 MLE 训练模型中固有的过度校正偏差。我们的方法还将 CSCD 拼写校正提高到 59.61 F1,超过 GPT-4 5.20 分。全面的消融研究表明,RL 对齐阶段相对于 SFT 基线贡献了 8% 的相对增益,并且该增益与大规模 CPT 的贡献正交,验证了编辑效率的显式优化对于高质量语法错误校正至关重要。我们的代码可在 https://github.com/TW-NLP/ChineseErrorCorrector 获取。