论文
VAA-CSEC:中文语义纠错的投票引导优势分配
VAA-CSEC: Vote-guided Advantage Allocation for Chinese Semantic Error Correction
摘要
中文语义错误纠正 (CSEC) 针对中文文本中的语义错误,这些错误通常比拼写和语法错误更加微妙和复杂,但仍然相对未得到充分研究。现有的基于LLM的方法在这项任务中面临两个反复出现的障碍:过度校正,以及思想链(CoT)推理和自洽解码之间的相互作用不明确,使得CoT带来的好处无法可靠地转移到最终的校正。我们提出了 CSEC 的投票引导优势分配(VAA-CSEC),这是一个结合了 CoT 蒸馏、监督微调(SFT)、强化学习(RL)和自一致性解码的多阶段框架。在 RL 过程中,我们设计了一个特定于任务的奖励函数,该函数与 CSEC 的最小编辑原则直接一致。我们进一步引入了组级相对策略优化(GLPO),它根据个体rollout奖励和投票聚合组奖励之间的差距重新分配 GRPO 优势,使 RL 训练目标与推理时使用的自洽目标保持一致。 CSED-C 和 NaSGEC-Exam 上的实验表明,VAA-CSEC 优于 CSED-C 上所有基于 LLM 的基线,F0.5 为 47.72%,在所有方法中实现了 42.15% 的最高召回率,并在 NaSGEC-Exam 上建立了 41.55% F0.5 的最新技术水平。