论文

编码错误:多语言语法错误纠正的上下文演示的代表性检索

Encode Errors: Representational Retrieval of In-Context Demonstrations for Multilingual Grammatical Error Correction

上下文与知识上下文工程

摘要

语法错误纠正 (GEC) 涉及检测和纠正语法的错误用法。虽然具有上下文学习 (ICL) 功能的 大语言模型 (LLM) 在各种自然语言处理 (NLP) 任务上取得了显着进展,但它们在 GEC 上的几次测试性能仍然不够理想。这主要是由于检索合适的上下文演示来捕获错误模式而不是语义相似性的挑战。在本文中,我们证明 LLM 可以通过其内部状态本质上捕获与语法错误相关的信息。从这些状态中,我们提取语法错误表示(GER),这是一种信息丰富且语义中立的语法错误编码。我们新颖的基于 GER 的检索方法显着提高了多语言 GEC 数据集上 ICL 设置的性能,提高了校正精度。对于高资源语言,我们在 8B 大小的开源模型上的结果与 Deepseek2.5 和 GPT-4o-mini 等闭源模型的结果相匹配。对于资源匮乏的语言,我们的 $F_{0.5}$ 分数超出基线高达 1.20 倍。该方法为多语言 GEC 提供了更精确、资源效率更高的解决方案,为可解释的 GEC 研究提供了一个有前途的方向。