论文

就在我的水平上:用于熟练程度感知文本简化的统一多语言框架

Right at My Level: A Unified Multilingual Framework for Proficiency-Aware Text Simplification

模型训练强化学习

摘要

文本简化通过提供与输入假设一致的可理解输入来支持第二语言 (L2) 学习。然而,构建个性化平行语料库的成本很高,而现有的基于 大语言模型 (LLM) 的可读性控制方法依赖于预先标记的句子语料库,并且主要针对英语。我们提出了 Re-RIGHT,一个统一的强化学习框架,用于在没有并行语料库监督的情况下进行自适应多语言文本简化。我们首先表明,即使使用最先进的 LLM(例如 GPT-5.2 和 Gemini 2.5),目标熟练程度(CEFR、JLPT、TOPIK 和 HSK)的基于提示的词汇简化在较简单的水平和非英语语言中表现不佳。为了解决这个问题,我们收集了四种语言(英语、日语、韩语和中文)的 43K 词汇级数据,并使用 Re-RIGHT 训练了一个紧凑的 4B 策略模型,该模型集成了三个奖励模块:词汇覆盖率、语义保留和连贯性。与更强的 LLM 基线相比,Re-RIGHT 在目标熟练程度下实现了更高的词汇覆盖率,同时保持了原始含义和流畅性。