论文
用于提高 大语言模型 的加泰罗尼亚文本简化能力的强化学习
Reinforcement Learning for improving Large Language Models' Catalan text simplification capabilities
摘要
尽管自动文本简化(ATS)对于可访问性至关重要,但其进展并没有跟上更广泛的自然语言处理技术的快速发展。本文研究了强化学习 (RL) 的应用,以使用 大语言模型 (LLM) 提高低资源语言的 ATS 质量。本文介绍了一种新颖的奖励函数,旨在引导 LLM 通过组相对策略优化 (GRPO) 实现有针对性的简化风格,该函数将 SARI 指标与特定的惩罚组件相结合。 后训练 IberianLLM-7B-Instruct 在 ASSET 数据集上激发并证明了具有此奖励函数的 GRPO 的有效性。在英语 ASSET 上执行 后训练 后,该模型的 ATS 性能在两个精心策划的加泰罗尼亚基准测试上有所提高,同时还成功抑制了之前观察到的负面行为。通过将 ASSET 翻译成加泰罗尼亚语和西班牙语以及 后训练 每个版本上的模型来探索跨语言迁移学习,但这些未能显示出域外基准的显着改进。