论文

SCRIPT:韩语预训练语言模型的子字符组合表示注入模块

SCRIPT: A Subcharacter Compositional Representation Injection Module for Korean Pre-Trained Language Models

模型训练监督微调与指令调优

摘要

韩语是一种形态丰富的语言,具有独特的书写系统,其中每个字符都由称为“字字”的子字符单元系统地组成。这些子字符不仅决定了韩语的视觉结构,还编码了频繁且具有语言意义的形态语音过程。然而,当前大多数韩语语言模型(LM)都是基于子词标记化方案,该方案并未明确设计用于捕获字符的内部组成结构。为了解决这一限制,我们提出了 SCRIPT,这是一个与模型无关的模块,可将子字符组合知识注入韩国 PLM 中。 SCRIPT 允许通过结构粒度增强子字嵌入,而不需要架构更改或额外的 预训练。因此,SCRIPT 增强了各种韩语自然语言理解 (NLU) 和生成 (NLG) 任务的所有基线。此外,除了性能提升之外,详细的语言分析表明 SCRIPT 重塑了嵌入空间,从而更好地捕捉语法规律和语义衔接变化。我们的代码可在 https://github.com/SungHo3268/SCRIPT 获取。