论文

越南高地、三角洲和海岸的回声:占婆语、高棉语和西农语多语言语料库

Echoes Across Vietnam's Highlands, Delta, and Coast: A Multilingual Corpus for Cham, Khmer, and Tay-Nung

模型评测基准与评测资源

摘要

越南的少数民族语言在自然语言处理(NLP)领域几乎不存在,挑战不仅仅限于数据稀缺:占族语、高棉语和泰农语在文字、越南语接触和标准化方面存在巨大差异,在这些条件下,标准多语言适应可能会学习到错误的信号。我们引入了 CKTN,这是这些语言的第一个语料库和基准(44,367 个文档,24M 个子词标记),涵盖持续预训练、类别分类和摘要文档检索。我们表明,现有的多语言编码器严重分割了这些语言,并且常见的适应指标可能会产生误导:模型可能会降低语言建模损失或擅长词汇重叠检索,但仍然无法跨文档进行语义泛化。我们通过脚本感知的适应方案来解决这个问题——词汇扩充与校准的替换词元预训练相结合——防止鉴别器利用微不足道的脚本不匹配。结果是编码器的碎片大大减少,并且在评估的模型中具有最强的分类性能,暴露了词汇重叠检索作为评估信号的局限性。