论文
LLM 对越南方言的鲁棒性如何?
How Robust Are LLMs to Vietnamese Dialects?
摘要
大语言模型 (LLM) 通常使用标准越南语进行评估,但日常交流经常涉及保留含义但表面形式不同的地方方言。现有的越南方言工作主要通过方言到标准标准化来解决这个问题,而不是衡量模型在越南方言输入下如何失败。为了解决这一差距,我们首次系统地评估了 LLM 对跨多个任务的越南方言变化的鲁棒性,量化了性能下降和故障模式。我们引入了 VialectBench(越南方言基准),这是一个受控基准,用于测试模型决策在六个越南方言组中是否保持稳定。 VialectBench 包含 400 个标准越南语源实例和 2,400 个人工编写的方言重写,涵盖情感识别 (ER)、自然语言推理 (NLI)、问答 (QA) 和多项选择问答 (MCQA)。使用固定参考语言模型的数据集评估表明,方言重写会引起可测量的模型相对似然变化,同时保持与标准对应语言几乎相同的长度。在 10 个指令调整模型中,方言输入使平均性能降低了 2.82%,并且没有一个评估模型是完全方言不变的。所有四项任务都受到影响,其中 QA 显示出最大的平均降级。不同方言组之间的稳健性也存在很大差异:PNT3 和 PNT2 导致平均性能下降最大,分别为 6.17% 和 4.73%,而 PNB 平均性能略有提高 0.42%。中部方言组 (PNT1-PNT4) 在所有模型中的平均有害翻转率也最高,为 6.54%。这些发现表明,标准越南语的出色表现并不能保证在保留意义的区域差异下的可靠行为。