论文

Indi-RomCoM:用于评估罗马化印度语-英语指令上的 LLM 的代码混合基准

Indi-RomCoM: Code-Mixed Benchmark for Evaluating LLMs on Romanized Indic-English Instructions

模型评测基准与评测资源

摘要

罗马化代码混合 (RCM),即双语使用者将当地语言与罗马文字的英语流畅地融合在一起,已成为跨语言社区的主要沟通形式。虽然 大语言模型 (LLM) 在单语言和本机脚本基准测试中表现强劲,但它们遵循指令和推理基于 RCM 的内容的能力在很大程度上仍未得到探索。为此,我们引入了 Indi-RomCoM 基准,以促进对印度语罗马化代码混合指令的系统评估。我们的基准测试涵盖七种指令跟踪任务、四种广泛使用的印度语言和三种受控的代码混合强度级别。我们广泛评估了一套 LLM,涵盖零次和少量设置下的专有、开放权重和印度语聚焦模型。 LLM 在 RCM 指令上始终表现不佳,随着代码混合密度的增加,性能会下降。此外,推理任务比检测任务(例如毒性)遭受的退化更少,因为生成的解释提供了必要的上下文。我们相信 Indi-RomCoM 可以帮助社区开发包容性的多语言系统。