论文

多语言只是名义上的?乌尔都语 LLM 的文化和语言弱点

Multilingual in Name Only? Cultural and Linguistic Weaknesses of LLMs in Urdu

模型评测模型能力评测

摘要

多语言 大语言模型 (LLM) 越来越多地用于开放式文本生成,但它们在资源匮乏的语言中的行为仍然知之甚少。在这项工作中,我们质疑当用于故事生成任务时,多语言 LLM 的生成有多正确和可靠。我们将乌尔都语视为代表性的低资源语言。我们生成 Urdu-Stories,这是使用三个当代 LLM(GPT-5.1、Qwen-3-Max、DeepSeek-3.1)生成的 93 个故事的语料库。我们根据九个标签的语言、语义和文化分类法手动注释其中存在的错误。我们值得注意的发现表明,LLM 经常犯基本的语法和语义错误。这些故事缺乏连贯性,有不自然的重复,并且表现出普遍的文化浅薄。我们进一步表明,使用少量镜头提示,文化和语境错误在很大程度上仍未得到解决。我们的研究结果强调了当前 LLM 作为低资源语言的内容生成和信息检索的可靠来源的局限性。