论文

用于根据多语言提示生成代码的 大语言模型:精心设计的基准和代码质量研究

Large Language Models for Code Generation from Multilingual Prompts: A Curated Benchmark and a Study on Code Quality

模型评测基准与评测资源

摘要

当使用不同的自然语言进行提示时,大语言模型 (LLM) 在相同的编程任务上表现不同,这种现象称为语言偏差。虽然这种行为已针对一般文本生成进行了广泛研究,但其对代码生成质量和编程约定的影响在很大程度上仍未得到探索。我们研究了用于描述编程任务的语言如何影响 GPT-4o mini、DeepSeek 和 Claude 生成的源代码。我们的研究包括 460 个编码任务,涵盖 Python (230) 和 Java (230)。我们将原始英语提示翻译并手动翻译成中文、印地语、西班牙语和意大利语,同时保留其技术含义。我们使用多个维度评估生成的代码,包括通过测试通过率的功能正确性、使用既定代码指标的结构质量、静态分析工具检测到的问题以及标识符和注释中使用的语言等词汇特征。我们的结果表明,(i) 英语提示并不能始终产生最佳的功能正确性或代码质量,(ii) 提示语言的影响取决于编程语言和 LLM,(iii) 生成的代码经常在注释和字符串文字中将英语与提示语言混合。这些发现为研究代码生成中的语言偏差提供了第一个精心策划的多语言基准,并为开发更强大的多语言代码生成系统提供了见解。