论文

提示中自然语言差异对使用大语言模型自动代码生成的影响的研究

A Study on the Impact of Natural Language Differences in Prompts on Automatic Code Generation Using LLMs

模型评测鲁棒性、公平性与可信度评测

摘要

大型语言模型(LLM)在自动代码生成任务中表现出了卓越的性能,从而鼓励了该领域的新研究。尽管许多研究已经探索了基于 LLM 的代码生成,但输入提示中自然语言的影响仍未被探索(语言偏差)。本研究旨在 (1) 量化输入提示的自然语言如何影响基于 LLM 的代码生成性能,以及 (2) 评估缓解策略以减少代码生成中的语言偏差。我们在 AtCoder、LeetCode 和 BigCodeBench 上评估代码生成的准确性。为了量化代码生成的语言偏差,每个问题都以英语、日语和中文呈现。我们使用七个 LLM(GPT-4o、o3-mini、DeepSeek-V3.2、Llama-3、Qwen2.5-Coder-14B、Qwen2.5-Coder-0.5B 和 GitHub Copilot)并根据准确性(生成的代码通过所有测试用例的问题数量)评估其性能。我们比较翻译前后的准确性,以评估翻译作为缓解策略的有效性。我们观察到问题陈述的自然语言会影响基于 LLM 的代码生成性能。具体来说,每个数据集官方支持的语言都达到了最高的中值准确率。此外,翻译提高了准确性,但其有效性在不同数据集和模型类型之间并不一致。我们发现 AtCoder 包含特别高比例的叙述式问题陈述和较长的问题陈述。自然语言显着影响 LLM 代码生成的准确性。翻译可以减轻某些设置中的语言偏差,但其有效性取决于数据集和模型类型。此外,输入提示的叙述方面和上下文长度是与语言偏见和翻译作为缓解策略的有效性相关的重要因素。