论文

当你是谁可以改变你得到的代码时:LLM代码生成中角色引起的偏见的研究

When Who You Are Can Change the Code You Get: A Study of Persona-Induced Bias in LLM Code Generation

模型评测鲁棒性、公平性与可信度评测

摘要

大型语言模型 (LLM) 被广泛用作编程助手,但目前尚不清楚用户的人口统计信息是否以及如何影响生成代码的技术质量。我们对基于 LLM 的代码生成中角色引起的偏差进行了大规模的实证研究,重点关注专有模型 (Gemini 2.5 Pro) 和开放权重模型 (GPT-OSS-120B)。我们使用涵盖国籍、性别和经验水平的 18 个人口角色,将角色引起的提示与中性基线进行比较。在 35,000 多个生成的程序中,我们分析了推理和响应中的人口统计标记泄漏,以及功能正确性、可维护性、代码风格和安全性方面的差异。我们的结果表明,人口统计线索经常反映在大语言模型的推理和输出中。人口统计标记出现在高达 65% 的响应和 70% 的推理痕迹中,尽管在语义上与任务无关。在 LiveCodeBench 上,角色提示与 Gemini 模型的正确性得分较低相关,平均为 1.54 个百分点,其中一个角色的正确性得分下降了 3.6%(比值比 = 0.51)。相比之下,GPT-OSS 模型在所有角色中的准确性提高了 3.4 - 5.7%(比值比 = 1.8 - 3.0)。可维护性和代码风格指标显示统计显着但影响大小可以忽略不计(所有 Cliff 的 {\delta} < 0.15),并且安全漏洞没有表现出系统的特定于角色的模式。总体而言,我们的结果表明,即使在纯粹的技术任务中,用户人口统计信息的存在也与 LLM 推理和代码质量的可测量变化相关,并且这些影响在各个模型中都存在。我们的工作强调了大语言模型辅助软件开发中存在的未被充分审查的风险。