论文
性别提示和 LLM 代码审查:性别提示如何影响代码质量和评估
Gendered Prompting and LLM Code Review: How Gender Cues in the Prompt Shape Code Quality and Evaluation
摘要
LLM 越来越多地嵌入到编程工作流程中,从代码生成到自动代码审查。然而,性别沟通方式如何与 LLM 辅助编程和代码审查相互作用仍有待探索。我们提出了一项混合方法试点研究,研究提示中与性别相关的语言差异是否影响代码生成结果和代码审查决策。在三项互补研究中,我们分析了(i)收集的真实世界编码提示,(ii)受控用户研究,其中开发人员在 LLM 的帮助下解决相同的编程任务,以及(iii)基于 LLM 的模拟评估框架,系统地改变性别编码提示风格和审阅者角色。我们发现,提示风格中与性别相关的差异虽然微妙,但可以衡量,女性创作的提示表现出更多间接和复杂的语言,这并不会转化为功能正确性或静态代码质量方面的一致差距。相比之下,对于 LLM 代码审查,我们观察到系统偏差:平均而言,尽管质量相当,但模型更认可女性编写的代码。对照实验表明,性别编码的提示样式会影响代码长度和可维护性,而审阅者的行为因模型而异。我们的研究结果表明,LLM 辅助编程中的公平风险较少来自生成准确性,而不是来自 LLM 评估,因为 LLM 越来越多地部署为自动代码审查器。