论文
识别与解释 AI 生成代码中的偏见
A Framework for Identifying, Categorizing, and Explaining Bias in AI-Generated Code
摘要
随着大型语言模型 (LLM) 集成到软件开发工作流程中,人们开始担心人工智能生成的代码中会出现无意的偏差。尽管有证据表明这些偏见存在,但系统地识别、分类和解释它们的研究有限。这项研究调查了人工智能生成的代码中的偏差,并评估大语言模型是否可以通过分类驱动的框架可靠地识别和解释它。我们扩展了现有的由人工智能生成的带有偏见的 Python 代码数据集,并使用偏见类别和人工编写的理由手动注释了片段,以建立真实数据集。使用该数据集,我们通过 ICL 评估了专有和开源大语言模型作为自动偏差检测和论证系统。最后,我们使用结构化论证和代码识别指标分析了大语言模型生成的解释与人类编写的论证之间的相似性。我们的研究结果表明,大语言模型可以有效支持代码偏差识别和解释。 Gemini 实现了 80.14% 的分类准确率、84.0%的精确率和 95.7% 的召回率,而最好的开源替代品 Qwen3-coder 实现了 82.45% 的准确率、68.64%的精确率和 80.22% 的召回率。此外,相对于人类推理,这些模型的合理相似性得分分别为 80.4% 和 80.14%,代码识别相似性得分为 86.0% 和 87.82%。这些结果表明,大语言模型可以检测生成的 Python 代码中存在偏见的逻辑,并生成与专家解释基本一致的解释。
