论文
从 If 语句到 ML 管道:重新审视代码生成中的偏差
From If-Statements to ML Pipelines: Revisiting Bias in Code-Generation
摘要
先前的工作主要通过简单的条件语句来评估代码生成偏差,这些条件语句仅代表现实世界编程的一小部分,并且仅揭示明显的、显式编码的偏差。我们通过检查更现实的任务:生成机器学习(ML)管道,证明这种方法极大地低估了实践中的偏差。测试专用代码和通用指令 大语言模型,我们发现生成的管道在特征选择期间表现出显着的偏差。敏感属性平均出现在 87.7% 的案例中,尽管模型明显排除了不相关的特征(例如,在信用评分中包含“种族”,而放弃“最喜欢的颜色”)。这种偏见比条件语句捕获的偏见更为普遍,条件语句中敏感属性仅出现在 59.2% 的情况下。这些发现在及时的缓解策略、不同数量的属性和不同的管道难度级别上都是稳健的。我们的结果对简单的条件作为偏差评估的有效代理提出了挑战,并表明当前的基准低估了实际部署中的偏差风险。