论文

推理如何在 LLM 生成的代码中塑造社会偏见?

How Reasoning Shapes Social Bias in LLM-Generated Code?

模型推理推理验证与自校正

摘要

大语言模型 (LLM) 越来越多地用于代码生成,但生成的程序可能会通过对敏感人口统计属性的不公平或差别对待而表现出社会偏见。虽然之前的工作主要研究直接代码生成,但基于推理的生成的偏差仍未得到充分探索。我们对基于推理的代码生成中的社会偏见进行了首次系统研究,在三个以人为中心的决策场景中针对现实偏见敏感任务评估了 9 个标准 LLM 和大型推理模型 (LRM)。我们发现推理通常会减少偏差,将平均偏差率从 0.64 降低到 0.40,但不同模型的效果差异很大。与此同时,代码质量并没有得到始终如一的保持,平均质量从 0.72 下降到 0.59。有偏见的推理强烈预测有偏见的代码,并且仅调整生成配置不足以实现稳健的缓解。基于这些发现,我们提出了 ProbeDebias,这是一种推理感知框架,可以在代码生成之前检测并重写有偏见的推理痕迹。 ProbeDebias 的推理偏差检测 F1 达到 87.76%,平均将代码偏差减少 83.73%,同时很大程度上保持质​​量。与SOTA基线相比,平均偏差进一步降低了52.70%-54.42%,质量提高了9.79%-36.79%。这些结果凸显了推理阶段分析对于生成可信代码的价值。