论文

LLM 生成的代码中的社会偏见:基准和缓解措施

Social Bias in LLM-Generated Code: Benchmark and Mitigation

模型评测鲁棒性、公平性与可信度评测

摘要

大语言模型 (LLM) 越来越多地被部署来为以人为本的应用程序生成代码,其中人口统计公平性至关重要。然而,现有的评估几乎完全集中在功能正确性上,而 LLM 生成的代码中的社会偏见基本上没有受到检查。扩展我们之前在 Solar 方面的工作,我们使用 SocialBias-Bench 进行了全面的实证研究,SocialBias-Bench 是涵盖七个人口统计维度的 343 个现实世界编码任务的基准。我们评估了四个著名的 LLM 并发现所有模型都存在严重偏差,代码偏差分数高达 60.58%。我们进一步表明,标准的即时干预措施,例如思想链推理和公平角色分配,会无意中放大而不是减少偏见。然后,我们研究结构化多代理软件流程框架是否可以提高公平性,发现当早期角色正确确定代码应该和不应该考虑的范围时,结构化管道可以减少偏差。然而,向所有代理角色添加明确的公平指令会产生比不提供更糟糕的结果,这表明分散的责任没有得到解决。为了解决这些限制,我们提出了公平监控代理(FMA),这是一个模块化组件,可以插入任何现有的代码生成管道而无需修改它。 FMA 分析任务描述以确定应考虑或限制哪些属性,然后通过迭代审查过程检测并纠正违规行为,而无需可执行测试套件。对所有 343 项任务进行评估后,与单独的开发代理相比,FMA 将偏差减少了 65.1%,并将功能正确性从 75.80% 提高到 83.97%,优于所有其他研究方法。