论文

身份还是提示噪音? LLM 代码生成的校准不变性审核

Identity or Prompt Noise? A Calibrated Invariance Audit of LLM Code Generation

模型评测鲁棒性、公平性与可信度评测

摘要

身份线索与固定的编程规范无关,但不平等的样本和提示措辞可能会产生原始的反事实差异。我们在 HumanEval+ 和 MBPP+ 上的七个检查点审核了 3073 万个执行的 Python 代,并在模型分配的性别、国家/地区和职业角色下辅以探索性 550B 切片。任务内随机化和错误发现率控制将占用确定为最一致的结构轴:CodeBLEU 分散度在 10/14 模型基准单元格中超过其可交换性零值,在 8/12 全覆盖单元格中仍然显着,并超过每个配对单元格中的国家/地区比率,尽管中位超额仅为 0.141 点。在六个高通过率单元格中,占用分散在词元相似性、长度、评论、参考相似性和复杂性上复制,而通过率分散在任何一个单元中都不显着。国家/地区在 12/14 单元格中领先原始离散度,但中位校准比率为 1.00。在这个设计中,与性别相关的变化不能与人物角色的措辞分开。因此,证据支持代码形式的小规模、可重复的职业条件变化,而不是对命名身份的稳定不利或已证明的下游危害。我们利用这一发现来激发对代码生成中偏见的潜在影响进行更广泛的评论,包括模型可能根据先前对话上下文中提供的身份信息来调节其输出的可能性。