论文
风格而非自我:表面线索解释大型语言模型的零样本代码归属
Style, Not Self: Surface Cues Explain Zero-Shot Code Attribution by Large Language Models
摘要
如果语言模型能识别自己写的代码,它作为裁判时可能偏袒这些代码,而模型互相监控的实例可能合谋。我们在当前商业模型上零样本测试这一点。五个LLM为MBPP、HumanEval和DS-1000生成解答,另外七个为MBPP生成,模型在四项任务中充当评测者:从一对解答中挑选自己的、判断单个解答是否出自己的、识别两个解答中哪个由指定模型所写、以及盲评质量。在单解答任务中,全部15个模型-基准组合的平衡准确率为49-58%,而原始准确率(38-67%)主要反映模型宣称作者身份的难易程度。在成对任务中,14个评测者-对手组合的准确率与评测者的解答更长的频率相关性达r=0.93。对指定模型的归属在某些配对上成功,在另一些配对上持续反转。一种剥离文档字符串、注释、类型提示和局部名称的基于规则的归一化保持Pass@1,并使12个复测结果中的十个落到随机水平;另外两个遵循其保留的长度差异,不过训练分类器仍能区分大多数归一化配对。Claude Haiku的自我偏好也消失了。我们建议报告平衡准确率、启发式基线和标签一致性。