论文
源代码作者归属并不能从竞赛推广到课堂
Source Code Authorship Attribution Does Not Generalize from Competitions to Classrooms
摘要
源代码作者归属旨在从程序片段的写作风格来识别其作者。我们根据三个数据源对预训练的 Transformer CodeBERT 进行微调:来自开放 Kaggle 存储库的公开 Google Code Jam (GCJ) 提交内容、精心策划的 GCJ 档案以及在技术大学收集的机构课程作业数据集。在多轮 GCJ 数据上,CodeBERT 对 10 位作者的 Top-1 准确率达到 92.6%,对 1000 位作者保留了 70.7% Top-1(88.2% Top-10)。在检查的课程作业数据集上,相同的管道在相应的机会基线上或低于相应的机会基线:在 690 位作者的封闭式作业数据集上为 0.2% Top-1,在评估超过 812 位作者的开放式作业数据集上为 0.06% Top-1。配套的多模型基准测试在其他数据集配置中提供了一致的跨模型证据,表明观察到的性能差距并非特定于 CodeBERT,而是在评估的模型系列中持续存在。我们分析了数据集和任务属性,这些属性合理地解释了这一差距,并认为基于 GCJ 的基准高估了作者归属在教育环境中的实际适用性,除非它们在目标课程作业环境中得到验证。