论文

HybridCodeAuthorship:行级代码作者身份检测的基准数据集

HybridCodeAuthorship: A Benchmark Dataset for Line-Level Code Authorship Detection

模型评测基准与评测资源

摘要

由于由 大语言模型 (LLM) 提供支持的人工智能代码助手的快速采用,行业代码库日益成为人工智能和人类编写的代码的混合体。出于风险管理和生产力分析的目的,对人工智能生成的代码进行细粒度的位置检测至关重要。为了开发此任务的算法,需要质量基准来评估性能。然而,现有的基准测试往往包含学术性的 LeetCode 风格的问题,并假设代码片段要么完全由人类编写,要么完全由 AI 编写,这并不能反映使用 AI 代码助手的行业代码库的不同意图和风格。为了填补这些空白,我们引入了 HybridCodeAuthorship,这是一种新颖的 Python 代码文件基准测试,其中包含交错的人类和人工智能编写的代码行,以模拟人工智能代码助手的真实使用。在本文中,我们首先介绍我们的数据集构建管道,它利用 CodeSearchNet,这是 GitHub 上开源存储库的大量链接集合。然后,我们在行级和块级对两种最先进的人工智能生成代码检测算法的性能进行基准测试。实验结果表明,HybridCodeAuthorship 是一个具有挑战性的基准测试,其得分最高的算法 AIGCode Detector 在块级和行级代码检测任务上分​​别获得了 0.48 和 0.56 的最高 F1 分数。