论文
使用 k-gram 软件胎记检测 LLM 辅助代码抄袭
Detection of LLM-assisted Code Plagiarism Using k-gram Software Birthmarks
摘要
大语言模型(LLM)显着降低了软件抄袭的技术门槛。通过在保留其功能的同时转换现有源代码,现代 LLM 可以生成语义相同的程序,从而可以逃避传统的抄袭检测技术。在此类攻击中,代码释义会修改程序的语法和结构,同时保留其行为。本文研究了软件胎记是否可以检测此类 LLM 辅助的抄袭行为。作为起点,我们使用基于 Java 操作码的独特 k-gram 的 k-gram 软件胎记,k 的范围从 1 到 6。我们使用三个当代的 LLM:ChatGPT-5.1-Codex-Mini、DeepSeek-V4-Flash 和 Claude-Haiku-4.5。该数据集由从积极维护的 BSD-2-Clause 许可 Java 项目中提取的可单独编译的源文件组成。我们进一步比较了胎记匹配的五种相似性度量:余弦相似性、Dice 指数、Jaccard 系数、Simpson 指数和基于编辑距离的相似性。结果表明,k-gram 软件胎记对于检测 LLM 辅助抄袭仍然有效。在评估的模型中,ChatGPT-5.1-Codex-Mini 生成了最难检测的克隆。此外,研究结果证实了面向编码的模型在抄袭任务中具有更高的性能。