论文
代码检测器有半衰期:LLM 生成的代码检测中的过时和公制错觉
Code Detectors Have a Half-Life: Obsolescence and Metric Illusions in LLM-Generated Code Detection
摘要
随着代码生成模型的发展,代码检测器可能会变得过时:在一代模型上验证的检测器可能不会转移到下一代模型。我们将这种有限的使用寿命称为探测器半衰期。我们对人类编写的代码以及由 C++、Java 和 Python 的 7 个生成器生成的代码评估了 8 个通用 LLM 判断器和 3 个专用检测器。我们的结果揭示了两个问题。首先,不同生成器和提示策略的性能差异很大,这表明某些检测器依赖于生成器特定的模式,而不是代码来源的一般证据。其次,准确性可能掩盖严重的预测偏差。 DetectCodeGPT 和 GPT-Sniffer 在所有生成器中实现了 0.50 的准确度,但 F1 得分为 0.00,因为它们将几乎每个样本都分类为 AI 生成。然而,通用型LLM评委取得了更强的准确性和F1分数。我们的结果表明,通用 LLM 有望成为无需训练的代码来源判断器,并且可以超越专用检测器。然而,它们的可靠性取决于判断模型、代码生成器和提示策略。因此,我们建议评估多个生成器的 LLM 评审,并报告宏 F1 以及特定类别的精确度和召回率。