论文
学会了还是记住了?量化代码 LLM 中的记忆优势
Learned or Memorized ? Quantifying Memorization Advantage in Code LLMs
摘要
用于训练 大语言模型 (LLM) 的代码数据集缺乏透明度,导致检测、评估和减轻数据泄漏变得困难。我们提出了一种基于扰动的方法来量化代码 LLM 中的记忆优势,定义为可能看到的和看不见的输入之间的性能差距。我们在四个任务系列的 19 个基准测试中评估了 8 个开源代码 LLM:代码生成、代码理解、漏洞检测和错误修复。不同模型和任务的敏感性模式差异很大。例如,StarCoder 在某些基准测试中达到了很高的灵敏度(高达 0.8),而 QwenCoder 仍然较低(大多低于 0.4),这表明泛化行为存在差异。任务类别也有所不同:代码摘要往往表现出较低的敏感性,而测试生成则要高得多。然后,我们分析了两个广泛讨论的基准测试:CVEFixes 和 Defects4J,它们经常被怀疑存在泄漏。与普遍担忧相反,两者都在模型中表现出较低的记忆优势:CVEFixes 仍低于 0.1,而 Defects4J 低于其他程序修复基准。这些结果表明,对于这些数据集,模型可能更多地依赖于学习的泛化而不是直接记忆。总的来说,我们的研究结果提供了证据,表明记忆风险高度依赖于任务和模型,并强调需要更强大的评估协议,特别是在以安全为中心的环境中。