论文

代码 LLM 的记忆诊断应该具有规模感知能力

Memorization Diagnostics for Code LLMs Should be Scale-Aware

模型评测评测方法与指标

摘要

代码 大语言模型 在多大程度上依赖于记忆而不是真正的理解仍然存在很大争议。虽然当前的文献经常报道广泛的记忆,但评估密集架构中的底层探测技术揭示了其大规模实用性的严重崩溃。使用同义词模糊测试或死代码插入等扰动的传统编码器式探针很难暴露缩放模型中的记忆,即使在已知污染的基准上也是如此,而依赖对数概率的解码器式探针也表现出类似的性能下降。这些探针的特定失败模式,特别是为什么这些技术会破坏较小的模型,但无法影响较大的模型,促使我们从记忆中解开表征负载,而不是将它们视为单一现象。通过将可逆数学变换应用于数值问题,我们隔离了这两个因素,并揭示了缩放编码器成功吸收了大量的表示负载,同时仍然收敛于正确的解决方案系列。在实际软件工程中,这种适应不同表面形式的能力对于 LLM 和代理应用程序的可用性和通用性来说真正重要。在训练过程中是否看到特定的解决方案成为一个不那么紧迫的问题,因为尽管记忆会增加受污染基准的分数,但考虑到表示负载,我们应该在多大程度上真正关心一个功能性答案是否最初被记住了,这是一个值得商榷的问题。因此,未来的评估必须围绕区分这些现象进行,而不是依赖于悄悄地将它们纠缠在一起的方法论。