论文
TRACER:代码 LLM 中细粒度污染检测的语义感知框架
TRACER: A Semantic-Aware Framework for Fine-Grained Contamination Detection in Code LLMs
摘要
数据污染是对模型评估可靠性的已知威胁。然而,在代码 大语言模型 (LLM) 中,它仍然未被充分探索,其中的污染往往超出了精确的重复范围。我们提出了 TRACER,一个用于细粒度代码污染检测的语义感知框架。 TRACER 使用三个级别的语义重叠(功能相同、几乎相同和共享逻辑)对污染进行建模,并通过从粗到细的管道检测它们。我们还引入了第一个细粒度代码污染检测基准,涵盖三个广泛使用的基准和三个代表性的 后训练 数据集。 TRACER 在多个 LLM 主干上实现了强大且一致的性能,GPT-5 在细粒度检测中达到了 0.91 的 F1 分数。在二进制设置中,TRACER 的 F1 为 0.92,比现有方法高出 42%-217%。我们进一步进行消融研究和误差分析,以评估 TRACER 中各个组件的贡献。