论文
通过模型合并进行跨域克隆检测的统一模型
A Unified Model for Cross-Domain Clone Detection via Model Merging
摘要
代码克隆类型的日益多样化,从语法副本到跨语言语义克隆,再到人工智能生成的副本,在克隆检测中造成了碎片化危机。当前的深度学习检测器是领域专家,在其训练分布之外会显着下降,跨领域 F1 下降超过 70%。部署多个专用模型是不切实际的,但训练单个跨域检测器需要同时访问所有训练数据。为了解决这个问题,我们研究了模型合并,这是一系列仅在经过训练的检查点上运行的事后技术。我们使用五种任务向量方法评估参数合并,通过贪婪层拼接进行架构合并,以及跨四个代码模型、三个基准和十二个配置的交叉标记器对齐。同基 TIES 合并创建了有效的跨域检测器,在两个模型系列和三个随机种子中进行了验证,在 UniXcoder 上达到 0.865 的组合 F1,在合并步骤中无需任何训练数据即可达到 93% 的多任务性能。 WUDI 实现了最高的分布内组合 F1 为 0.899,但 TIES 对未见过的 AI 生成的克隆具有更好的泛化能力,这使其成为我们推荐的方法。跨库合并在所有五种方法中仅产生边际和高方差增益,这表明通过共享预训练库的任务向量兼容性是有效合并的约束因素。合并检测器还在 GPTCloneBench 上以较低的推理成本优于零样本代码 LLM,并且对未见过的 AI 生成的克隆的泛化能力比多任务训练高出 4 倍,这表明域内性能和 OOD 鲁棒性之间存在权衡。这项工作提供了软件工程模型合并的第一个系统实证研究之一,以及构建跨域克隆检测器的实用方法。