论文
基础模型作为重构正确性检测的预言机
Foundation Models as Oracles for Refactoring Correctness Detection
摘要
流行的集成开发环境 (IDE) 中的重构工具可能会引入意外的行为更改或编译错误,这是一个持续存在的挑战,会破坏开发人员对自动化转换的信任。传统的检测方法依赖于手工设计的前提条件以及静态和动态分析,但适应性仍然有限,并且可能会错过微妙的正确性问题。这项研究探讨了基础模型作为检测 Java 程序中重构错误的预言机的潜力。我们在十多年来从广泛使用的 Java IDE(IntelliJ-IDEA、Eclipse 和 NetBeans)中收集的 226 个真实重构错误(涵盖 47 种重构类型)中评估了零样本提示,无需进行特定于任务的训练。我们的结果表明,基础模型可以有效地完成这项任务,尽管不同模型的性能有所不同。在首次运行设置中,GPT-OSS-20B 的准确率达到 80.5%,而 GPT-5.4 达到 93.8%。我们还评估了其他开放权重和专有模型:Gemma-4-31B 在开放权重模型中取得了最强的结果,Gemini-3.1-Pro-Preview 在所有评估模型中取得了最好的总体结果。变形测试表明,在测试的语义保留扰动下,模型预测在很大程度上保持一致,但这些结果应被解释为稳健性证据,而不是反对记忆或数据污染的证据。除了检测准确性之外,基础模型还可以提供简短的解释,帮助支持开发人员检查,跨重构类型进行操作,而无需显式编码的重构特定规则,并且可以作为开发工作流程中的轻量级分类辅助工具。我们的研究结果表明,基础模型可以通过标记可疑的转换以供开发人员检查来补充传统的重构检查。