论文

使用 LLM 进行代码转换规则合成:潜力和限制

Code Transformation Rule Synthesis using LLMs: Potential and Limits

模型评测模型能力评测

摘要

由于其黑盒性质,LLM 的可解释性有限且缺乏确定性。它们的使用成本也会上升,特别是在大型代码库上执行重复性任务时。为了缓解这个问题,我们针对转换规则的三种特定领域语言(即 Comby、GritQL 和 Ast-Grep)进行了一项新颖的实证研究。我们在六个不同的数据集上评估了三个 LLM(GPT-5.4、GPT-oss-120B 和 Llama3.1-8B),涵盖四个软件演化任务:API 误用纠正、程序修复、API 迁移和语言版本迁移。我们的结果提供了证据,表明转换规则综合超越了强大的前沿模型的概念验证。 GPT-5.4 始终实现高规则适用率,并在大多数基准测试中生成最接近 真值 的转换。较小且开放的 GPT-oss-120B 和 Llama3.1-8B 模型对于更简单的局部更改仍然有效,但难以应对复杂的迁移场景。我们还通过使用元变量以及通过许多数据集的第一个四分位数中的高重用分数观察到不可忽略的普遍性。最后,与反统一算法相比,LLM 在正确性方面优于反统一算法,但在规则适用性方面表现较差。总的来说,我们的结果表明 LLM 在生成健全、正确、可概括和可重用的规则方面具有巨大潜力。