论文

使用突变注入框架评估 Java 代码片段适应的 LLM

Evaluating LLMs on Java Code Snippet Adaptation Using a Mutation-Injection Framework

模型评测基准与评测资源

摘要

背景:开发人员经常通过复制片段并调整它们以适应新的上下文来重用代码。用于评估 大语言模型 (LLM) 代码适配的现有基准要么依赖于明确的分步指令,仅涵盖狭窄的更改类型(例如可变接线),要么专门在功能级粒度上运行。当所需的更改发生变化和受控时,LLM 在没有明确编辑指导的情况下能够如何适应代码片段仍然未知。目标:我们研究无指令代码片段适应,其中 LLM 必须调整代码片段以适应其目标上下文,而无需任何明确的编辑指导。我们研究三个维度:哪种适应类型最难(RQ1)、性能如何随适应复杂性扩展(RQ2)以及模型需要多少周围环境(RQ3)。方法:我们将从具有强大测试覆盖率的开源存储库构建 Java 代码片段数据集,并应用适应运算符的分类法,该分类法源自开发人员如何使用突变注入框架适应复制代码的经验发现。在代码片段级别工作并控制注入的更改可以让我们准确地知道模型必须执行哪些调整。未突变的片段可以作为模型需要进行的更改的合理参考。 LLM 将在三个上下文粒度级别的无指令适应任务上进行评估。正确性将主要通过测试套件重新插入来衡量,并辅以突变级别检查。