论文

通过环境对齐生成可执行存储库级代码

Toward Executable Repository-Level Code Generation via Environment Alignment

摘要

大语言模型(LLM)在代码生成方面取得了强大的性能,但现有方法仍然难以在可执行验证下进行存储库级代码生成。在此评估设置下,成功不是取决于孤立代码片段的合理性,而是取决于生成的多文件存储库是否可以成功安装、解决其依赖项和内部引用、启动并在真实执行环境中进行验证。为了应对这一挑战,我们提出了 EnvGraph,这是一个用于存储库级代码生成的框架,它将存储库可执行性表述为环境对齐问题。 EnvGraph 联合对存储库成功执行的两个耦合条件进行建模,即外部依赖满足和存储库内部引用解析。它维护双层环境表示,使用执行证据来执行基于执行证据的归因,并通过迭代对齐循环内的统一目标修订机制来指导存储库生成。我们使用三个代表性主干 LLM 评估存储库级代码生成的 EnvGraph,并将其与代表性环境感知和存储库级基线进行比较。实验结果表明,EnvGraph 在这些存储库级基准测试中始终保持最佳性能。特别是,它在功能正确性方面比最强的非 EnvGraph 基线高出 5.72--5.87 个百分点,在非功能质量方面高出 4.58--8.66 个百分点。