论文

LEGO:以Agent原生可复用代码原语构建大型仓库

Large-scale Repository Engineering via Agent-Native Reusable Code Primitives

摘要

配备开发环境的大语言模型已将代码生成推进到完整仓库构建,但模块、接口、配置、测试和依赖必须协同工作,因此完整仓库仍难交付。我们提出代码原语,即供Agent复用的可执行组件,包含接口契约、完整依赖、验证测试和来源信息。每个原语利用常驻LLM评估相关性,并根据目标仓库调整实现、接口与依赖。我们将1,424个经过验证的原语组织到可搜索的CodeFace库中。随后提出LEGO,激活任务相关原语,将适配后的实现与任务专用代码集成,解决组件间约束,再依据实际执行的测试修改结果。为开展端到端评测,我们构建LEGO-REPO,包含七个软件领域、22条能力路线和五种难度的522项可执行重建任务;使用仓库原有测试,在空包下限与原始源码上限之间评分。13个受测基础模型中,最强者的交付分数为0.318,在41.0%的任务中得分为零。LEGO使全部13个模型平均提高0.1474,将GPT-5.6-terra由0.3180提高到0.5134,增幅61.4%。受控比较显示,经适配的原语优于把检索代码作为上下文提供,或直接使用未经修改的外部代码。在独立仓库Agent、三个外部基准及重新从不重叠来源挖掘的CodeFace上,效果仍然存在。用GPT-OSS-20B进行适配和诊断,可在降低24.0%成本的同时保留使用同一模型配置得分的95.1%。

LEGO:以Agent原生可复用代码原语构建大型仓库:论文原图
图 1:从代码基元到完整的存储库。左:现实世界的存储库被挖掘为组件级代码基元,每个基元都带有其接口、依赖项、测试、配置和文档,并在 CodeFace 中进行组织。右图:用户请求激活所需的原语,这些原语会进行自我调整并交换其更改所施加的要求,然后将调整后的实现编辑到存储库中并在执行反馈和诊断下进行修改。