论文
LEGO:以Agent原生可复用代码原语构建大型仓库
Large-scale Repository Engineering via Agent-Native Reusable Code Primitives
摘要
配备开发环境的大语言模型已将代码生成推进到完整仓库构建,但模块、接口、配置、测试和依赖必须协同工作,因此完整仓库仍难交付。我们提出代码原语,即供Agent复用的可执行组件,包含接口契约、完整依赖、验证测试和来源信息。每个原语利用常驻LLM评估相关性,并根据目标仓库调整实现、接口与依赖。我们将1,424个经过验证的原语组织到可搜索的CodeFace库中。随后提出LEGO,激活任务相关原语,将适配后的实现与任务专用代码集成,解决组件间约束,再依据实际执行的测试修改结果。为开展端到端评测,我们构建LEGO-REPO,包含七个软件领域、22条能力路线和五种难度的522项可执行重建任务;使用仓库原有测试,在空包下限与原始源码上限之间评分。13个受测基础模型中,最强者的交付分数为0.318,在41.0%的任务中得分为零。LEGO使全部13个模型平均提高0.1474,将GPT-5.6-terra由0.3180提高到0.5134,增幅61.4%。受控比较显示,经适配的原语优于把检索代码作为上下文提供,或直接使用未经修改的外部代码。在独立仓库Agent、三个外部基准及重新从不重叠来源挖掘的CodeFace上,效果仍然存在。用GPT-OSS-20B进行适配和诊断,可在降低24.0%成本的同时保留使用同一模型配置得分的95.1%。
