论文

LLM 代理可以查看代码存储库

LLM Agents Can See Code Repositories

上下文与知识上下文工程

摘要

由 大语言模型 提供支持的 编码智能体 在软件工程任务中表现出了强大的性能。然而,大多数代理几乎完全以文本形式使用存储库,这与人类开发人员使用文件夹层次结构和依赖关系等视觉结构在大型代码库中定位自己的方式不同。对于多模式 大语言模型 (MLLM),代理是否可以有效地从存储库的可视化表示中受益是一个悬而未决的问题。本文首次对基于 LLM 的代理在存储库级问题解决方面的视觉存储库表示进行了系统的实证研究。我们评估了最近的四种多模式模型。我们的结果表明,严格的仅视觉设置会降低准确性并增加词元成本,因为代理缺乏足够的符号细节并通过重复的视觉查询进行补偿。相比之下,将存储库结构的可视化图表作为补充模式与标准文本界面集成,可以帮助代理更有效地理解结构:输入词元消耗减少高达 26%,同时保持或提高问题解决的准确性。可视化在故障定位和代理自主控制勘探深度时最有用。这些发现指出了下一代 编码智能体 的实用混合文本和视觉设计。