论文
VITAL-RAG:编码智能体 中上下文分配的不变性竞争
VITAL-RAG: Invariance Race for Context Allocation in Coding Agents
摘要
编码智能体 通常从整个存储库检索代码,但只有有限的证据可以适合最终的模型输入。 编码智能体 的传统检索增强生成 (RAG) 将同一代码对象的片段视为单独的结果,因此冗余视图可能会占用多个上下文位置并挤出有用的代码。按代码对象对片段进行分组可以减少这种冗余,但会丢弃任务所需的本地信息。我们将这种张力描述为不变性竞赛:分配应该在冗余渲染下保持稳定,但当片段添加与任务相关的语义时会发生变化。为了解决这一竞争,我们引入了 VITAL-RAG,它通过规范代码对象组织证据,仅在添加尚未表示的语义时保留一个与查询相关的同伴,并在每个对象和全局 词元预算 下呈现选定的证据。在 RepoBench 上,VITALRAG 将 Recall@4K 从 39.59% 提高到 63.67%,同时减少了 35.63% 的证据标记。在三个模型后端中,它匹配或优于 RepoClassBench 上的最新基线,并在 RepoExec 上实现了最高的原始 Pass@1。