论文
A^2Agent:存储库级代码本地化代理的动作感知强化学习
A^2Agent: Action-Aware Reinforcement Learning for Repository-Level Code Localization Agents
摘要
本地化与问题相关的代码区域是自动化软件工程中的关键步骤。然而,由于它们依赖于稀疏的轨迹级信号,现有方法无法识别哪些每回合动作是有效的,并且经常在探索过程中发现正确的代码区域但无法提交它们。为了解决这些限制,我们提出了一种动作感知强化学习方法,该方法将奖励标准代码区域的发现和承诺的每回合奖励序列与动作级优势估计方案相结合,该方案通过对共享相同探索上下文的回合进行分组来隔离每个动作的功劳。广泛的评估表明,我们的方法在 SWE-Bench Verified 上的平均 F1 比最先进的 (SOTA) 提高了 1.58%,在 SWE-Bench Pro 上提高了 8.55%,我们的 4B 模型的性能优于基线高达 8 倍。我们的代码可在 https://github.com/donian00/A2Agent 获取。