论文

RepoMirage:在带有扰动的代码代理中探测存储库上下文推理

RepoMirage: Probing Repository Context Reasoning in Code Agents with Perturbations

模型评测基准与评测资源

摘要

代码代理目前在存储库级软件工程基准测试中表现出色,但尚不清楚问题解决等端到端任务的成功是否真正反映了存储库上下文推理、跨多个文件识别任务相关信息以及推理它们之间关系的能力。为了研究这个问题,我们引入了 RepoMirage,这是一个基于 SWE-Bench Verified 构建的两阶段评估套件,它采用扰动作为诊断工具,通过改变存储库的暴露方式来增加对上下文推理的需求。首先,RepoMirage-Perturb 应用了三种类型的语义保留存储库级扰动,当正确解决需要更广泛的上下文访问时,显示出明显的性能下降。 RepoMirage-Extend 进一步将针对扰动的结构瓶颈转化为超出问题解决范围的显式任务,平均性能从原始设置的 66.8% 下降到 25.3%,表明存储库上下文推理存在显着缺陷。进一步的轨迹分析揭示了一种探索漂移,即智能体访问更广泛的存储库上下文,但无法将其转化为有效的结构信息。受这一观察的启发,我们提出了 RepoAnchor,这是一种结构优先的原型工作流程,它将存储库探索与下游问题解决分开,并表明显式结构脚手架会产生显着的收益。这些结果揭示了代码代理存储库上下文推理中以前被忽视的差距,并表明更强的结构感知方法有可能改进它们。