论文

通过启动狂野代码理解之旅来投射 SWE 代理的新兴思维

Projecting the Emerging Mindset of SWE Agent by Launching a Wild Code Understanding Journey

智能体系统Agent任务评测

摘要

软件工程代理(SWE 代理)越来越多地通过真实存储库中的工具介导的轨迹进行工作,但它们的行为仍然难以用具体的、可观察的术语来表征。这些轨迹记录了工具的使用、中间推理、证据选择和自我引导停止,但它们本身并不能解释为什么选择特定的动作、哪些证据是可信的,或者何时判断理解足够。这种张力使得轨迹数据既有限又有价值:当通过严格的观察进行解释时,忠实的、可重播的轨迹可以成为研究代理行为的经验基础。我们介绍 Ada,一个用于存储库级代码理解的范围设备。 Ada 通过有界工具接口进入真实的代码库,允许开放式探索保持可记录为有限轨迹。在这个狂野但有限的环境中,Ada 选择在哪里查看、仔细阅读什么、何时巩固部分理解以及何时关闭其存储库帐户。我们通过观察镜头来投射 Ada 的思维-行动链,使导航、证据选择、综合、基础和停止变得可见,而不将行为减少到原始工具数量或推测隐藏的意图。一起阅读,这些镜头产生了基于通过软件世界记录的运动的行为档案。该研究跨越 408 条轨迹,涵盖多个模型、存储库、任务系列和启动条件,展示了如何将忠实的数字痕迹转化为新兴 SWE 代理心态的严格、可比较的预测。结果揭示了效率、轨迹多样性、认知基础和干预限制方面的差异,同时为观察真实代码库中的 SWE 代理行为提供了方法基础。