论文
相同的信号,不同的语义:软件工程代理的跨框架行为分析
Same Signal, Different Semantics: A Cross-Framework Behavioral Analysis of Software Engineering Agents
摘要
基于 LLM 的软件工程代理的行为研究提取了有关哪些轨迹形状与更高的分辨率相关的操作规则:测试步骤遵循代码修改、错误级联较短或轨迹紧凑。每个规则通常源自单个框架,并且它是否在符号和大小上转移到结构上不同的代理设计尚未经过直接测试。我们在生态系统规模上解决了这个问题:64,380 个 SWE-bench 从跨越 43 个框架的 126 个代理配置运行,其中每个配置将 LLM 与提供其工具和工作流程的框架(例如 SWE-Agent、OpenHands)配对。我们通过依次固定每一层来将框架效应与 LLM 效应分开,然后测量每种配置的一个行为结果效应,并检查这些效应如何一致或不一致。在 LLM 保持固定的情况下交换框架会在每个动作功能中产生巨大的行为差异。对于大多数信号,配置不仅在幅度上不一致,而且在方向上也不一致。错误率是最干净的情况:当错误率较低时,47 个配置可以解决更多问题,而当错误率较高时,48 个配置可以解决更多问题。其他五个连续特征和先前 SE 文献中七个二元模式中的三个也显示出类似的方向分歧。框架同一性比 LLM 系列更多地解释了这种变化:对于平均转弯,框架解释了 64% 的配置间差异,而 LLM 为 10%。这意味着相同的可观察行为信号对于不同的代理配置可能具有相反的含义。因此,任何单一框架的行为发现都需要进行交叉配置验证,然后才能被称为通用框架。