论文

SWE-PolyVision:存储库级软件工程的跨图像溯因推理基准测试

SWE-PolyVision: Benchmarking Cross-Image Abductive Reasoning for Repository-Level Software Engineering

智能体系统Agent任务评测

摘要

当前的多模式软件工程基准将图像作为附加上下文公开,但没有测试代理是否可以将跨图像分布的证据集成到经过验证的存储库级修复中。我们推出了 SWE-PolyVision,这是一个可执行基准测试,包含来自 36 个开源组织的 92 项真实任务,其中包括 48 项公共任务和 44 项私人坚持任务。该版本包含 402 张静态图像和 6 个视频,每个任务至少有两个视觉输入。每个任务将固定的前缀存储库与隔离的验证器配对,并在三种访问模式支持的条件下进行评估:纯文本、本机视觉和工具介导的视觉。在十一种编码模型中,视觉访问会改变要解决的任务,但效果取决于模型和任务。两个跟踪链接的 Native Vision 案例说明了互补的视觉和文本线索如何导致源本地化、经过验证的修复;受控干预表明,这种转换在不同投入之间尚未稳定。因此,SWE-PolyVision 将多图像证据的可用性与其在存储库级修复中的成功使用分开,而不将补丁成功单独视为显式推理的证明。