论文
MM-IssueLoc:用于评估多模式存储库级问题本地化中的视觉证据的受控基准
MM-IssueLoc: A Controlled Benchmark for Evaluating Visual Evidence in Multimodal Repository-Level Issue Localization
摘要
真正的存储库问题通常包括视觉证据,例如屏幕截图、错误对话框、呈现的 UI 状态和日志,但存储库级别的问题本地化主要作为纯文本任务进行评估。现有的多模态 SE 基准评估端到端修复,将本地化与补丁合成纠缠在一起,并模糊视觉输入是否有帮助、有害或被忽略。我们引入了 \textbf{MM-IssueLoc},这是一种用于具有视觉证据的存储库级本地化的受控基准和评估协议。 MM-IssueLoc 包含 23 种语言的 652 个问题 PR 实例,带有 7 个图像类别和 4 个相关级别的注释。它提供文件级和功能级标准标签、配对的纯文本和图像评估,以及将图像转换为结构化文本证据的基于 VCE 的诊断。我们评估基于 LLM 和基于检索的系统,包括 MM-IssueLoc-VL-Emb 作为受控多模态 检索器。结果表明,现有系统距离可靠的多模式存储库定位还很远:最强的代理达到 38.96 个文件 Acc@5 和 22.45 个函数 Acc@10,而最强的 检索器 达到 33.86 个函数 Acc@10。跨基准比较表明,以文本为主的 SWE 基准上的高本地化分数并不能完全转移到多模式问题本地化。 MM-IssueLoc 将视觉证据转化为明确的评估变量,使未来的工作能够测试系统是否通过使用视觉证据进行本地化来改进,而不是依靠纯文本提示或下游补丁生成效果。