论文

SWE-QA:复杂代码理解的数据集和基准

SWE-QA: A Dataset and Benchmark for Complex Code Understanding

模型评测基准与评测资源

摘要

在本文中,我们介绍了 SWE-QA,这是一个文本和代码语料库,旨在对多跳代码理解进行基准测试,解决简化的评估任务与现实软件开发中所需的复杂推理之间的差距。虽然现有的代码理解基准侧重于孤立的片段,但开发人员必须定期连接多个分散的代码段中的信息。该数据集包含从 SWE-bench 的 12 个 Python 存储库系统生成的 9,072 个多项选择问题,评估了几种循环推理模式,例如将实体定义与其用法联系起来的声明和调用问题,以及检查多个协作组件之间的动态关系的交互实体问题。该基准通过基于解析的实体提取和 大语言模型 辅助问题构建以及经过仔细验证的干扰项生成,将真正的理解与肤浅的模式匹配区分开来。对 15 种语言模型(360M 至 671B 参数)的评估揭示了多跳推理的重大挑战,最佳性能达到 74.41% 的准确率。密集架构的性能始终优于专家混合模型 10-14 个百分点,而推理增强型变体则表现出不一致的优势。