论文
普遍的标注错误正在破坏Text-to-SQL基准与排行榜
Pervasive Annotation Errors Break Text-to-SQL Benchmarks and Leaderboards
摘要
研究者已提出大量text-to-SQL技术来简化数据分析并加速数据驱动应用的开发。为比较这些技术并选择最佳者部署,社区依赖公开基准及其排行榜。由于这些基准在问题构建与答案评估中严重依赖人工标注,标注的有效性至关重要。本文开展实证研究:(i)测量两个广泛使用的text-to-SQL基准BIRD与Spider 2.0-Snow的标注错误率;(ii)修正BIRD开发集的一个子集,以衡量标注错误对text-to-SQL代理性能与排行榜排名的影响。通过专家分析,我们发现BIRD Mini-Dev与Spider 2.0-Snow的错误率分别为52.8%与62.8%。我们在原始与修正后的BIRD Dev子集上重新评估BIRD排行榜的全部16个开源代理。性能变化介于-7%到31%(相对值),排名变化介于-9到+9位。我们进一步评估这些影响是否可推广到完整BIRD Dev集。我们发现,代理在未修正子集上的排名与完整Dev集的排名强相关(Spearman's r_s=0.85,p=3.26e-5),而与修正子集的排名仅弱相关(Spearman's r_s=0.32,p=0.23)。这些发现表明,标注错误会显著扭曲所报告的性能与排名,可能误导研究方向或部署选择。代码与数据发布于 https://github.com/uiuc-kang-lab/text_to_sql_benchmarks。
