论文

SPENCE:用于检测 NL2SQL 基准污染的语法探针

SPENCE: A Syntactic Probe for Detecting Contamination in NL2SQL Benchmarks

模型评测评测方法与指标

摘要

大语言模型 (LLM) 在自然语言到 SQL (NL2SQL) 基准上取得了出色的性能,但其报告的准确性可能会因基准查询或训练期间看到的结构相似模式的污染而夸大。我们引入 SPENCE(NL2SQL 污染效应的语法探测和评估),这是一种用于检测和量化此类污染的受控语法探测框架。 SPENCE 系统地为四个广泛使用的 NL2SQL 数据集(Spider、SParC、CoSQL 和较新的 BIRD 基准)生成测试查询的语法变体。我们使用 SPENCE 在基于执行的评分下评估多个高容量 LLM。对于每个模型,我们测量随着句法分歧水平的增加而执行准确性的变化,并使用 Kendall tau 和自助法置信区间来量化排名敏感性。通过将这些稳健性趋势与基准发布日期对齐,我们观察到明显的时间梯度:较旧的基准(例如 Spider)表现出最强的负值,因此训练泄漏的可能性最高,而较新的 BIRD 数据集显示出最小的敏感性,并且基本上未受污染。总之,这些发现凸显了时间上下文化、句法探测评估对于值得信赖的 NL2SQL 基准测试的重要性。