论文

PolySQL:通过自动后端同构跨 SQL 方言扩展文本到 SQL 评估

PolySQL: Scaling Text-to-SQL Evaluation Across SQL Dialects via Automated Backend Isomorphism

模型评测评测方法与指标

摘要

SQL 方言在不同数据库引擎的语法、类型和功能上有所不同。然而,文本到 SQL 基准测试主要仅支持 SQLite。这造成了一个关键的评估差距:跨方言评估揭示了每个查询的一致性较弱(Cohen 的 ),表明 SQLite 性能对于其他方言来说是不可靠的代理。然而,这样的评估仍然非常困难:现有方法要么需要昂贵的手动查询转译,要么依赖在复杂 SQL 上经常失败的工具。为了弥补这一差距,我们引入了 PolySQL,这是一种新颖的双执行方法,通过比较规范化的执行结果来消除查询转译的需要。值得注意的是,我们的方法比具有 100% 查询覆盖率的查询转译实现了更高的评估保真度。 PolySQL 包含三个数据集,支持首次大规模跨方言研究。我们的研究表明,从 SQLite 到其他方言,平均准确度下降了 10.1%,并确定了显着的方言难度等级。我们发现这种退化源于逻辑错误而不是句法错误(61% vs. 8%)。我们发布了框架代码和排行榜,以实现严格的方言鲁棒性评估。