论文

UniQL:迈向Text-to-SQL的方言通用基准

UniQL: Towards Dialect-Universal Benchmarking for Text-to-SQL

模型评测基准与评测资源

摘要

现有的文本到 SQL 基准测试主要以 SQLite 为中心,因此很难评估模型是否可以跨异构 SQL 方言进行泛化。然而,现实世界的数据库系统在语法、函数、类型系统和执行语义方面存在很大差异,因此相同的自然语言意图通常需要特定于方言的 SQL 实现。我们推出 UniQL,这是一种经过人工验证的跨方言文本到 SQL 评估基准。 UniQL 将 1,534 个自然语言问题与 16 种 SQL 方言的可执行 SQL 注释对齐,产生 24,544 个方言特定查询。所有方言都具有相同的意图、一致的模式和数据库内容,从而能够对方言泛化进行受控评估。 UniQL 是通过结合数据库迁移、SQL 翻译、执行引导验证、迭代规则总结和人工验证的混合管道构建的。对开源和闭源 LLM 的实验表明,当前模型距离方言通用还很远,不同数据库系统之间的性能差异很大,并且从 SQLite 成功到其他方言的迁移有限。这些发现强调需要一致的跨方言基准和更多方言感知的文本到 SQL 方法。代码和数据可在 https://github.com/JerryGao818/UniQL 获取

UniQL:迈向Text-to-SQL的方言通用基准:论文配图
图 1:UniQL 构建管道。 UniQL 通过数据库迁移、混合 SQL 翻译、基于执行的验证、迭代翻译规则演化和人工验证,将广泛使用的 BIRD SQLite 开发集扩展到 16 种 SQL 方言。