论文
BIRD-History:带有细粒度知识标注的历史驱动文本到SQL基准
BIRD-History: A Benchmark for History-Driven Text-to-SQL with Fine-Grained Knowledge Annotations
摘要
虽然最近基于大语言模型 (LLM) 的文本到 SQL 系统在标准基准测试中取得了令人印象深刻的性能,但当用户查询隐式依赖于特定于领域的知识(例如业务逻辑、数据约定和分析实践)时,它们就会陷入困境,而这些知识既没有被模式捕获,也没有在自然语言问题中明确说明。历史 SQL 查询日志提供了此类知识的宝贵来源,但现有基准测试不足以支持对历史驱动方法的评估。为了弥补这一差距,我们引入了 BIRD-History,这是一个由 11 个数据库中的 1,393 个任务组成的基准测试,旨在评估文本到 SQL 系统使用历史 SQL 脚本处理未指定的自然语言问题的能力。每个任务都用真实标签进行注释,指定哪些历史查询包含相关知识以及哪些 SQL 子句对其进行编码,从而能够系统地评估检索有效性和知识利用率。除了基准测试之外,我们还提出了一个插件检索器,它从历史 SQL 脚本中提取五种类型的外部知识,然后检索相关片段并重新排序以生成查询。该检索器无缝集成到现有的少量文本到 SQL 管道中,无需立即进行修改。实验证明了四个文本到 SQL 系统的一致改进,突出了利用历史查询日志来处理未指定查询的价值。数据集和代码在 https://github.com/zjuidg/BIRD-History 上开源。