论文
模式优先检索:自然语言分析的嵌入目录
Schema-First Retrieval: Embedding Catalogs for Natural Language Analytics
摘要
企业文本到 SQL 系统经常在生成 SQL 之前失败:模型接收到错误的架构上下文。现代仓库包含数千个表、缩写列、非正式指标、隐藏连接约定以及原始表名称未捕获的权限边界。我们引入了模式优先检索,这是一个嵌入目录元数据而不是仓库行的检索层。系统使用特定于对象的文本模板对五种类型的目录对象、表、列、度量、关系和查询历史记录进行索引。在查询时,它在 SQL 生成之前结合了并行向量搜索、沿袭扩展、跨编码器重新排序、工作负载内存和确定性访问控制门。在 CRUSH4SQL(1,534 个问题)上,模式优先检索的表召回率@20 达到 96.4%,跨编码器重新排名在列召回率@10 处增加了 +11.1 分;与同样模板化的 BM25 基线相比,语义检索在表召回@5 上为+32.8 分。在 SEDE(857 个问题)上,查询历史记录将表召回率@5 从 52.1% 提高到 92.3%。在 BIRD(96 个问题)上,模式优先上下文将 SQL 执行错误从 15.6% 减少到 6.2%,减少了 2.5 倍。这些结果表明,目录选择是自然语言分析的一流检索问题,而不是提示格式细节。