论文

BudgetSchemaBench:文本到 SQL 中模式上下文的预算扫描诊断

BudgetSchemaBench: A Budget-Swept Diagnostic for Schema Context in Text-to-SQL

模型评测评测方法与指标

摘要

结构化源上的数据Agent必须将数据库模式适合模型的上下文窗口。大型目录可以跨越许多数据库和数千个列,因此成本限制可能需要在上下文窗口填满之前在表覆盖率和序列化详细信息之间进行选择。我们引入了 BudgetSchemaBench,这是针对此设置的基于执行的诊断。它的构造从黄金 SQL 中机械地派生出相关性标签,无需人工或大语言模型编写的基本事实。使用汇集的 80 个数据库目录,我们扫描了四个模式上下文预算并比较了三种表示形式,同时保持每个检索器的表排名固定。源命名空间检查会拒绝从错误数据库获取正确结果的查询。评估涵盖三个条件:端到端检索;冻结黄金,保证所需的桌子;以及删除这些表的探针。对于原始序列化的主求解器,将预算从目录的 2.5% 提高到 50%,在词法检索下将 1,279 个保留问题的执行准确性提高了 18 个百分点,但在密集检索下仅提高了 3 个百分点;密集检索器已经以最小的预算找到了最需要的表。当所需的表被删除时,94.6% 的正确预测准确地命名了其中之一,这与从参数知识重建缺失的模式一致。对于冻结金条件下的两个主要求解器,三种表示最多相差 2 个百分点,并且最宽的成对 95% 置信区间将差异限制在 +/-4 个百分点内。我们使用来自不同系列的一种推理模型观察到相同的定性模式。当检索受到覆盖范围限制时,执行准确性对模式预算比对测试的序列化更敏感。诊断以及用于构建和评估它的代码是公开可用的。