论文
超越工具层:面向企业Text-to-SQL的上下文工件端到端优化
Beyond the Harness: End-to-End Optimization of Context Artifacts for Enterprise Text-to-SQL
摘要
在企业环境中部署LLM做Text-to-SQL,瓶颈往往不在模型,而在于送抵模型的上下文:业务逻辑横跨数千张表,任何模型都无法一次性读入完整目录。我们认为最有效的干预点是模型消费的知识库上下文,而且这一上下文应当从历史使用中构造出来,而不是作为一个固定输入去适配。利用查询DAG分解——与BEAVER等企业基准所标注的同类中间产物,这里从生产SQL中恢复——我们比较了oracle查询图与检索到的知识库上下文的价值。在此消融中,在完整oracle图之上再加入检索的知识库上下文时,边际提升最大。在此基础上,我们优化了一个把历史查询画像蒸馏为可复用SQL参考卡的流程。在一个来自大型在线零售商、包含5,176条生产查询的基准上,优化这些上下文工件带来的收益(约12–25%的AST相似度)大于优化检索工具层(约3–12%)。在公开BEAVER基准上——它缺少我们内部环境所具备的生产使用信号——情况更为复杂:仅用表卡的效果与原始历史SQL大致相当。最优的优化变体检索卡片与原始SQL两者,在保留出的N=300子集上得分为9.00%,可比基线为6.33%(p值0.12),且只使用检索上下文与工具层改动,没有智能体循环。
