论文
模块的收益是否值得成本:上下文学习Text-to-SQL的准确率与成本分析
Are These Modules Worth Their Cost? A Paradigm-Level Accuracy-Cost Analysis of In-context Learning Text-to-SQL
摘要
上下文学习 (ICL) 文本到 SQL 的最新进展通过围绕基础生成器组装日益复杂的管道,显着提高了公共基准的执行准确性,但现有研究通常报告总体端到端准确性,而没有量化各个设计选择的边际准确性成本贡献。因此,提供统一的范例级成本准确性量化仍然是理解和配置现代文本到 SQL 的关键挑战。为了解决这个问题,我们在单个受控实现下实例化了 ICL 文本到 SQL 管道的五个重复模块的 17 个范式级别配置,并在跨越不同能力级别和推理风格的所有四个基础模型中归因每个范式的边际贡献和产生的成本。我们的分析表明,执行反馈细化是唯一一种能够以持续的低成本普遍受益的范式,而大多数其他模块仅在依赖基础模型的条件下才有帮助。词元核算表明,输入需求与管道结构更紧密相关,而输出需求对基础模型生成行为更敏感。跨模块分析进一步表明,堆叠提高了大多数基础模型的准确性,尽管增益的组成方式因基础模型能力而异。我们还发现,与升级到具有精益管道的前沿模型相比,固定预算通常更好地用于在中层基础模型上设计更复杂的管道。这些发现提炼成一个可操作的、具有成本意识的分层指南,无需按范式搜索即可转移到五个额外的基础模型。