论文

On-Prem Open LLM 在文本到 SQL 方面能走多远? BIRD 上的跨系列尺寸 x 技术前沿

How Far Do On-Prem Open LLMs Get on Text-to-SQL? A Cross-Family Size x Technique Frontier on BIRD

模型评测模型能力评测

摘要

无法将数据发送到云 API 的组织越来越多地问:如果模型必须在开放权重上在本地运行,那么文本到 SQL 有多好,以及哪些流行的准确性“秘诀”值得他们计算?我们以 BIRD 开发拆分(n=1534,执行准确性)为基础,以诚实、完全可重现的基准来回答,评估了两代的三个开放模型系列——Qwen2.5-Coder (7B/14B/32B)、CodeLlama-Instruct (7B/13B/34B) 和 Llama-3.x (8B、70B)——在一个匹配的协议下,消除了与模型无关的模型配方(模式链接、自我修正、自我一致性)逐个组件,每个差异都通过配对 McNemar 测试进行测试。有四项发现引人注目。 (i) 世代比原始大小更重要,并且配方是家庭稳健的:Qwen2.5-Coder 在匹配大小(7B 时为 39.1 vs 20.9)上主导了较旧的 CodeLlama,但现代非 Qwen 模型(Llama-3.3-70B,匹配服务上为 49.2)具有竞争力,因此 CodeLlama 的弱点反映了其 2023 年一代,而不是“非 Qwen = 弱”。 (ii) 自我纠正是一种强有力的、近乎免费的胜利,对所有三个有改进空间的家庭都很重要。 (iii) 模式链接没有帮助,更强的链接器也无法挽救它:具有 96.5% 金表召回率的检索/嵌入链接器在统计上与无链接无法区分,排除了三个家族中的“弱词汇稻草人”反对意见。 (iv) 自我一致性的价值很差(约 5 倍词元+0.13 pp,不显着)。我们报告每个阶段的实际成本($/1000 个查询)并发布所有代码、预测和摘要;存档代码和数据:https://doi.org/10.5281/zenodo.20952794