论文
Spider 2.0-AIFunc:将现实世界的文本到 SQL 扩展到 AI 原生 SQL 工作流程
Spider 2.0-AIFunc: Extending Real-World Text-to-SQL to AI-Native SQL Workflows
摘要
主要云数据平台现在将 大语言模型 功能作为本机 SQL 函数公开,使分析师能够在普通 SQL 查询中执行分类、过滤、情感分析、提取、相似性搜索和聚合。然而,现有的文本到 SQL 基准仅评估传统 SQL,并且没有提供有关模型是否可以生成此类 AI 原生 SQL 的信号。我们推出了 Spider 2.0-AIFunc,这是一个基准测试,包含 125 个真实世界数据库中的 465 个经过验证的实例,涵盖 Snowflake 平台上的六种人工智能功能。从现有的企业文本到 SQL 基准测试开始,我们通过基于代理的管道构建 Spider 2.0-AIFunc,将源任务重写为 AI 原生形式,同时转换目标查询并细化自然语言指令,使预期的 AI 原生解决方案变得明确并减少歧义。所有实例都在时间上分离的窗口中传递多轮重复执行协议,以在发布前确认结果稳定性。通过评估十种最先进的语言模型,我们发现最强的专有模型达到 67-70% 的执行精度,而最好的开源模型达到 58.1%,这一差距主要是由谓词规范、数据库模式对应和 AI 函数参数化方面的错误造成的。专为传统文本到 SQL 挑战(例如模式检索和相关表选择)而设计的代理框架无法有效地转移到 AI 原生 SQL:最小的代理设置始终匹配或优于更复杂的替代方案,这表明这些框架采用的策略在此设置中不太重要。数据可在 https://github.com/Leolty/Spider2-AIFunc 获取。