论文
FALCON:NL2SQL对合成数据的模型与数据集无关框架
FALCON: A Model and Dataset Agnostic Framework for Synthetic Data Generation for NL2SQL Pairs
摘要
关系库是最广泛部署的结构化知识形态之一,其自然语言访问要求把语言接地到schema实体与关系,并处理人们措辞请求时固有的歧义。既有NL到SQL合成数据生成方法大多忽视这种歧义,产出过于简化的查询,无法让模型为现实结构化知识访问的复杂性做好准备。我们提出FALCON——用紧凑开源模型低成本生成与挑战性真实基准复杂度匹配的、歧义感知的现实NL-to-SQL数据的框架:组合保留字SQL种子与人设提示生成结构复杂查询,同时以基于对齐的过滤保持难度——区分真正错误与复杂但有效的查询。人类评估确认跨模型尺寸的稳定高质量;生成的数据在SQL复杂度与自然语言丰富度上都超过既有基准。难度分层分析显示:随查询复杂度上升,FALCON数据训练的模型越来越超越基线数据训练的模型,验证管道在生成有挑战训练数据上的成功;与少量既有基准数据混合训练可恢复简单查询性能同时保留复杂查询优势。模型与数据库无关的设计使组织能在本地生成高复杂度NL-to-SQL训练数据而无需外部API。