论文
LIMIT:Text-to-SQL指令微调的少即是多
LIMIT: Less Is More for Instruction Tuning in Text-to-SQL
摘要
大语言模型在 Text-to-SQL 上通过推理增强微调取得显著进展,但现有方法主要依赖海量指令语料,假设规模驱动性能。我们挑战这一范式,研究一个根本问题:有效的 Text-to-SQL 指令微调最少需要多少数据?我们提出 LIMIT(Less Is More for Instruction Tuning in Text-to-SQL),一个以数据为中心的框架,表明当样本经过策略性选择时,强大的数据库推理能力可以从极其精简的训练集中涌现。LIMIT 分四个阶段运行:难度感知过滤,识别处于模型学习前沿的样本;思维链合成与基于一致性的选择;通过 LLM-as-judge 的多维质量评分;以及联合最大化模式覆盖与样本质量的遗传算法优化。在 BIRD 和 Spider 基准上,LIMIT 仅选择 796 和 863 个样本即实现 100% 的表覆盖,使 Qwen3-8B 达到 69.1% 和 88.9% 的执行准确率。该结果超越了用 20 倍数据训练的方法,在开源方法中树立新的最优水平。我们的发现表明,精心的数据策展而非规模才是高效 Text-to-SQL 学习的关键。
