论文

文本到 SQL 集成的剩余技能优化

Residual Skill Optimization for Text-to-SQL Ensembles

智能体系统Agent Harness

摘要

文本到 SQL 集成通过绘制多个 SQL 候选并选择一个来改进单个候选生成,但其有效性受到 Pass@K(K 个候选中至少一个正确的概率)的限制。现有方法通过随机解码或提示变体启发式地获取多样性,使候选集由相关故障主导。我们提出了 DivSkill-SQL,一个剩余技能优化框架,可以在没有模型 微调 的情况下构建互补的代理文本到 SQL 集成:每个新技能都针对当前技能集成失败的示例进行优化,可证明其对 Pass@K 的边际贡献。在 Spider2-Lite 上,与最强的集成基线相比,DivSkill-SQL 在 Snowflake 上的选定准确度提高了 11.1 分,在 BigQuery 上提高了 8.3 分,并且在两个基本模型(Opus-4.6 和 GPT-5.4)上都有一致的增益。在单一方言迁移上优化的技能,无需跨方言(Snowflake、BigQuery、SQLite)和不同的任务制定进行重新训练,例如 BIRD-Critic(+2.6 分)。错误诊断显示幻觉模式引用和函数调用减少了 3 倍,这表明收益来自真正可靠的补充技能,而不是表面形式的变化。