论文
基于LLM的SQL生成:提示、自我精炼与自适应加权多数投票
LLM-Based SQL Generation: Prompting, Self-Refinement, and Adaptive Weighted Majority Voting
摘要
Text-to-SQL已成为一个突出的研究领域,尤其随着大语言模型(LLM)的快速发展。通过让用户以自然语言而非SQL查询数据库,该技术显著降低了数据分析的门槛。然而,由于用户查询中的歧义、模式链接的复杂性、跨SQL方言的有限泛化以及对领域特定理解的需求,从自然语言生成准确的SQL仍然具有挑战性。在本研究中,我们提出一个构建于PET-SQL之上、无需真实标注数据的单智能体自精炼与集成投票(SSEV)流水线,将自我精炼与加权多数投票(WMV)及其随机化变体(RWMA)相结合。实验结果表明,SSEV在多个基准上取得有竞争力的性能,在Spider 1.0-Dev上执行准确率达85.5%,Spider 1.0-Test上达86.4%,BIRD-Dev上达66.3%。基于SSEV流水线的洞见,我们进一步提出ReCAPAgent-SQL(Refinement-Critique-Act-Plan基于智能体的SQL框架),以应对企业数据库和真实世界Text-to-SQL任务日益增长的复杂性。该框架集成了用于规划、外部知识检索、批评、动作生成、自我精炼、模式链接和结果验证的多个专门智能体,通过智能体协作实现SQL预测的迭代精炼。ReCAPAgent-SQL的WMA结果在Spider 2.0-Lite的前100个查询上取得31%的执行准确率,显示出在处理真实企业场景方面的显著改进。总体而言,我们的工作促进了可扩展Text-to-SQL系统在实际场景中的部署,以更低成本和更高效率支持更好的数据驱动决策。
