论文

Agentic-SQL再审视:LLM Text-to-SQL的基于自主性分类法与实证基准分析

Agentic-SQL Revisited: Autonomy-Based Taxonomy and Empirical Benchmark Analysis for LLM Text-to-SQL

模型评测模型能力评测

摘要

基于LLM的Text-to-SQL进展分散在不同基准、骨干和推理协议上报告,使跨系统比较非常脆弱。我们把该领域重新框定为一个排行榜聚合:收集作者自己报告的指标,并沿推理自主性轴组织——涵盖受限生成、上下文内、迭代式、Agentic和推理内化——每个数据格都有可追溯的出处。为给聚合提供实证锚点,我们在Spider上做聚焦案例研究,比较8B开源骨干在有和无思维链(CoT)监督下的表现与少样本DeepSeek V3和GLM-4基线。四个模式浮现:Spider上的增益向BIRD和Spider 2.0的迁移不均衡;自主性以不菲代价换取鲁棒性;推理内化介于仅答案解码与外部编排的Agent之间;CoT增益集中在Hard和Extra-Hard查询上。我们发布一个镜像该自主性轴的Python工具框架,以便未来方法可直接加入排行榜。