论文

DecoSearch:面向Text-to-SQL的复杂度感知路由与计划级修复

DecoSearch: Complexity-Aware Routing and Plan-Level Repair for Text-to-SQL

模型推理推理策略与问题分解

摘要

大语言模型(LLM)在自然语言到SQL的翻译上已展现卓越能力——但既有方法在需要多步、数据感知推理的复杂查询上仍然失手。我们介绍DecoSearch——免训练框架——通过把每个查询路由到适当的推理力度层级解决该问题。轻量模式选择器先把完整数据库模式剪枝到相关表与列。LLM裁判随后决定问题是否需要分解:直接问题走直接生成路径——复杂问题升级为原子子问题的有向无环图(DAG)——每个由定向SQL生成步求解。RAG组件以语义相似训练示例锚定分解器——拓扑精化器在执行失败信号表明分解本身有缺陷(而非可修的SQL错误)时重构推理计划。以DeepSeek为骨干——DecoSearch在BIRD上取得70.53%执行准确率、Spider上88.31%——超越全部免训练基线——同时比竞争方法少消耗一个数量级的token。它还可作为模型无关包装器——无需修改管线即持续改进微调过的SQL生成骨干。

DecoSearch:面向Text-to-SQL的复杂度感知路由与计划级修复:论文配图
图 1:管道从通过证据感知模式修剪进行预处理开始。评委决定问题是否可以解决;如果是,则直接路径生成并执行单个 SQL 查询,如果成功则退出。否则,分解器会生成由 @[n] 依赖占位符链接的原子子问题的 DAG。在子问题求解阶段,每个节点按照拓扑顺序执行;在生成下游 SQL 之前,上游结果将解析为小型结果集的内联值列表,或者具体化为大型结果集的临时表。持续执行失败会触发Topology Refiner重写DAG并重试。