论文
SQL-ASTRA:通过列集匹配与轨迹聚合缓解智能体SQL中的稀疏反馈
SQL-ASTRA: Alleviating Sparse Feedback in Agentic SQL via Column-Set Matching and Trajectory Aggregation
摘要
智能体强化学习(RL)在复杂任务上展现出前景,但Text-to-SQL大多仍局限于单轮范式。一个主要瓶颈是贡献归因问题。在传统范式中,奖励仅由最后一轮反馈决定,忽略了中间过程,导致信用评估模糊。为解决这一问题,我们提出Agentic SQL,一个以通用双层奖励机制为特色的框架,旨在提供有效的轨迹级评估与稠密的步级信号。首先,我们提出聚合轨迹奖励(Aggregated Trajectory Reward,ATR)来解决多轮贡献归因。ATR利用非对称转移矩阵聚合面向过程的分数,以激励持续改进。借助Lyapunov稳定性理论,我们证明ATR充当能量耗散算子,保证策略无环且单调收敛。其次,列集匹配奖励(Column-Set Matching Reward,CSMR)提供即时的步级奖励以缓解稀疏性。通过在每一轮执行查询,CSMR将二值(0/1)反馈转换为基于部分正确性的稠密[0, 1]信号。在BIRD上的评估显示,相比使用二值奖励的GRPO提升5%。值得注意的是,在使用相同模型的情况下,我们的方法在BIRD和Spider 2.0上优于SOTA的Arctic-Text2SQL-R1-7B,推动Text-to-SQL走向稳健的多轮智能体范式。
