论文
通过结果奖励模型对文本到 SQL 进行测试时验证
Test-Time Verification for Text-to-SQL via Outcome Reward Models
摘要
提高 大语言模型 (LLM) 在推理时的可靠性是文本到 SQL 等结构化推理任务的核心挑战。常见的测试时推理策略(包括 Best-of-N 采样和多数投票)依赖于启发式信号,例如执行成功或输出频率,这些信号在候选输出之间提供有限的语义区分。在这项工作中,我们研究结果奖励模型 (ORM) 作为学习语义评分函数,用于文本到 SQL 中的测试时验证。虽然 ORM 之前已被探索用于测试时间扩展和对齐,但它们在结构化查询生成中的应用仍未得到充分探索。我们引入了 GradeSQL,这是一个可扩展的框架,用于通过自动候选生成和基于执行的标签来训练特定于任务的 ORM,从而无需手动注释即可进行验证者训练。我们将 ORM 集成到验证驱动的 Best-of-N 管道中,并在多个开源 LLM 系列的 BIRD 和 Spider 基准测试上评估我们的方法。基于 ORM 的选择始终优于基于执行的 Best-of-N 和多数投票,在 BIRD 上的增益高达 +4.33%,在 Spider 上的增益高达 +2.10%。我们进一步表明,ORM 可通过更大的候选集有效扩展,并对复杂查询产生更强的改进。总的来说,我们的结果表明,基于 ORM 的验证为文本到 SQL 的启发式测试时选择策略提供了一种简单、有效且可扩展的替代方案。代码数据集和模型是公开可用的。