论文

知道何时停止:预测文本到 SQL 中的执行一致性收敛

Knowing When to Stop: Predicting Execution-Consistency Convergence in Text-to-SQL

模型推理测试时计算扩展

摘要

重复 LLM 调用是估计 Text-to-SQL 结果可信度的标准方法:多次运行管道,判断每个 SQL 执行,并使用结论的一致性作为置信度信号。悬而未决的问题是何时停止、何时一致性收敛。我们将其表述为收敛预测问题,并训练一系列轻量级一维模型,这些模型观察运行一致性轨迹,并在每一步决定进一步的运行是否不太可能对其产生实质性改变,并且我们根据有原则的 Beta-Bernoulli 停止规则和学习的运行计数基线对它们进行基准测试。在 BIRD 基准和两个生产客户数据集上,我们的方法根据每个用户问题调整其停止点,当一致性收敛较早时停止得更快,而当收敛较晚时则持续时间更长。我们进一步表明,运行之间的弱序列相关性使我们可以将它们的顺序排列为训练增强,并由可调的洗牌权重控制。三个数据集的性能保持一致,为了模拟不完美的生产判断,我们将噪声注入到通过比较生成的 SQL 结果和 真值 SQL 结果获得的正确/不正确的判断中,表明该方法仍然可靠地预测收敛。