论文

LatentRefusal:面向不可回答 Text-to-SQL 查询的潜在信号拒绝

LatentRefusal: Latent-Signal Refusal for Unanswerable Text-to-SQL Queries

模型推理推理验证与自校正

摘要

在基于 LLM 的 text-to-SQL 系统中,不可回答与欠明确的用户查询不仅可能生成错误的文本,还可能生成会产出误导性结果或违反安全约束的可执行程序,构成安全部署的重大障碍。针对此类查询的现有拒绝策略要么依赖输出层的指令遵循——因模型幻觉而脆弱,要么估计输出不确定性——增加复杂性与开销。为应对这一挑战,我们将 text-to-SQL 系统中的安全拒绝形式化为可答性门控问题,并提出 LatentRefusal,一种从大语言模型中间隐藏激活预测查询可答性的潜在信号拒绝机制。我们引入 Tri-Residual Gated Encoder,一个轻量探测架构,用于抑制模式噪声并放大指示不可回答性的稀疏、局部化的问题-模式失配线索。在多样歧义与不可回答设定上的大量实证评估,连同消融研究与可解释性分析,证明了所提方法的有效性,并表明 LatentRefusal 为 text-to-SQL 系统提供了可附加且高效的安全层。在四个基准上,LatentRefusal 将两种骨干上的平均 F1 提升至 88.5%,同时仅增加约 2 毫秒的探测开销。

LatentRefusal:面向不可回答 Text-to-SQL 查询的潜在信号拒绝
图1:拒绝范式的比较。上:传统基于提示的方法依赖 LLM 的输出,在不确定性或幻觉下常常失效。下:我们的方法在生成之前直接从冻结 LLM 的内部隐藏状态中检测拒绝信号,确保安全且高效的拒绝机制,而无需生成或执行任何 SQL。这使单次、低延迟的拒绝决策成为可能,并避免运行可能有害的查询。