论文

在链歧义和意图漂移下评估对话式文本到 SQL 的 LLM

Evaluating LLMs on Conversational Text-to-SQL under Chain Ambiguity and Intent Drift

模型评测基准与评测资源

摘要

大语言模型 (LLM) 的最新进展已将会话式文本到 SQL 建立为用户和数据库之间的实用接口,通常涉及多次澄清和修订。然而,现有的基准测试主要评估执行的准确性,而用户意图的展开和转变在很大程度上没有被揭示。为了解决这个问题,我们引入了 TIDE-Bench,这是链歧义和意图漂移评估下对话式文本到 SQL 的基准,针对两种重复出现的模式:链歧义(未指定的问题触发具有条件依赖性的分层澄清)和意图漂移(用户撤回并替换先前提交的请求元素)。 TIDE-Bench 基于 BIRD 的 514 个锚定 SQL 构建,包含 1,542 个样本,并引入了用于链识别和偏差识别分辨率的专用指标(超越执行精度)。评估 12 个先进的 LLM 揭示了一个持久的链识别瓶颈,不受澄清频率、广泛的漂移识别分辨率差距以及联合激活时故障模式之间重叠的影响。发布了TIDE-Bench的相应代码以供进一步研究。