论文
文本转 SQL 中小样本示例选择的鲁棒主动学习
Robust Active Learning for Few-Shot Example Selection in Text-to-SQL
摘要
特定领域的文本到 SQL 系统通过检索带注释的少数示例来构建 大语言模型,并且每个示例都需要专家编写的 SQL。我们将选择要注释的查询视为查询嵌入的低维流形上的受限实验设计,具有查询相关的注释噪声、跨语义域传播选择的分区拟阵约束以及未知的协方差结构。我们提出了一种最大化异方差信息增益目标的分层贪婪算法。我们证明了目标在查询相关噪声下是单调和子模的,因此分层贪婪选择在分区约束下具有 1/2 近似保证。在内核错误指定的情况下,保证会因附加频谱项而降低;我们在两个实验池上计算它,发现它太大,无法提供定量信息。为了将设计目标与下游任务联系起来,我们给出了一个检索模型,该模型通过每个域填充距离、演示噪声和域覆盖范围从下面限制了几次射击的准确性,并且我们在两个池上校准了其局部性假设。在企业供应链语料库和 BIRD 基准上,选定的银行在相同注释预算下比随机和基于距离的选择改进了跨域检索和端到端 LLM SQL。分层控制和预先指定的测试表明,增益来自分区约束:每个层内的均匀采样与预言机标签评估中的完整方法相匹配,层内最远点选择在小预算下增加了一点,并且噪声加权没有可测量的效果。实用的建议是从第一批开始为每批每个域注释一个示例。