论文

FollowTable:指令跟随表检索的基准

FollowTable: A Benchmark for Instruction-Following Table Retrieval

模型评测基准与评测资源

摘要

表检索(TR)传统上被表述为临时检索问题,其中相关性主要由主题语义相似性决定。随着基于 LLM 的代理系统的日益普及,对结构化数据的访问越来越由指令驱动,其中相关性取决于显式内容和模式约束,而不仅仅是主题相似性。因此,我们将指令跟随表检索(IFTR)形式化,这是一项新任务,需要模型共同满足主题相关性和细粒度指令约束。我们确定了 IFTR 中的两个核心挑战:(i) 对内容范围的敏感性,例如包含和排除约束,以及 (ii) 对基于模式的需求的认识,包括列语义和表示粒度——现有 检索器 中基本上不存在这些功能。为了支持系统评估,我们引入了 FollowTable,这是第一个大规模 IFTR 基准,通过分类驱动的注释管道构建。我们进一步提出了一个新的指标,称为指令响应分数,以评估检索排名是否始终适应相对于仅主题基线的用户指令。我们的结果表明,现有的检索模型很难遵循表格数据的细粒度指令。特别是,它们表现出对表面语义线索的系统偏见,并且在处理基于模式的约束方面仍然受到限制,这凸显了未来改进的巨大空间。