论文
语义相似、逻辑有别:诊断表格RAG中的语义可答性鸿沟
Semantically Similar, Logically Distinct: Diagnosing the Semantic-Answerability Gap in Table RAG
摘要
表格是检索增强生成(RAG)中的关键知识源,但检索到的表格可能缺乏回答查询所需的充分证据——我们把这一属性称为可答性(answerability)。可答性泛指一个或一组来源是否含充分证据,而以语义相关性优化的检索模型即使在单源情形下也不能保证它,构成根本性错配。为研究这一问题,我们提出TCR-Bench,一个面向RAG中表格内容级可答性的诊断基准,围绕“兄弟表”构建——即模式高度相似但内容有细微差异的表。在TCR-Bench上,受评的稠密检索器持续表现出语义—可答性鸿沟:它们常能检索到正确的兄弟表组,却难以在组内定位唯一可答的那张表,QA表现从oracle的0.755跌到top-5检索的0.330。我们的分析提示该鸿沟与语义累积、模式级线索依赖与弱行列绑定相关。作为对鸿沟来源的诊断探针,我们测试轻量两阶段管线——可答性感知重排(AAR),直接做查询—表的可答性判断——能否挽回性能:top-1目标检索从18.2%提升到57.4%;这一大幅增益本身证明所观察到的失败大多反映缺失的可答性验证步骤,而非模型容量的固有局限。
