论文
QO-Bench:诊断类型化事件元组上的查询操作符保留检索
QO-Bench: Diagnosing Query-Operator-Preserving Retrieval over Typed Event Tuples
摘要
许多关于商业、法律和科学语料库的现实世界问题都是对文本中潜在记录的数据库式查询的自然语言版本。现有的检索增强生成(RAG)系统主要针对语义相关性进行优化,但检索合理的段落并不能保证正确的查询执行。我们引入了 QO-Bench,这是一种针对类型化事件元组的查询操作符问答的诊断基准。该基准测试涵盖 22,984 篇新闻文章和 614 个企业活动,并使用 18 个查询模板实例化 785 个问题。每个参考答案都是根据键入的事件元组确定性计算的,并通过召回进行评分,答案通过精确匹配而不是 LLM 判断与黄金元组匹配。此设计可实现操作员级诊断,例如连接和交叉。我们在匹配条件下评估 RAG、ReAct RAG、GraphRAG 和信息提取到 SQL,并使用长上下文预言上限来隔离检索失败。两轴框架——索引时间保存与查询时间执行——预测每个范式失败的地方,结果证实了这一点:系统检索相关文本,但丢弃操作员需要的键入值,并且可部署范式排名在操作员之间反转,相似性检索领先于过滤器/项目,并在交集和计数上提取到 SQL。即使有确凿的证据,长上下文预言机仍远未饱和,因此运算符执行(而不仅仅是检索)是一个更强大的答案模型无法消除的核心瓶颈。 QO-Bench 将目标从段落相关性重新定义为保留查询运算符的检索。基准测试、预测和代码发布于 https://github.com/ZHANG-MENGAO/qo-bench。