论文

OBLIQ-Bench:通过潜在和隐式查询暴露现代 检索器 中被忽视的瓶颈

OBLIQ-Bench: Exposing Overlooked Bottlenecks in Modern Retrievers with Latent and Implicit Queries

模型评测基准与评测资源

摘要

检索基准日益饱和,但我们认为高效搜索远未成为解决问题。我们确定了一类称为倾斜的查询,它们寻找实例化潜在模式的文档,例如查找表达隐含立场的所有推文、展示特定故障模式的聊天日志或与抽象场景匹配的记录。我们研究了可能产生倾斜的三种机制,并引入了 OBLIQ-Bench,这是一套针对真实长尾语料库的五个倾斜搜索问题。 OBLIQ-Bench 暴露了检索和验证之间被忽视的不对称性,其中每当相关文档出现时,推理 LLM 都能可靠地识别潜在相关性,但即使是复杂的检索管道也无法首先显示最相关的文档。我们希望 OBLIQ-Bench 能够推动检索架构的研究,以有效捕获大型语料库中的潜在模式和隐含信号。