论文
OBLIQ-IR:训练密集检索器进行倾斜查询
OBLIQ-IR: Training a Dense Retriever for Oblique Queries
摘要
间接检索,如 OBLIQ-Bench 所示,要求检索器查找其相关性由潜在属性(隐含的立场、类似推理技术、作者指纹或模糊的舌尖回忆)决定的文档,而这些属性在文档中很少或没有表面表达。围绕前沿语言模型构建的最先进的密集编码器和代理搜索管道在这些任务上表现出巨大的第一阶段瓶颈,而相同的语言模型在显示候选时可以可靠地验证相关性。我们使用 OBLIQ-IR 来解决这个问题,这是一种单向量密集检索器,其训练混合物将每个机制的合成查询与一种新形式的跨模型监督相结合:来自冻结作者身份编码器的 kNN 图蒸馏,它将风格与主题的归纳偏差传递给学生。经过微调的 3B 检索器在写作风格上达到 0.211 NDCG@10,在数学上达到 0.171,在 Twitter 上达到 0.177,在国会上达到 0.281,比 GPT-5.2 Multi-Hop Agent 提高 \xr{0.010 到 0.150} NDCG@10,比 Gemini-2-Embedding 提高 0.027 到每个报告的任务为 0.222 NDCG@10。代码、数据和检查点可通过此 https URL 获取