Prism-Reranker:超越相关性评分——共同为代理检索提供贡献和证据
Prism-Reranker: Beyond Relevance Scoring -- Jointly Producing Contributions and Evidence for Agentic Retrieval
摘要
现代检索管道越来越多地为下游消费者提供服务,例如检索增强生成(RAG)和需要的不仅仅是标量相关性得分的自主代理。仅告诉调用者“相关性如何”的重新排序器会强制代理将整个文档转储到语言模型上下文中,从而在偏离主题的段落和样板文件上浪费标记。我们推出了 Prism-Reranker,这是一个基于 Qwen3.5 构建的重排序模型系列,有四种尺寸(0.8B、2B、4B、9B),超越了标量评分。除了标准的是/否相关性判断之外,每当判决为“是”时,模型都会发出(i)贡献声明,总结文档如何帮助查询,以及(ii)证据段落:一个独立的重写,保留每个与查询相关的信号,同时丢弃噪音。 Prism-Reranker 采用混合目标进行训练,该目标将强大的商业重新排序 API 中的逐点 蒸馏 与贡献和证据目标上的受监督 微调 相结合。我们从 KaLM-Embedding 的开源聚合中整理训练数据,并通过商业搜索 API 检索的真实 Web 文档进行增强,用于开放域查询和 LLM 合成变体,并将部分查询重写为关键字式重新表述,以使模型适应代理发出的流量。为了协调开放语料库中不一致的标签并获得清晰的二进制监督,我们使用 LLM-as-Judge 集合重新标记数据,该集合聚合了来自五个前沿 LLM 的投票。在 BEIR 的 QA 子集以及 LLM 对贡献和证据质量的判断评估中,Prism-Reranker 在所有四种规模上都获得了可靠的结果。我们进一步表明,相同的方法扩展了现有的基于 LLM 的重新排序器,增强了 Qwen3-Reranker-4B 的贡献和证据能力,同时将其平均 BEIR-QA NDCG@10 比基本模型提高了 +1.54。模型权重、训练配方和评估套件已发布。