论文

MTR-Suite:评估和综合会话检索基准的框架

MTR-Suite: A Framework for Evaluating and Synthesizing Conversational Retrieval Benchmarks

模型评测基准与评测资源

摘要

对话检索的准确评估对于推进检索增强生成(RAG)系统至关重要。然而,现有的会话检索基准受到成本高昂、稀疏的人工注释或僵化、不自然的自动启发式的困扰。为了应对这些挑战,我们引入了 MTR-Suite,这是一个用于审核、综合和基准检索的统一框架。它具有:(1) MTR-Eval,一个基于 LLM 的审核员,可量化先前基准中的一致性差距; (2) MTR-Pipeline,一个使用贪婪遍历聚类的多智能体系统,以 1/400 的人力成本生成高保真对话; (3) MTR-Bench,严格的通用领域基准。 MTR-Bench 模仿生产风格的挑战(困难的主题切换、冗长),提供卓越的判别能力。我们在 https://github.com/rangehow/mtr-suite 上公开提供我们的代码和数据,以促进未来的研究。