论文

MIRA:LLM 辅助多类别集成检索基准

MIRA: An LLM-Assisted Benchmark for Multi-Category Integrated Retrieval

模型评测基准与评测资源

摘要

用户越来越期望现代搜索系统能够提供统一的界面,从不同的数据源和格式无缝地检索信息。然而,当前的信息检索(IR)评估基准并没有跟上这种发展的步伐,这主要是由于缺乏代表当代搜索领域多样性的测试集合。我们通过 MIRA 解决了这一关键差距,MIRA 是一个基于大型社会科学搜索平台的新颖基准。 MIRA 专为在单一、统一的评估框架内跨异构类别(出版物、研究数据、变量以及仪器和工具)进行类别感知排名而设计。所提出的集合在几个方面具有独特性:(1)它建立在真实用户查询的基础上,为评估提供了更现实的基础; (2)涵盖四个不同类别的学术项目,可以进行多方位的评价; (3)它利用大语言模型生成主题描述和叙述,以及对这些主题的相关性评估,大大减少了测试集生成的人力和成本。我们发布此资源是为了为多方面、类别感知、集成或跨类别信息检索的研究提供基础测试平台,从而使社区受益。