论文

HETERQA:多个异构源记录检索的基准测试

HETERQA: Benchmarking Record Retrieval over Multiple Heterogeneous Sources

模型评测基准与评测资源

摘要

在新兴系统(例如社交媒体和电子商务平台)中,数据记录通常来自异构源,例如关系表、文本文档、图像存储库、空间数据库和知识图。因此,检索问答(QA)任务的目标记录需要我们共同利用这些异构源。然而,大多数现有基准都是根据单独的来源构建的,并且只有极少数最近的基准考虑了两个或三个来源。为了缓解这个问题,我们引入了 HETERQA,这是一个包含 857 个 QA 对的综合基准测试,用于五个异构源的记录检索。 HETERQA 使用 Yelp 业务记录实例化此设置,每个记录都基于多个来源。我们以答案驱动的方式构建 HETERQA:首先使用记录字段约束初始化候选记录,然后通过异构源进行丰富,最后在保留自然语言问题之前跨所需源进行交叉验证。我们通过矛盾检测和人工验证来验证基准,并在相同的指标下进一步评估稀疏、密集、混合、后期交互和代理 检索器。结果表明,HETERQA 具有挑战性:混合检索实现了最强的 Recall@10,Self-RAG 实现了最佳的 MRR@10,并且所有评估的方法仍远未达到基准饱和。这些发现表明 HETERQA 为异构源记录检索提供了一个有效的测试平台,并为未来的检索方法留下了很大的空间。基准数据集和源代码分别可在 https://huggingface.co/datasets/hanchang02/HeterQA 和 https://github.com/hanchang02/HeterQA 公开获取。