论文

HAKARI-Bench:统一条件下比较检索架构和效率设置的轻量级基准

HAKARI-Bench: A Lightweight Benchmark for Comparing Retrieval Architectures and Efficiency Settings under Unified Conditions

模型评测基准与评测资源

摘要

随着检索增强生成和语义搜索的快速普及,选择正确的嵌入和检索配置变得越来越困难。大型检索基准很全面,但过于繁重,无法在开发过程中重新运行,并且几乎没有基础设施可以在相同条件下跨许多模型比较生产设置(降维、量化、重新排名)。我们推出了 HAKARI-Bench,这是一个轻量级基准测试,可将现有检索套件重建为小型数据集(纳米集):采用统一格式,涵盖 43 种语言的 35 个基准测试和 551 个任务,能够对五个检索系列(BM25、密集、稀疏、后期交互、重新排序)及其效率变体进行相同条件、模型无关的比较。在 55 个模型中,其总体排名再现了官方 MTEB 检索 v2、MMTEB v2 检索和英语 BEIR(完整),Spearman >0.97。 HAKARI-Bench 并不能取代全面评估;它可以实现快速模型选择、回归检测和读取质量效率帕累托前沿。代码、数据和排行榜均在 MIT 许可下发布。