论文

走向半自动比较基于关键字和语义搜索的准确性

Towards Semi-Automatically Comparing Keyword-Based and Semantic Search Accuracy

模型评测评测方法与指标

摘要

信息检索 (IR) 在管理大型数据集方面的重要性日益增加,这凸显了传统基于关键字的搜索系统的显着局限性。基于上下文感知的聊天搜索方法,例如检索增强生成(RAG),最近出现,但与基于关键字的系统相比,它们的评估通常依赖于主观用户反馈。这些范式之间仍然缺乏严格的定量比较。这项工作引入了一种新颖的初步框架来定量评估产生不同输出格式(例如列表和消息)的搜索系统的 IR 准确性。它侧重于两个关键方面:基于关键字的系统的排名准确性和基于语义聊天的系统检索信息的完整性。我们的方法使用针对特定领域上下文(例如公司或问题)定制的可互换等价类,可以对语义和基于关键字的方法进行半自动比较。我们通过工业案例研究验证了该框架,证明了上下文感知搜索相对于基于关键字的方法在统计上的显着改进,并得到了曼-惠特尼 U 测试等分析的支持。凭借其适应性设计,所提出的框架为客观评估基于关键字和基于语义聊天的搜索方法提供了坚实的基础。