论文

LLM时代我们还需要地名词典吗?使用空间神经符号索引进行链接检索

Do We Still Need Gazetteers in the Era of LLMs? Chaining Retrieval with a Spatial Neuro-Symbolic Index

上下文与知识检索增强

摘要

地理信息检索 (GeoIR) 任务要求系统为下游应用程序解释不明确的地名。传统上,地名解析依赖于地名词典提供地点实体和空间关系的明确索引。最近,无地名词典的方法试图减少对手工搜索的依赖:密集检索利用文本编码器来捕获丰富的上下文,超越了词汇搜索的限制。然而,文本编码器隐含地假设学习的表示可以充当可靠的空间语义索引。在本文中,我们通过空间语义索引设置来评估这一假设:给定上下文地名提及,我们检索由从地名词典知识图派生的文本表示的相应地名词典实体。我们在两种检索策略下对五个冻结文本编码器进行了基准测试:对实体表示进行强力最近邻检索,以及限制检索的神经符号分层波束搜索(即将搜索与地名词典层次结构链接起来)。实验结果揭示了明显的粗略与精细的权衡。无约束的密集检索经常会导致灾难性的空间错误。相反,分层约束改善了粗粒度地理定位,但对于细粒度的本地化度量仍然产生有限的好处:普通文本编码器无法捕获地名词典中编码的细尺度空间保真度。我们的代码公开于:https://doi.org/10.25439/rmt.31094269

LLM时代我们还需要地名词典吗?使用空间神经符号索引进行链接检索的原论文方法或结果图
图 1. 在搜索系统中,索引构建数据以将查询键映射到候选记录。传统上,词汇索引依赖于表面字符串匹配(例如,将“歌剧院”解析为伦敦的“皇家歌剧院”),而空间索引则容忍不同地理分辨率的候选者(例如,验证“新南威尔士”的更广泛区域)。在本文中,空间语义索引合并了两种模态,以在具有不同空间精度的所有层次尺度上检索概念上准确的候选者。索引的概念超越了传统的空间数据库索引(例如,基于几何的结构)(Samet,2005),以支持基于文本的应用程序中的有效地理信息检索(GeoIR)。索引