论文

利用 AI 基础模型进行多模态、多尺度时空语义搜索和推荐

Multimodal and Multiscale Spatial-Temporal Semantic Search and Recommendation with AI Foundation Models

摘要

语义搜索和类似文档的推荐,例如包含空间和时间信息的异常环境事件(例如,阿拉斯加的死鲸被冲上岸)的新闻和报道,是地理信息检索(GIR)中的一项关键任务。这项工作提出了一种新颖的框架,利用人工智能基础模型,包括 大语言模型 (LLM) 和视觉语言模型 (VLM),来实现对此类事件文档的有效相似性搜索和排名。为了支持这一目标,我们引入了两种新策略:(1)CAMERA(上下文感知多模态事件检索算法),它融合文本和视觉信息以生成比仅从文本派生的嵌入更丰富的嵌入; (2) ASTRA(自适应时空重排序算法),它通过将尺度相关的时空相关性与语义相似性相结合来改进相似性排序。使用来自本地环境观察者网络的数据集进行的实验结果表明,我们的 VLM 增强方法在相似性排名有效性方面优于基于 LLM 的单峰方法。通过自动链接相关事件报告,拟议的框架可以帮助数据管理者和公众更深入地了解环境变化及其局部影响。这些发现凸显了人工智能基础模型通过整合空间、时间、规模和语义等关键地理概念的多方面智能分析来推进 GIR 的潜力。