论文

TEMPS:为时间信息检索学习时序句子嵌入

TEMPS: Temporal Sentence Embeddings for Temporal Information Retrieval

上下文与知识检索增强

摘要

现代信息检索系统很少表示时间,但许多检索需求依赖时间:在临床、新闻和法律搜索中,事件何时发生决定文档是否相关。稠密检索器和检索增强生成流程能匹配主题,却不善于匹配时间,因而返回主题相关但时间不符的内容。本文提出时间文本相似度(TTS),衡量两个有时间锚点的文本在时间上的一致性,独立于主题相似性。随后提出TEMPS,即精确搜索时间嵌入模型,作为模块化时间分支接入冻结的语义检索器,并用上述信号训练。它把以锚点确定的时间表达解析为区间,用矩匹配将每个区间近似为高斯分布;由此得到的顺序监督以锚点日期为条件的编码器,推理时将其分数与语义分数融合。时间表达的解析与对齐提供监督,因此训练无需手工标注时间数据。时间评分本身是分布嵌入中的高斯KL包含度量,TEMPS新增的是时间解析对齐及矩匹配监督。在三项时间基准上,TEMPS改善了所有受测语义主干的MRR;在TS-Retriever上,相比此前最佳时间检索方法,R@1从19.92提高至25.39。