论文

SatIR:基于可扩展高召回率约束满意度的信息检索,用于临床试验匹配

SatIR: Scalable High-Recall Constraint-Satisfaction-Based Information Retrieval for Clinical Trials Matching

摘要

许多现实世界的检索和匹配问题需要的不仅仅是主题相关性:候选者必须满足众多配置文件中的一个配置文件的特定约束,而不仅仅是与其相关。临床试验是这一挑战的一个高风险实例:它们是循证医学的核心,但尽管 ClinicalTrials.gov 上列出了超过 50 万个试验,每月吸引约 200 万用户,但许多试验仍难以实现招募目标。现有的检索技术主要基于关键字和嵌入相似性匹配,将资格约束视为软信号而不是绑定要求,导致召回率低、精度低且可解释性有限。我们提出了 SatIR,一种基于形式约束满足的可扩展、高效、高精度、高召回率、可解释的临床试验检索方法。利用已建立的医学本体论,我们使用 大语言模型 (LLM) 将非正式推理(关于模糊性、隐含的临床假设和不完整的患者记录)转换为明确、精确、可控和可解释的正式可满足性模理论 (SMT) 约束。为了可扩展且高效的检索,我们将 SMT 匹配问题投影到关系代数上,从而实现高效的数据库实现,在保留高召回率的同时,几乎不牺牲精度。 SatIR 在 SIGIR 2016 数据集和源自 TREC 2022 的基准上持续改进基于相似性的基线的资格感知检索。相对于 TrialGPT 式检索,SatIR 在 SIGIR 2016 上为每位患者检索到的相关性和合格试验多了 32%-72%,并在 TREC 基准上实现了 1.8-3.2 倍的合格试验召回。检索速度很快,在 3,621 项 SIGIR 试验中,每位患者仅需要 146 毫秒。