论文
用于可扩展患者试验匹配的轻量级检索增强生成和基于 大语言模型 的建模
Lightweight Retrieval-Augmented Generation and Large Language Model-Based Modeling for Scalable Patient-Trial Matching
摘要
患者试验匹配需要对冗长、异构的电子健康记录 (EHR) 和复杂的资格标准进行推理,这对可扩展性、泛化和计算效率提出了重大挑战。现有方法要么依赖于 大语言模型 (LLM) 的全文档处理,这在计算上是昂贵的,要么使用难以捕获非结构化临床叙述的传统机器学习方法。在这项工作中,我们提出了一个轻量级框架,它将检索增强生成和基于 大语言模型 的建模相结合,以实现可扩展的患者试验匹配。该框架明确区分了两个关键组件:检索增强生成用于从长 EHR 中识别临床相关片段,降低输入复杂性,而 大语言模型 用于将这些选定片段编码为信息表示。这些表示通过降维进一步细化,并使用轻量级预测器进行建模,从而实现高效且可扩展的下游分类。我们在多个公共基准(n2c2、SIGIR、TREC 2021/2022)和来自 Mayo Clinic (MCPMD) 的真实多模态数据集上评估了所提出的方法。结果表明,基于检索的信息选择显着减少了计算负担,同时保留了具有临床意义的信号。我们进一步证明,冻结的 LLM 为结构化临床数据提供了强有力的表示,而 微调 对于建模非结构化临床叙述至关重要。重要的是,所提出的轻量级管道实现了与端到端 LLM 方法相当的性能,并且计算成本显着降低。