论文

SIFTING:一种基于 LLM 的新型框架,用于从临床自由文本报告中提取结构化且透明的信息,并应用于肺癌的肿瘤分期

SIFTING: A Novel LLM-Based Framework for Structured and Transparent Information Extraction from Clinical Free-Text Reports, with Application to Tumor Staging in Lung Cancer

上下文与知识上下文工程

摘要

背景:大语言模型 (LLM) 有望从临床自由文本文档中提取信息,但其输出通常是非结构化的且缺乏可追溯性,使临床工作流程中的验证和采用变得复杂。在这项工作中,我们引入了 SIFTING,这是一个基于 LLM 的框架,旨在解决这些缺点。方法:SIFTING 将 LLM 的语言理解功能与段级处理和结构化提示相结合,并进行严格的输出控制,将结果与源文本联系起来,从而实现准确和透明的信息提取。为了展示其功能,我们将该框架应用于从 130 份肺癌放射学报告中提取肿瘤 T 分期信息的任务(SIFTING-T 分期)。开源 LLM Llama-3.3-70B (35 GB) 的紧凑型 4 位量化版本用于完全自托管设置,提供对数据和模型的完全控制。根据四位临床专家创建的参考标准评估性能,并与传统单提示方法中使用的一系列 LLM 进行比较,使用引导重采样来估计置信区间。结果:SIFTING-T-stage 相对于参考标准的准确度为 90% (95% CI: 84-95)。我们发现其性能甚至可以与具有推理功能的最先进的 LLM 相媲美,并且可以与临床专家互换 (p < 0.001),同时通过源文本参考提供完整的可追溯性。结论:SIFTING 能够从临床自由文本文档中提取准确、结构化且可追踪的信息。它确保数据控制、再现性和可验证的输出,支持临床验证和工作流程集成。