论文
提示、计划、提取:用于从临床叙述中提取肺部病理学的零次代理 LLM 工作流程
Prompt, Plan, Extract: Zero-Shot Agentic LLMs Workflows for Lung Pathology Extraction from Clinical Narratives
摘要
从病理报告中提取信息对于癌症分期、肿瘤登记人群至关重要。然而,关键数据仍然嵌入在叙述性报告中,使得手动提取劳动密集型且容易出错。传统的有监督的自然语言处理管道通过完全监督的命名实体识别和关系提取来解决这个问题,但需要昂贵的手动注释,并且当上游实体丢失时会遭受级联故障。在这项研究中,我们开发了一个零样本、代理工作流程,并评估了五个开源生成 大语言模型 (LLM),以填充肺切除病理报告中的 13 个美国病理学家学院天气字段。我们使用新颖的、与注册中心一致的评估框架将它们与最先进的监督 GatorTron NER-RE 基线进行比较。基线达到了 0.960 的 Micro-F1,而最佳零样本模型 (GPT-OSS-20B) 达到了 0.893(召回率:0.949)的 Micro-F1,无需特定任务训练即可准确提取病理阶段等复杂关系。这些结果表明,开源、零次代理 LLM 作为提取肺部病理信息的低成本解决方案显示出巨大的潜力。