论文
用于模式约束临床信息提取的检索增强 大语言模型
Retrieval-Augmented Large Language Models for Schema-Constrained Clinical Information Extraction
摘要
护患对话记录包含可操作的观察结果,但将这些记录大规模转换为结构化表示仍然具有挑战性。文档负担很大,之前的研究表明临床医生将工作日的大部分时间花在文档和相关的案头工作上,而不是直接的患者护理上。 MEDIQA-SYNUR 专注于从护理-患者对话记录中提取观察结果,要求系统将这些叙述规范化为具有值类型约束的预定义模式。我们提出了一种模块化检索增强生成(RAG)管道,该管道使用训练集作为示例语料库,结合模式约束提示(完整模式与修剪后的候选模式)、基于确定性模式的后处理和第二遍审核,以及两个 LLM 主干:Llama-4-Scout-17B-16E-Instruct 和 GPT-5.2 以及相应的嵌入模型拉格。我们的最佳配置使用具有完整架构、RAG 和第二次审核的 GPT-5.2,获得 80.36% 的 F1 分数。总体而言,我们的结果表明,RAG 始终如一地提高了性能,而模式约束的最佳程度取决于模型,并且第二遍审核通过纠正残余模式遵守错误而产生了适度的额外收益。