论文
大语言模型 能否可靠地从冠状动脉造影报告中提取生理指标值?
Can Large Language Models Reliably Extract Physiology Index Values from Coronary Angiography Reports?
摘要
冠状动脉造影 (CAG) 报告包含临床相关的生理测量结果,但这些信息通常采用非结构化自然语言的形式,限制了其在研究中的使用。我们研究了使用 大语言模型 (LLM) 从葡萄牙语 CAG 报告中自动提取这些值及其解剖位置。据我们所知,这项研究是第一个解决从大量(1342 份报告)CAG 报告语料库中提取生理学指标的研究,也是少数专注于 CAG 或葡萄牙语临床文本的研究之一。我们探索不同设置下的本地隐私保护通用和医疗 LLM。提示策略包括零样本提示、少样本提示和带有令人难以置信的例子的少样本提示。此外,我们应用约束生成并引入基于正则表达式的后处理步骤。鉴于测量的稀疏性,我们提出了一个多阶段评估框架,将格式有效性、值检测和值正确性分开,同时考虑不对称的临床错误成本。这项研究证明了 LLM 在从葡萄牙 CAG 报告中提取生理指标方面的潜力。非医学模型的表现类似,Llama 在零样本提示下获得了最佳结果,而 GPT-OSS 对提示变化表现出最高的鲁棒性。虽然 MedGemma 表现出与非医学模型相似的结果,但 MedLlama 的结果在无约束环境中不符合格式,并且在受约束环境中的性能显着降低。提示技术的变化和添加正则表达式层在模型之间没有显示出显着的改进,而使用约束生成降低了性能,尽管有允许使用不符合模板的特定模型的好处。