大语言模型能否解锁眼科诊断报告中的离散数据?
Can large language models unlock discrete data in ophthalmic diagnostic reports?
摘要
目的:使用两种提示策略从眼科诊断 PDF 报告中提取结构化数据,评估大语言模型 (LLM) 的准确性和效率。方法:使用两个 GPT-4o 辅助管道处理 20 份涉及 4 种类型(视野、OCT 青光眼概述、OCT 视网膜神经纤维层单次检查和 OCT 厚度图;每种 n = 5)的去识别化报告,并与协调的手动基本事实进行比较。 Schema-Constrained 使用带有预定义 JSON Schema 的结构化输出模式; Prompt-Only 使用了详细的指令提示,然后将 Python 转换为 JSON。结果是值准确性、格式准确性和提取时间。结果:视野和 RNFL 单项检查的模式约束值准确率为 100.00%,青光眼概述为 97.45%,厚度图为 98.00%; Prompt-Only 在所有四种报告类型中实现了 100.00%。所有报告类型中模式受限的格式准确度均为 100.00%,仅提示格式准确度为 100.00%,RNFL 单项考试除外 (90.14%)。手动审核的每份报告的平均提取时间为 56.51 秒,而模式约束的平均提取时间为 5.04 秒,仅提示的平均提取时间为 4.70 秒,减少了约 92%。结论:在这个小型概念验证数据集中,通用 LLM 辅助管道以高精度从眼科诊断 PDF 中提取结构化数据,并显着缩短了处理时间。 Prompt-Only 实现了最高的值准确度,而 Schema-Constrained 则生成符合架构的输出,格式准确度为 100%。这些互补的优势支持进一步评估用于研究和临床数据提取的混合、验证感知工作流程。