论文
BLUEmed:用于临床错误检测的检索增强多代理辩论
BLUEmed: Retrieval-Augmented Multi-Agent Debate for Clinical Error Detection
摘要
临床记录中的术语替换错误(其中一个医学术语被语言上有效但临床上不同的术语替换)对医疗保健中的自动错误检测提出了持续的挑战。我们引入了 BLUEmed,这是一个通过混合检索增强生成 (RAG) 进行增强的多智能体辩论框架,它将基于证据的推理与用于临床错误检测的多视角验证相结合。 BLUEmed 将每个临床记录分解为重点子查询,通过密集、稀疏和在线检索来检索按源划分的证据,并分配两个领域专家代理不同的知识库来进行独立分析;当专家意见不一致时,结构化的反驳回合和跨源裁决可以解决冲突,然后是级联安全层,过滤常见的误报模式。我们在零样本和少样本提示下,使用跨越专有和开源系列的多个骨干模型,在临床术语替代检测基准上评估 BLUEmed。实验结果表明,BLUEmed 在少样本提示下实现了最佳准确率 (69.13%)、ROC-AUC (74.45%) 和 PR-AUC (72.44%),优于单智能体 RAG 和仅辩论基线。对六个骨干模型和两种提示策略的进一步分析证实,检索增强和结构化辩论是互补的,并且该框架从具有足够指令遵循和临床语言理解的模型中获益最多。