论文
学习毒理学决策支持的诊断推理
Learning Diagnostic Reasoning for Decision Support in Toxicology
摘要
急性多物质中毒需要在很大的不确定性下做出快速、挽救生命的决定,因为临床医生必须依赖不完整的摄入细节和非特异性症状。在这种混乱的环境中进行有效的诊断推理需要将非结构化的非医学叙述(例如护理人员场景描述和不可靠的患者自我报告或已知病史)与生命体征等结构化医学数据融合起来。虽然 大语言模型 (LLM) 显示出处理此类异构输入的潜力,但它们在这种情况下表现不佳,通常表现不佳仅依赖于患者病史的简单基线。为了解决这个问题,我们提出了 DeToxR(推理毒理学决策支持),这是强化学习 (RL) 首次适应紧急毒理学。我们设计了一个强大的数据融合引擎,用于基于 LLM 跨 14 种物质类别的多标签预测,并通过组相对策略优化 (GRPO) 进行微调。我们直接使用临床表现奖励来优化模型的推理。通过制定多标签一致性指标作为奖励信号,该模型会因缺少共同摄入的物质和幻觉不存在的毒物而受到明确的惩罚。我们的模型显着优于其未适应的基础 LLM 对应模型和监督基线。此外,在初步的临床验证研究中,该模型通过实现更高的 micro-F1(0.644 与 0.473)和识别正确毒物的回忆来显示出临床优势。这些结果证明了 RL 对齐的 LLM 具有综合非结构化临床前叙述和结构化医疗数据以在高风险环境中提供决策支持的潜力。