论文

VeriLLMed:使用知识图对医疗 大语言模型 进行交互式可视化调试

VeriLLMed: Interactive Visual Debugging of Medical Large Language Models with Knowledge Graphs

AI 基础设施可观测性

摘要

大语言模型 (LLM) 在医学诊断方面显示出前景,但由于高风险的临床决策和不完善的推理可靠性,实际部署仍然具有挑战性。因此,仔细检查模型行为对于评估诊断推理是否可靠且有临床依据至关重要。然而,调试医疗 LLM 仍然很困难。首先,开发人员通常缺乏足够的医学领域专业知识来以具有临床意义的术语解释模型错误。其次,模型可能会在涉及不同输入类型、任务和推理步骤的大量不同实例中失败,这使得开发人员很难确定哪些错误值得重点检查。第三,开发人员很难识别不同情况下重复出现的错误模式,因为现有的调试实践主要以实例为中心,并且依赖于对孤立故障的手动检查。为了应对这些挑战,我们推出了 VeriLLMed,这是一种可视化分析系统,它集成了外部生物医学知识来审核和调试医学 LLM 诊断推理。 VeriLLMed 将模型输出转换为可比较的推理路径,构建基于知识图的参考路径,并识别三类重复出现的诊断错误:关系错误、分支错误和缺失错误。案例研究和专家评估表明,VeriLLMed 可以帮助开发人员识别临床上不可信的推理,并生成可操作的见解,为医学 LLM 的改进提供信息。