论文

使用 大语言模型 验证医学因果假设

Medical Causal Hypothesis Verification with Large Language Models

模型评测模型能力评测

摘要

大语言模型 (LLM) 在搜索和信息检索中的使用越来越多,这凸显了评估其在医疗保健等高风险领域的可靠性的必要性。尽管 LLM 可以有效回答有关疾病、症状和治疗的问题,但其准确评估因果关系并将其结论建立在经过验证的科学证据的能力仍不清楚。在这里,我们提出了一项初步的小规模研究,调查 LLM 在评估因果医疗声明并通过同行评审的研究支持它们的准确性。我们提出了一个用于验证因果假设的评估框架,可用于系统地跟踪现有和未来 LLM 的表现。我们评估了 8 个 LLM 在 17 个医学因果假设上的表现,以评估它们是否能够使用文献中的科学证据可靠地验证这些假设。我们根据六个标准(总共 1,067 个注释点)系统地注释他们提供的科学证据,并使用九个评估指标对其进行评估。我们的分析表明,虽然 LLM 表现出很强的召回率,但它们在提供有效的科学文章和支持证据以及拒绝不受支持的假设方面往往表现不佳。这些发现凸显了当前 LLM 的一个关键局限性,因为尚不能完全相信它们能够从生物医学文献中验证因果关系。这项工作强调了在医疗保健环境中使用 LLM 进行搜索和检索之前需要进行严格的评估。