论文

十位头痛专家对比人工智能进行临床文献总结

Ten Headache Specialists versus Artificial Intelligence for Clinical Literature Summarization: A Critical Evaluation and Comparison

模型评测模型能力评测

摘要

总结最新的医学文献来指导临床决策对于循证医学和高质量的患者护理至关重要。然而,由于与患者相处的时间有限以及发表的文章数量迅速增加,临床医生面临着越来越多的挑战。尽管检索增强型大语言模型(LLM)在临床总结方面显示出了希望,但对其在综合更广泛的科学文献方面的有效性以及与专家撰写的综合进行直接比较的人类评估仍然很少。我们使用三个最先进的 LLM 构建了一个基于 RAG 的代理 AI 框架:Sonnet、GPT-4o 和 Llama 3.1。一位头痛专家提出了 13 个问题,其中 3 个用于快速优化,10 个用于评估。美国和加拿大的十位头痛专家每人为一个问题撰写了一份摘要,每个问题产生四个摘要(专家、Sonnet、GPT-4o 和 Llama)。专家们在不了解作者身份的情况下,根据正确性、完整性、简洁性和临床实用性,对摘要进行了严格的评估,排除了他们撰写摘要的主题,并使用标准化评分标准对每个摘要进行了从 1 到 10 的评分。他们还按偏好对摘要进行排名,并表明他们是否认为每个摘要是由专家或大语言模型撰写的。我们的研究比较了头痛专家评估的大语言模型和专家撰写的文献摘要,结果表明,专家撰写的摘要更受青睐,尽管专家有时发现区分人类和人工智能生成的摘要具有挑战性。我们还确定了标准评估指标之外的关键专家价值特征,这些特征可以指导人类和人工智能文献摘要管道的未来改进。