论文

BioCreative IX 上的 MedHopQA 轨道概述:多跳医疗问答系统的轨道描述、参与和评估

Overview of the MedHopQA track at BioCreative IX: track description, participation and evaluation of systems for multi-hop medical question answering

模型评测基准与评测资源

摘要

多跳问答(QA)仍然是生物医学领域的一个重大挑战,要求系统集成多个来源的信息来回答复杂的问题。为了解决这个问题,BioCreative IX MedHopQA 共享任务旨在对 大语言模型 (LLM) 的多跳推理进行基准测试。我们开发了一个新颖的数据集,其中包含 1,000 个具有挑战性的 QA 对,涵盖疾病、基因和化学物质,特别强调罕见疾病。每个问题都需要通过整合来自两个不同维基百科页面的信息进行两跳推理。此次挑战赛吸引了来自 13 个团队的 48 份参赛作品。使用表面字符串比较和概念准确性(MedCPT 评分)来评估系统。结果显示基线 LLM 和增强系统之间存在巨大的性能差距。排名靠前的提交在 MedCPT 指标上获得了 89.30% 的 F1 分数和 87.30% 的精确匹配 (EM) 分数,而零样本基线的分数分别为 67.40% 和 60.20%。该挑战的一个核心发现是检索增强生成(RAG)和相关的基于检索的策略对于出色的性能至关重要。此外,当正确答案表面形式不同时,概念级评估改进了答案评估。 MedHopQA 数据集是公开可用的,以支持这一重要领域的持续进展。挑战材料:https://www.ncbi.nlm.nih.gov/research/bionlp/medhopqa 和基准 https://www.codabench.org/competitions/7609/