论文

MedHopQA:基于疾病的多跳推理基准和基于 LLM 的生物医学问答的评估框架

MedHopQA: A Disease-Centered Multi-Hop Reasoning Benchmark and Evaluation Framework for LLM-Based Biomedical Question Answering

模型评测基准与评测资源

摘要

在生物医学领域评估 大语言模型 (LLM) 需要能够区分推理和模式匹配的基准,并随着模型能力的提高而保持区分性。现有的生物医学问答(QA)基准在这方面受到限制。多项选择格式可以让模型通过答案消除而不是推理来取得成功,而广泛传播的考试式数据集越来越容易受到性能饱和和训练数据污染的影响。多跳推理被定义为整合多个来源的信息以得出答案的能力,对于诊断支持、基于文献的发现和假设生成等具有临床意义的任务至关重要,但在当前的生物医学 QA 基准中仍然代表性不足。 MedHopQA 是一个以疾病为中心的多跳推理基准,由 1,000 个专家策划的问答对组成,作为 BioCreative IX 的共享任务引入。每个问题都需要综合两篇不同的维基百科文章中的信息,并且答案以开放式自由文本格式提供。黄金注释通过来自 MONDO、NCBI Gene 和 NCBI Taxonomy 的基于本体的同义词集得到增强,以支持词汇和概念级别的评估。 MedHopQA 是通过结合人工注释、分类、迭代验证和 LLM-as-a-judge 验证的结构化流程构建的。为了减少排行榜游戏和污染风险,这 1,000 个计分问题嵌入在 CodaBench 排行榜上可公开下载的 10,000 个问题中,并保留答案。 MedHopQA 提供了一个基准和可重复使用的框架,用于构建未来的生物医学 QA 数据集,优先考虑成分推理、饱和抗性和抗污染性作为核心设计约束。