论文

更健康的 LLM:公共卫生问答的检索增强生成

Healthier LLMs: Retrieval-Augmented Generation for Public Health Question Answering

模型评测基准与评测资源

摘要

大语言模型 (LLM) 在医学问答基准上取得了有希望的结果,但它们在公共卫生中的使用受到幻觉和官方指导快速发展的限制。检索增强生成(RAG)通过将响应建立在明确维护的语料库中来减轻这些风险,但端到端性能主要取决于检索配置和超越多项选择格式的评估。我们将 PubHealthBench(源自英国政府公共卫生指南的 7,929 个问题的问答 (QA) 基准)扩展到检索增强环境中,并系统地评估检索和生成选择。我们比较了多个嵌入模型和语料库变体的密集、稀疏和混合检索,并表明混合检索持续提高召回和排名质量,块长度和主题与排名性能相互作用。提供检索到的上下文可显着提高不同 LLM 集合中多项选择的准确性,使较小的开放权重模型能够匹配或优于未检索时使用的较大模型,其增益主要由检索质量和仔细的上下文选择驱动。为了评估真实的自由形式回答,我们引入了基于标题的 LLM 作为法官,涵盖 忠实性、完整性、清晰度和事实一致性,并根据双重人类注释对其进行验证。对于 忠实性 和完整性,法官与人类的一致性最强,而事实的一致性和清晰度的再现不太可靠,因此在大规模解释这些维度时需要谨慎行事。总体而言,我们的结果强调检索是可靠的公共卫生 QA 的主要杠杆,并为构建和评估基于官方指导的 RAG 系统提供了实用指导。