论文
MedRouter:学习专家模型选择以改善医学问答
MedRouter: Demystifying Knowledge Differences Across Medical LLMs for Routing-Based Reasoning
摘要
医学问答跨越不同的专业和模式,个人医学大语言模型 (LLM) 在跨任务和领域中表现出独特的优势。这种异质性表明,与依赖任何单一模型相比,联合专家可能会更广泛地覆盖医学问题。然而,现有的LLM路由方法主要寻求平衡答案质量和推理成本,从而为如何利用专业能力的差异来改进医学推理留下了余地。在本文中,我们介绍了 MedRouter,这是一个 agentic 系统,它使用基于嵌入的多标签路由器来选择和查询专业 LLM,然后将其响应传递给生成器以生成最终答案。我们进一步提出了 SCALE(专家能力感知学习),这是一个两阶段的训练框架,首先通过专家正确性监督来训练路由器,然后通过强化学习来优化其选择。第二阶段使用绩效增益奖励(PGR),衡量专业信息如何影响生成器的答案正确性(相对于没有该信息的答案)。对八个基于文本和多模式医疗 QA 基准的实验表明,MedRouter 的平均准确度比最强的路由基准高出 8%。我们对专家输出的分析进一步揭示了独特的优势和互补的问题级别覆盖范围,激励学习路由将这些功能结合起来以实现更全面的医学推理。