论文

AgentRx:面向多模态临床预测任务的LLM智能体基准研究

AgentRx: A Benchmark Study of LLM Agents for Multimodal Clinical Prediction Tasks

智能体系统Agent任务评测

摘要

构建有效的临床决策支持系统需要综合复杂的异构多模态数据。这些模态包括时序电子健康记录数据、医学影像、放射学报告和临床笔记。基于大语言模型(LLM)的智能体已在多种医疗任务中展现出出色表现,尤其是涉及文本模态的任务。考虑到医疗数据在不同医院系统间的碎片化,协作式智能体框架为缓解数据共享难题提供了一个有前景的方向。然而,LLM智能体在多模态临床风险预测中的有效性在很大程度上尚未得到检验。在本工作中,我们使用大规模真实世界数据,对用于临床预测任务的基于LLM的智能体进行系统评估。我们评估了单模态与多模态设置下的表现,并量化了单智能体与多智能体系统之间的性能差距。我们的发现表明,单智能体框架优于朴素的多智能体系统,更善于处理多模态数据,且校准更好。这凸显了改进多智能体协作以更好处理异构输入的迫切需求。通过开源代码与评估框架,本工作提供了一个新的基准,支持医疗领域智能体系统的后续发展。

AgentRx:面向多模态临床预测任务的LLM智能体基准研究:论文配图
图1:AgentRx基准考察的智能体评测框架:覆盖单智能体(单模态/多模态)与多智能体等形态。