论文

LongMedBench:面向长程临床决策的医疗智能体基准

LongMedBench: Benchmarking Medical Agents for Long-Horizon Clinical Decision-Making

智能体系统上下文与知识记忆Agent任务评测Agent记忆长程任务评测

摘要

本工作提出LongMedBench:一个基于真实EHR的长程临床决策基准。既往对基于LLM的医疗智能体的评估大多强调短上下文知识问答与工具使用;但真实医疗本质上是纵向的——临床医生必须聚合跨多次就诊、检验与演化的治疗证据。因此长程交互对现实评估必不可少。LongMedBench经可复现管线构建:把MIMIC-IV入院记录与临床笔记整合为时序事件流与长上下文记忆数据集,支持智能体与临床环境的长程多会话交互;含335名患者,人均19.72次住院、每次就诊44.91个医疗事件。以长程决策过程为指导,我们提出含三个套件的评估分类:事实问答、时序推理与长程决策——度量智能体如何在扩展时程上理解并利用历史患者信息。实验显示:近期LLM能善用显式时间戳,但在隐式时间推断上有困难;RAG与智能体记忆系统能改善信息检索类任务,而决策类任务的表现高度依赖模型的即时上下文。

LongMedBench:面向长程临床决策的医疗智能体基准:论文配图
图 1:LongMedBench 的数据处理流程