论文

RealICU:LLM智能体理解长上下文ICU数据吗?一个超越行为模仿的基准

RealICU: Do LLM Agents Understand Long-Context ICU Data? A Benchmark Beyond Behavior Imitation

模型评测基准与评测资源

摘要

重症监护病房(ICU)产生漫长、密集且不断演变的临床信息流,医生必须在时间压力下反复重新评估患者状态,凸显对可靠AI决策支持的明确需求。现有ICU基准通常将历史临床医生操作视为真值。然而,这些操作是在对潜在患者状态信息不完整、时间上下文有限的情况下做出的,因而可能并非最优,使得难以评估AI系统的真实推理能力。我们提出RealICU,一个在真实ICU条件下评估大语言模型(LLM)的事后标注基准,其标签由资深医生审阅完整患者轨迹后创建。我们设计了四项源自医生需求的任务:评估患者状态、急性问题、推荐操作,以及存在不安全后果风险的危险信号操作。我们以30分钟窗口切分每条轨迹,并发布两个数据集:包含94名MIMIC-IV患者930个窗口标注的RealICU-Gold,以及由经医生验证的LLM事后标注器Oracle扩展到11,862个窗口的RealICU-Scale。包括记忆增强型在内的现有LLM在RealICU上表现不佳,暴露出两种失败模式:临床建议中的召回-安全权衡,以及对早期患者解读的锚定偏差。我们进一步引入ICU-Evo来研究结构化记忆智能体,它改善了长程推理但未能完全消除安全失败。总体而言,RealICU为度量和改进高风险诊疗中的AI序列决策支持提供了一个临床扎根的试验台。项目页面:https://chengzhi-leo.github.io/RealICU-Bench/

RealICU:LLM智能体理解长上下文ICU数据吗?一个超越行为模仿的基准:论文配图
图 1:ICU 决策是在海量数据量和时间压力下做出的。 ICU 人工智能副驾驶将数据流集成到决策支持面板中,该面板可评估患者状态、识别急性问题、提出建议措施,并对不安全的危险信号行为发出警告。