论文

CodeClinic:评估临床推理智能体编程技能的自动化

CodeClinic: Evaluating Automation of Coding Skills for Clinical Reasoning Agents

智能体系统Agent任务评测Agent Skills

摘要

基于大语言模型(LLM)的临床推理智能体旨在自动化重症监护病房(ICU)监护以及从电子健康记录(EHR)追踪患者状态等任务。现有系统通常依赖人工整理的临床工具或技能来处理脓毒症检测、器官衰竭评估等概念。然而,维护这些工具库需要大量专家投入,而零样本查询或代码生成往往产生低效且不可靠的推理链,在机构特定的临床政策下尤为如此。我们提出CodeClinic,一个构建于MIMIC-IV之上的基准,用于评估LLM智能体能否合成并组合可复用的临床技能,而非依赖固定工具箱。该基准包含两个互补任务:纵向ICU监测与组合式信息搜寻。纵向设定模拟每四小时做出结构化决策的患者轨迹监测,覆盖25种发现和8个临床类别;组合式设定横跨9个领域的259个任务、共63k个实例,并按组合依赖深度分层,以评估日益复杂的多步推理。我们进一步提出一个离线自动形式化流水线,通过迭代式LLM精炼,将自然语言临床指南转换为可复用且经验证的Python技能库。与零样本代码生成相比,所得技能库提升了一致性,同时将每次查询的token用量最多降低40%。

CodeClinic:评估临床推理智能体编程技能的自动化:论文配图
图 1:CodeClinic 中纵向 ICU 监测任务的图示。在 ICU 住院期间,每隔 4 小时就会提示代理评估患者的当前状况,并有严格的可见性限制,将其限制为当前检查点可用的数据。在每个检查点,代理都会推理或编写代码来收集证据并输出监视决策。先前检查点决策的滚动历史记录通过汇总步骤在整个停留期间进行。