论文

面向临床预测模型的人机协同设计

Human-AI Co-design for Clinical Prediction Models

智能体系统Agent 架构与控制循环

摘要

开发安全、有效且实际有用的临床预测模型(CPM),传统上需要临床专家、数据科学家与信息学家的迭代协作。这一过程打磨模型构建中往往细小却关键的细节,例如纳入哪些特征/患者、临床类别应如何定义。然而,这种传统协作过程极其耗时耗资源,导致只有一小部分CPM进入临床实践。当团队试图纳入可能包含海量概念的非结构化临床笔记时,挑战进一步加剧。为应对这一挑战,我们提出HACHI,一个迭代式人机协同框架,利用AI代理加速全可解释CPM的开发,支持对临床笔记中概念的探索。HACHI在以下两者间交替:(i)AI代理快速探索并评估临床笔记中的候选概念;(ii)临床与领域专家提供反馈以改进CPM学习过程。HACHI将概念定义为简单的是否问题并用于线性模型,使临床AI团队能够透明地审查、精炼并验证每轮学到的CPM。在两个真实预测任务(急性肾损伤与创伤性脑损伤)中,HACHI超越现有方法,浮现出常用CPM未纳入的新临床相关概念,并提升模型跨临床站点与时间段的泛化性。此外,HACHI揭示了临床AI团队的关键作用,例如引导AI代理探索其未曾考虑的概念、调整概念粒度、更改目标函数以更好对齐临床目标,以及识别数据偏倚与泄漏问题。

面向临床预测模型的人机协同设计
图1:HACHI 框架利用 LLM 与人在环路(humans-in-the-loop)构建有效的临床预测模型(clinical prediction model, CPM)。(a) HACHI 由外循环与内循环组成:外循环中,临床 AI 团队就如何学习 CPM 向 AI 智能体提供指导与反馈;内循环中,AI 智能体遵循临床 AI 团队的指令,寻找能使 CPM 预测准确率最大化的 k k 个概念(正式定义为是非式问题,即 yes/no 问题)。内层由 AI 引导的 CPM 学习过程分为三步:1. 通过对从临床笔记中抽取的关键短语(keyphrases)进行头脑风暴来初始化 CPM;2. 通过分析哪些关键短语与目标结局关联最强来提出候选概念;3. 通过对每个概念进行标注并选择表现最佳的概念来评估候选概念。步骤2与步骤3重复进行直至收敛。每一轮中,临床 AI 团队分析 AI 引导 CPM 学习过程的结果,并就如何改进该过程提供反馈,例如修改提示词、澄清哪些概念属于或不属于关注范围。在两个真实世界临床预测任务上,HACHI 相对基线并跨轮次取得提升:(b) 创伤性脑损伤(traumatic brain injury, TBI)的诊断,其性能以 AUC 衡量,针对总体人群(见图)以及跨两个站点的分层(见表)。(c) 急性肾损伤(acute kidney injury, AKI)的发生,其性能在内部验证集(Period 1,见图与表)以及时间上不重叠的后续测试数据集(Period 2,见表)上评估。误差棒表示标准误。