论文

具有上下文强盗偏好学习的人在环多智能体呼吸机决策支持

Human-in-the-Loop Multi-Agent Ventilator Decision Support with Contextual Bandit Preference Learning

智能体系统Agent 协作

摘要

呼吸机决策支持需要连续决策,跟踪不断变化的生理和疾病轨迹,同时尊重安全边界和临床医生特定的调整方式。基于规则的方法很少概括个性化,并且端到端强化学习或单个 大语言模型 系统仍然难以控制和审计。我们提出了呼吸机决策支持系统(VDSS),这是一种人在环多代理框架,通过合同驱动的结构化接口协调模块化决策组件,并生成可追踪的证据以供审查。 VDSS 通过上下文强盗执行在线偏好调整,在每个调整周期根据最终接受的决策更新临床医生的特定偏好,并使用它们来指导后续建议。结构化拒绝反馈会触发有针对性的重新规划,以减少无效迭代并提高交互稳定性。经过专家评审的回顾性 ICU 轨迹重播表明,建议的可接受性更高,达成可接受计划的交互次数更少,支持临床可部署的人类人工智能协作。