论文

Planner-Auditor Twin:基于FHIR的LLM规划、指南召回、可选缓存与自我改进的Agentic出院规划

Planner-Auditor Twin: Agentic Discharge Planning with FHIR-Based LLM Planning, Guideline Recall, Optional Caching and Self-Improvement

模型推理推理验证与自校正

摘要

目的:大语言模型(LLM)在临床出院规划中展现出前景,但其使用受幻觉、遗漏和置信度校准不准的制约。我们引入一个自我改进、缓存可选的Planner-Auditor框架,通过将生成与确定性验证和针对性重放解耦来提升安全性与可靠性。材料与方法:我们使用MIMIC-IV-on-FHIR实现了一个Agentic、回顾性、FHIR原生的评估流水线。对每位患者,Planner(LLM)生成带显式置信度估计的结构化出院行动计划。Auditor是一个确定性模块,评估多任务覆盖率、跟踪校准(Brier分数、ECE代理指标)并监测动作分布漂移。该框架支持两层自我改进:(i)启用时的事件内再生成;(ii)跨事件差异缓冲,并针对高置信度、低覆盖率案例进行重放。结果:虽然上下文缓存相比基线提升了性能,但自我改进循环是收益的主要驱动因素,将任务覆盖率从32%提升到86%。校准显著改善,Brier/ECE降低,高置信度失误减少。差异缓冲在重放期间进一步纠正了持续的高置信度遗漏。讨论:反馈驱动的再生成和针对性重放是减少遗漏和提升置信度可靠性的有效控制机制。将LLM规划器与基于规则的观察型Auditor分离,使系统性可靠性测量和无需模型重训练的更安全迭代成为可能。结论:Planner-Auditor框架通过可互操作的FHIR数据访问和确定性审计,提供了通往更安全自动出院规划的实用路径,并有可复现的消融实验和以可靠性为中心的评估支持。

Planner-Auditor Twin:基于FHIR的LLM规划、指南召回、可选缓存与自我改进的Agentic出院规划
图1:Planner-Auditor 架构概览。工作流始于通过 simulation harness 进行 FHIR 数据检索与摘要。Planner Agent(GPT-4o-mini)生成草拟计划。覆盖率检查门(coverage check gate)评估该草稿;存在覆盖缺口的高置信度计划被标记存入记忆缓冲区。下游的 Auditing Agent 对覆盖率、校准度与漂移进行评分,并记录判定而不阻塞实时生成。在跨回合重放(cross-episode replay)步骤中,缓冲的失败案例被重新注入以进行离线改进,从而修复被标记的案例。