论文

可以安全停止吗?序贯临床诊断Agent的风险约束停止

Safe to Stop? Risk-Constrained Stopping for Sequential Clinical Diagnosis Agents

智能体系统Agent 动作执行与治理

摘要

临床诊断人员不仅必须决定下一步要求进行什么测试,还必须决定何时进行诊断或推迟。现有的智能体基准主要评估固定或无约束交互后的准确性,从而隐含自动停止的可靠性。我们提出了 Cros,一个风险约束的停止层,结合了状态错误排序、不相交开发分裂的策略设计以及选择性诊断错误的 LTT 式精确测试和完整顺序策略的最小自主覆盖率。其有限样本保证要求在访问校准标签之前冻结候选族、测试规则和任何随机化。在 1,834 集 MIMIC 衍生的腹痛基准上,完整排名器实现了探索性状态误差 AUROC 0.853,而最大类别概率为 0.715,骨干网本机停止分数为 0.552。在之前查看的 367 集评估分割中,对冻结的 Cros 权重进行分析平均,在 78.8% 覆盖率、成本 5.57 和 0.68 测试下产生 16.9% 的选择性误差,而在本机停止下在 100% 覆盖率、成本 8.14 和 1.53 测试下产生 30.8% 的误差。强制延续是非单调的:仅 HPI 的误差为 28.3%,全面检查后误差为 34.3%。然而,尽管缺少锁定的开发裕度,但在此观察的分割中,均匀权重混合消融更便宜,并且 Cros 名义上仅在 20 个开发重新分割中的 6 个中满足联合标准。由于评估标签是在早期开发过程中进行检查的,因此这些发现提供了探索性可行性和审核证据,而不是确认性安全证书。