论文
Asclepius:一种适应性Harness用于长时域临床智能体
Asclepius: An Adaptive Harness for Long-Horizon Clinical Agents
摘要
LLM智能体大多在短时、单任务轨迹上进行基准测试,但实际部署需持续数小时且面临资源竞争,暴露出不同类别的失败模式。我们使用临床环境模拟器(CES)作为测试平台,该环境模拟智能体在持续的时间和资源压力下管理整个急诊科班次,长时执行失败在单次轨迹中通过结构化、多维度评分显著体现。在CES中,现有智能体多数能正确诊断,但未能及时、完整地执行关键操作,暴露出执行差距。我们将其归因于三种长时失败模式:指令遵循漂移、治疗不完整,以及治疗时效上的严重性公平缺失。我们提出Asclepius,一种具备自演化Harness的智能体辅助框架,该框架在班次间根据轨迹级反馈动态重写操作手册,引入外部化的临床技能库以存储高风险治疗方案知识,并通过三个独立子智能体将每轮决策分派至患者队列中。在从未参与Harness演化观察的独立批次中,Asclepius在关键操作正确性上较强基线框架提升22%(p=0.024),并保持诊断准确率,五名来自三个模型家族的评估者均观察到一致提升;在完整十批次数据集上,关键操作准确率提升达25%,时效性提升13%。这三种失败模式构成耦合瓶颈:只有当三个组件共同作用时,失效才出现明显减少。
