论文
考察多智能体医疗系统在临床推理中对人为干预的脆弱性
Examining the Vulnerability of Multi-Agent Medical Systems to Human Interventions for Clinical Reasoning
摘要
故障点的人为干预可以改变多智能体医疗系统的诊断准确性。我们将故障点定义为人工智能代理对话中的时刻,其中代理的推理最容易受到外部影响。这项研究使用 MedQA 数据集分析了模拟医患对话,以衡量干预措施如何改变推理和准确性。正确的干预方法显示基线诊断准确性提高高达 40%,而错误或与偏差相关的干预措施会使性能下降高达 6%,并增加诊断漂移和不确定性。除了性能变化之外,我们的分析还揭示了模拟代理环境中的认知偏差与现实世界的临床实践之间的行为相似性。例子包括过早关闭和容易受到误导性线索的影响。总体而言,这些发现表明,通过人为干预来识别和指导故障点可能会提供一种提高多智能体医疗系统诊断鲁棒性的机制。
