论文
带一致性验证的多智能体推理改进医学MCQA的不确定性校准
Multi-Agent Reasoning with Consistency Verification Improves Uncertainty Calibration in Medical MCQA
摘要
错误校准的置信度分数是在临床环境中部署人工智能的实际障碍。总是过度自信的模型不会提供有用的推迟信号。我们提出了一个多代理框架,将特定领域的专业代理与两阶段验证和 S 分数加权融合相结合,以改善医学多项选择题回答中的校准和区分。四名专家(呼吸科、心脏病科、神经科、胃肠科)使用 Qwen2.5-7B-Instruct 进行独立诊断。然后,每个诊断都会经过两阶段的自我验证过程,衡量内部一致性并产生专家置信度分数(S 分数)。 S 分数驱动加权融合策略,选择最终答案并校准报告的置信度。我们评估了四种实验设置,涵盖 MedQA-USMLE 和 MedMCQA 的 100 个问题和 250 个问题高分歧子集。校准改进是核心发现,在所有四种设置中,ECE 降低了 49-74%,包括更严格的 MedMCQA 基准,即使绝对准确性受到知识密集型召回要求的限制,这些收益仍然存在。在 MedQA-250 上,整个系统达到 ECE = 0.091(比单一专家基线降低 74.4%)和 AUROC = 0.630 (+0.056),准确度为 59.2%。消融分析将两阶段验证确定为主要校准驱动因素,将多智能体推理确定为主要准确性驱动因素。这些结果表明,基于一致性的验证可以在不同的医疗问题类型中产生更可靠的不确定性估计,为安全关键的临床人工智能应用中的延迟提供实用的信心信号。
