论文
高风险推理的多主体审计框架:临床心理健康筛查的评估和可解释性
A Multi-Agent Audit Framework for High-Stakes Reasoning: Evaluation and Interpretability in Clinical Mental Health Screening
摘要
高风险推理任务需要透明且可验证的工作流程,但传统的单模型 大语言模型 (LLM) 经常在零样本范式下与幻觉和低可解释性作斗争。为了解决这一普遍的人工智能挑战,我们提出了一个多代理审计框架,该框架可以模拟协作的多步骤验证过程。我们使用模块化 LangChain 工作流程在临床心理健康筛查的敏感领域中实证验证了这种架构。我们的框架将推理过程分解为感知代理、知识检索增强生成(RAG)、思想链(CoT)临床推理和关键的审计验证阶段。我们使用本地部署的开源模型在 DAIC-WOZ 数据集上评估了该框架。实验结果表明,我们的多智能体管道显着优于单智能体基线,将 PHQ-8 抑郁症严重程度预测的平均绝对误差 (MAE) 从 5.35 降低到 5.02。通过公开跨代理验证痕迹,该框架减轻了推理漂移并提供了高度可解释的诊断原理,为超越孤立模型扩展的可靠人工智能辅助决策支持提供了通用范例。我们在 GitHub 上开放数据和代码访问,以实现可复制性。