论文
融合人类和 LLM 专业知识来检测心理健康聊天机器人响应中的幻觉和遗漏
Blending Human and LLM Expertise to Detect Hallucinations and Omissions in Mental Health Chatbot Responses
摘要
随着由 LLM 驱动的聊天机器人越来越多地部署在心理健康服务中,检测幻觉和遗漏对于用户安全变得至关重要。然而,最先进的 LLM 作为法官的方法在高风险的医疗保健环境中常常会失败,其中细微的错误可能会造成严重的后果。我们表明,领先的 LLM 法官在心理健康咨询数据上的准确率仅为 52%,一些幻觉检测方法的召回率接近于零。我们确定根本原因是 LLM 无法捕获领域专家认可的细微语言和治疗模式。为了解决这个问题,我们提出了一个框架,将人类专业知识与 LLM 相结合,以跨五个分析维度提取可解释的、领域知情的特征:逻辑一致性、实体验证、事实准确性、语言不确定性和专业适当性。对公共心理健康数据集和新的人工注释数据集的实验表明,在这些特征上训练的传统机器学习模型在我们的自定义数据集上实现了 0.717 F1,在幻觉检测公共基准上实现了 0.849 F1,两个数据集的遗漏检测达到了 0.59-0.64 F1。我们的结果表明,在高风险的心理健康应用中,将领域专业知识与自动化方法相结合可以产生比黑盒 LLM 判断更可靠和透明的评估。