论文
评估用于临床面试训练的面向支架的多智能体 大语言模型 系统
Evaluating Scaffolding-Oriented Multi-Agent Large Language Model System for Clinical Interview Training
摘要
临床教育必须让医学生做好在不确定的条件下进行安全、连贯的患者访谈的准备。传统的标准化患者 (SP) 训练需要大量资源且难以扩展。我们开发了面向脚手架的多智能体大语言模型(LLM)人工智能标准化患者(AI-SP)训练平台1。该系统包括用于模拟对话的患者代理、提供苏格拉底式提示但不泄露诊断信息的辅导代理,以及监控临床进展而不泄露总结分数的轮次评估代理。在一项随机对照研究(N = 100 名医学生)中,参与者被分配到多药剂 (MA) 支架条件或对照条件。所有学生在指定条件下完成了两次学习课程,然后在只有患者的环境中进行了考试。使用基于标准化客观结构化临床考试 (OSCE) 的评估标准评估表现。虽然各组之间的最终诊断准确性没有观察到显着差异,但与利用结构化渐进信息披露的对照组相比,多智能体人工智能标准化患者系统提高了最终检查分数;在沟通、同理心表达和具体历史记录行为方面观察到最实质性和持续的改进。这些发现表明,专门的 LLM 代理可以提高模拟临床访谈的过程质量,而不会人为地夸大检查结果。为了支持未来的研究,我们发布了一个多专家注释数据集,其中包括成绩单、清单注释、轮次评估和 OSCE 一致的评分结果。该资源旨在促进基于教学的 AI-SP 系统的开发,并推进人工智能支持的临床推理训练的研究。