论文
针对资源匮乏的法国 OSCE 的基于 LLM 的数据生成和临床技能评估
LLM-Based Data Generation and Clinical Skills Evaluation for Low-Resource French OSCEs
摘要
客观结构化临床考试 (OSCE) 是通过结构化患者访谈评估医学生临床和沟通技能的标准方法。然而,在法国,训练课程的组织受到人力和后勤方面的限制,限制了学生进行重复练习和结构化反馈。自然语言处理 (NLP) 和 大语言模型 (LLM) 的最新进展现在提供了自动评估此类医疗访谈的机会,从而减少了训练期间对人工检查员的需求。然而,真正的法国欧安组织注释笔录仍然极其稀缺,限制了可重复的研究和可靠的基准测试。为了应对这些挑战,我们研究了 LLM 在资源匮乏的情况下生成和评估法国欧安组织对话的用途。我们引入了一个受控管道,可以根据特定场景的评估标准生成合成的医患访谈记录,结合理想和扰动的表现来模拟不同的学生技能水平。由此产生的对话会通过 LLM 辅助框架自动贴上银色标签,支持可调整的评估严格性。对多个开源和专有 LLM 进行基准测试表明,中型模型($\le$32B 参数)在合成数据上达到了与 GPT-4o ($\sim$90\%) 相当的精度,凸显了本地可部署、隐私保护的医学教育评估系统的可行性。