论文

日本中风大语言模型评估:使用大型语言模型进行日语中风安全护理的对话基准

Japanese Stroke LLM Evaluation: A Conversational Benchmark for Safe Stroke Care in Japanese Using Large Language Models

模型评测基准与评测资源

摘要

背景:大语言模型(LLM)在多项选择医学知识考试中取得了与医生​​相当的表现,但其在临床病史采集、紧急性评估和安全性方面的能力仍未得到充分评估。我们提出了日本中风大语言模型评估(日语中风护理的多轮对话基准),并评估了以实践为导向的条件下大语言模型的表现和安全性。方法:我们创建了 10 个中风和相关病症案例,并在多轮日语对话中评估了大语言模型。大语言模型担任医生,而经委员会认证的神经外科医生则担任模拟患者和评估员。每个案例都包括历史记录和使用预先指定的标准评分的行动阶段。可能直接威胁生命的错误被定义为严重错误。总体安全阈值至少为 80%,严重错误为零。 2025 年 10 月和 2026 年 6 月对 18 个模型进行了评估。结果:Claude Fable 5 得分最高(87.4%),关键错误为零,其次是 Claude Opus 4.7(80.3%)和 GLM-5.2(75.6%)。两位领导人达到了安全门槛。 11 个模型犯了 17 个严重错误,包括在 t-PA 之前未能确认实验室结果或血糖、在气道稳定之前进行手术、遗漏颈部血管评估以及 t-PA 超出其适应症。病史采集问题数与病史采集分数相关(r = 0.648,p = 0.007)。结论:日本中风大语言模型评估为以实践为导向的条件下大语言模型的表现提供了基准,包括历史记录问题的上限。病例和评估是由神经外科专家创建的,而不是使用大语言模型作为法官的方法。到 2026 年,基于云的模型和本地模型的性能都会得到改善,其中一些模型会超过安全阈值。需要使用真实案例进行进一步评估。