论文
“AI”能当医生吗?临床中同理心、可读性和一致性的研究 LLM
Can "AI" Be a Doctor? A Study of Empathy, Readability, and Alignment in Clinical LLMs
摘要
大语言模型 (LLM) 越来越多地部署在医疗保健领域,但其与临床标准的沟通一致性仍未得到充分量化。我们对结构化医学解释和现实世界的医患互动中的通用和专业领域 LLM 进行多维评估,分析语义保真度、可读性和情感共鸣。基线模型放大了相对于医生的情感极性(非常负面:43.14-45.10% vs. 37.25%),并且在 GPT-5 和 Claude 等较大的架构中,产生更高的语言复杂性(FKGL 高达 16.91-17.60,而医生撰写的响应为 11.47-12.50)。以同理心为导向的提示可减少极端消极情绪并降低年级复杂性(GPT-5 最高可达 -6.87 FKGL 分),但不会显着提高语义保真度。协作重写产生最强的整体一致性。改写配置实现了与医生答案的最高语义相似度(平均值高达 0.93),同时不断提高可读性并减少情感极端。双重利益相关者评估表明,没有任何模型在认知标准上超越医生,而患者始终更喜欢重写的变体以提高清晰度和情绪基调。这些发现表明,LLM 作为协作沟通增强器最有效,而不是替代临床专业知识。