论文

提示语言影响大语言模型的诊断推理和准确性

Prompting language influences diagnostic reasoning and accuracy of large language models

模型评测模型能力评测

摘要

大语言模型 (LLM) 越来越多地被探索用于临床决策支持,但大多数评估都是用英语进行的,其在其他语言中的可靠性不确定。在这里,我们通过比较五个 LLM(o3、DeepSeek-R1、GPT-4-Turbo、Llama-3.1-405B-Instruct 和 BioMistral-7B)的英语和法语表现,评估提示语言对诊断推理和最终诊断准确性的影响。两名医生使用 18 分制量表对涵盖 16 个医学专业的总共 180 个临床案例进行了评估,评估诊断准确性和推理质量。五个模型中有四个在英语方面表现较好(平均差 0.37-0.91,调整后 p < 0.05),差距跨越推理的多个方面,包括鉴别诊断、逻辑结构和内部效度。 o3 是唯一没有表现出整体语言效果的模型。这些发现表明,提示语言仍然是 LLM 临床表现的关键决定因素,对全球公平的语言文化部署具有影响。