对LLM生成的胸部CT报告日文翻译的盲法放射科医师评估与基于LLM的评估:比较研究
Blinded Radiologist and LLM-Based Evaluation of LLM-Generated Japanese Translations of Chest CT Reports: Comparative Study
摘要
背景:放射学报告的准确翻译对多语言研究、临床交流和放射学教育十分重要,但基于LLM的评估的效度仍不清楚。目的:评估LLM生成的胸部CT报告日文翻译的教学适用性,并比较放射科医师评估与LLM-as-a-judge评估。方法:我们分析了来自CT-RATE-JPN验证集的150份胸部CT报告。对每份英文报告,将人工编辑的日文翻译与DeepSeek-V3.2生成的翻译进行比较。一名获得委员会认证的放射科医师和一名放射科住院医师独立开展盲法成对评估,涵盖4项标准:术语准确性、可读性、整体质量以及放射科医师风格的真实性。与此同时,3个LLM裁判(DeepSeek-V3.2、Mistral Large 3和GPT-5)评估了同样的成对样本。一致性采用QWK和一致率进行评估。结果:放射科医师与LLM裁判之间的一致性接近于零(QWK为-0.04至0.15)。两名放射科医师之间的一致性也很差(QWK为0.01至0.06)。放射科医师1在59%的病例中将术语评为相当,并在可读性(51%)和整体质量(51%)上更青睐LLM翻译。放射科医师2在75%的病例中将可读性评为相当,并在整体质量上更青睐人工编辑的翻译(40%对21%)。所有3个LLM裁判在全部标准上都强烈青睐LLM翻译(70%-99%),并在超过93%的病例中认为其更像放射科医师风格。结论:LLM生成的翻译常被评判为自然流畅,但两名放射科医师的判断差异明显。LLM-as-a-judge表现出对LLM输出的强烈偏好,与放射科医师的一致性可忽略不计。就翻译放射学报告的教学用途而言,仅依靠自动化的基于LLM的评估并不充分;专家放射科医师的审阅仍然重要。