论文

Slop 悖论:综合标准化如何消除人工智能重写的放射学报告中的临床不确定性和跨模式对齐

The Slop Paradox: How Synthetic Standardization Erodes Clinical Uncertainty and Cross-Modal Alignment in AI-Rewritten Radiology Reports

模型评测模型行为与机制分析

摘要

AI 辅助临床文档工具越来越多地使用 大语言模型 (LLM) 来总结、标准化和重新格式化放射学报告。我们提出了对由此产生的信息退化的受控测量。使用印第安纳大学数据集中的 450 份胸部 X 射线报告,我们通过三个现实的 LLM 重写任务生成合成版本:EHR 总结、标准化重写和教学案例准备。我们测量实体侵蚀(通过医学 NER)、对冲崩溃(临床不确定性语言的丢失)和跨模式对齐退化(通过 BiomedCLIP 图像文本相似性)。我们的中心发现是信息丢失和跨模式保真度之间的分离。 EHR 摘要在内容层面最具破坏性,侵蚀了 51.4% 的临床实体和 43.7% 的对冲语言,但它几乎完全保留了图文对齐(下降了 2.5%)。这两项任务旨在生成更清晰的训练数据、标准化重写和教学案例准备,但效果恰恰相反:它们保留了更多实体(26.8% 和 29.3% 被侵蚀),但导致了 14.9-16.5% 的对齐下降,是 EHR 总结的六到七倍。我们将其称为“slop paradox”:重写使临床文本在多模态训练中看起来更清晰,这正是将其从图像中拉开的原因。与我们预先指定的假设相反,罕见的病理学并没有优先被降解:在九个罕见与常见的比较中,多重比较校正后没有差异,并且名义差异向相反的方向发展(常见>罕见),因此污染对于特定条件的监测是不可见的。退化的主要决定因素是人工智能重写任务的类型,而不是临床内容。这些发现对多模式医疗人工智能数据集的构建和人工智能辅助临床文档的治理具有重要意义。