论文

CSEval:评估文本到图像生成临床语义的框架

CSEval: A Framework for Evaluating Clinical Semantics in Text-to-Image Generation

模型评测评测方法与指标

摘要

文本到图像生成正日益被应用于医疗领域的多种用途,如数据增强和教育。评估这些生成图像的质量与临床可靠性至关重要。然而,现有方法主要评估图像的真实感或多样性,未能捕捉生成图像是否反映预期的临床语义,如解剖部位和病理。在本研究中,我们提出Clinical Semantics Evaluator(CSEval),一个利用语言模型评估生成图像与其条件提示之间临床语义对齐的框架。我们的实验显示,CSEval能识别其他指标所忽视的语义不一致,并与专家判断相关。CSEval为现有评估方法提供了可扩展且具临床意义的补充,支持生成式模型在医疗保健中的安全采用。

CSEval:评估文本到图像生成临床语义的框架
图1:我们提出的用于评估文本到图像生成中临床语义的框架。用户自定义的提示引导合成医学图像的生成。然后,一个预训练的报告生成模型为这些合成图像生成 findings(影像所见)。所选指标(RadGraph–F1 score)衡量标准答案与合成的实体—关系图在文本空间中的重叠程度,定量反映合成图像对原始提示中所述临床细节的遵循准确程度。