论文
CT-FineBench:用于CT报告生成细粒度评估的诊断保真度基准
CT-FineBench: A Diagnostic Fidelity Benchmark for Fine-Grained Evaluation of CT Report Generation
摘要
由于文本量大、征象多样且复杂,以及存在细粒度、面向疾病的属性,生成报告的评估仍然是计算机断层扫描(CT)报告生成中的关键挑战。传统评估指标只提供词法重叠或实体匹配的粗略度量,无法反映临床应用所需的细粒度诊断准确性。为填补这一空白,我们提出CT-FineBench,一个基于CT-RATE和Merlin构建、用于评估CT报告细粒度事实一致性的基准。我们的基准通过一个严谨的、基于问答(Question-Answering,QA)的流程构建:首先,我们识别并结构化关键的、与征象相关的临床属性(如位置、大小、边缘)。其次,我们系统地把这些属性转化为一个QA数据集,其中问题用于探查以金标准报告为依据的具体临床细节。CT-FineBench的评估协议是使用该QA数据集查询机器生成的报告,并对答案的正确性打分。这使得全面、可解释且与临床相关的评估成为可能,超越表层的词法重叠,精确定位具体的临床错误。实验表明,CT-FineBench与专家临床评估的相关性更好,且相比既往指标对细粒度事实错误明显更敏感。
