论文

iTRIALSPACE:用于肺部 CT 模型受控评估的可编程虚拟病变试验

iTRIALSPACE: Programmable Virtual Lesion Trials for Controlled Evaluation of Lung CT Models

模型评测基准与评测资源

摘要

我们推出 iTRIALSPACE,这是一种用于肺部 CT 模型受控评估的可编程评估框架。标准基准是静态回顾性集合,涉及病变大小、肺叶患病率、解剖结构和采集背景,因此很难确定驱动模型准确性的结构因素。 iTRIALSPACE 通过四阶段流程将真实的临床 CT 和病变概况组合成受控虚拟病变试验,从而解决了这一限制:多数据集结节分析、明确的试验规范、解剖感知掩模插入和 ControlNet 条件 CT 合成。该框架建立在统一的 54 属性结节剖面数据集之上,涵盖来自 7 个公共 CT 源的 13,140 个带注释的结节,并实例化为 13 种试验模式。我们在一项包含 55,469 个样本的虚拟病变研究中评估 iTRIALSPACE,该研究涵盖三个医学 VLM、四个空间指导条件和三个临床任务。在所有 13 种模式中,合成底物保持在真实到真实 FID 基线内,并且合成性能排名强烈转移到真实临床数据($ρ$ = 0.93,p < 10$^{-15}$)。受控试验模式揭示了固定分布基准无法获得的结果,包括波瓣均衡采样下快捷驱动的大小预测崩溃以及双交叉分析中宿主与供体方差比为 8.9 倍和 3.3 倍。这些结果将 iTRIALSPACE 定位为可审计的评估基础设施,用于超越静态回顾性基准的受控、可证伪测试。