论文
放射学视觉语言模型基准的法医再现性审核:从预期协议到发布的工件
Forensic Reproducibility Audit of a Radiology Vision-Language Model Benchmark: From Intended Protocol to Released Artifact
摘要
医学成像 AI 基准测试结合了数据集、DICOM 渲染、提示、提供商 API、自动化标签、统计代码、手稿和存储库版本。这些工件之间的一致性通常是假设的,而不是经过测试的。我们对保存的胸片视觉语言模型(VLM)飞行员进行了回顾性法医再现性审核;没有再次调用模型,也没有新注释图像或报告。我们跟踪了提示绑定、DICOM 元数据、输出完整性、标签提取、匹配分析和发布传播。在 300 次计划的模型提示调用中,有 297 次生成了非空报告。使用相同的 C 提示符执行了标记为 A/B 的 60 个 Claude 调用。这 30 项研究代表了 28 名患者。渲染四张 MONOCHROME1 图像时不需要极性反转,未保留数据集分割成员资格,并且未经验证的提取器将五份报告截断为 4000 个字符。重建一个由 369 个完整病例发现块组成的共同队列将 Cochran 的 Q 从 154.73 更改为 182.29。在 45 个 McNemar 比较中,27 个未经调整 p < 0.05,20 个在 Holm 调整后仍低于 0.05。这些值仅描述存档的自动标签矩阵;它们无法恢复预期的即时比较或建立临床表现。我们撤回了原始性能、排名、提示效果和临床声明,并为队列、DICOM 渲染、提示和模型标识、调用状态、注释来源、键控分析和派生工件指定了机器可验证的控制。