论文
支架效应:快速框架如何推动临床 VLM 评估中明显的多模态收益
The Scaffold Effect: How Prompt Framing Drives Apparent Multimodal Gains in Clinical VLM Evaluation
摘要
值得信赖的临床人工智能要求性能提升反映真实的证据整合,而不是表面的伪影。我们评估了两个临床神经影像队列 \textsc{FOR2107} (情感障碍)和 \textsc{OASIS-3} (认知衰退)的二元分类的 12 个开放权重视觉语言模型(VLM)。这两个数据集都带有结构 MRI 数据,不携带可靠的个体级诊断信号。在这些条件下,较小的 VLM 在引入神经影像背景后表现出高达 58% F1 的增益,而蒸馏模型与大一个数量级的同行相比具有竞争力。对比置信度分析表明,仅在任务提示中提及 MRI 可用性即可解释这种转变的 70-80%,而与是否存在成像数据无关,这是一种特定领域的模态崩溃实例,我们将其称为“支架效应”。专家评估揭示了在所有条件下都以神经影像为基础的合理性的捏造,并且偏好对齐,同时消除了 MRI 参考行为,将两种条件折叠到随机基线。我们的研究结果表明,表面评估不足以作为多模态推理的指标,这对 VLM 在临床环境中的部署具有直接影响。
