论文
预测熵作为医学视觉语言模型中错误和释义不稳定性的联合筛选
Predictive Entropy as a Joint Screen for Error and Paraphrase Instability in Medical Vision-Language Models
摘要
医学视觉语言模型(VLM)在回答胸片上的二元存在问题时可能会以两种相互关联的方式失败:它们肯定是错误的,并且当临床上等效的问题被改写时,它们会改变答案。在二进制答案头中,两个失败都跟踪相同的 logits 裕度,因此我们测试一个分数对两者的筛选效果如何。在 MedGemma-4B-IT 上,跨 MIMIC-CXR(分布内,n = 196)和 PadChest(分布外,n = 861),单遍预测熵预测是/否答案在改写下翻转,PadChest 上的接收者操作特征曲线 (AUROC) 下的面积 (AUROC) 为 0.823,MIMIC 上为 0.821,并且信号在五个随机种子中保持稳定(0.828$\pm$0.021)。相同的信号在 LLaVA-RAD-7B (AUROC 0.83) 上复制,并且对于翻转定义不变(所有重写、保留运算符或排除否定重写),因此屏幕在推理时不需要语义过滤器。一个低熵阈值会导致错误率和翻转率一起下降(80% 覆盖率时为 3.3% 和 5.7%),并且阈值选择会转移到保留分割。在跨站点转移下,我们测试的更昂贵的方法没有增加任何实用性:在 5% 的风险目标下,单个前向传递回答了 88.5% 的情况,与蒙特卡罗 (MC) Dropout 相匹配,并且在错误检测上击败了均匀平均的五种子适配器集合 0.111 AUROC。即使准确率达到 91% 的模型在重新措辞时仍有 13% 的项目自相矛盾,并且一次前向传递即可标记这些项目。