论文

传闻:无需图像的视觉语言医学诊断

Hearsay: Vision-Language Medical Diagnoses Without an Image

模型评测模型行为与机制分析

摘要

当被要求描述从未附加过的医学图像时,前沿视觉语言模型不会放弃:他们捏造了一个诊断。我们证明这种虚构并不是随机的。它是根据患者的身份来构建的。在胸部 X 光、脑部 MRI 和皮肤科方面,Claude Opus-4.7、GPT-5.4 和 Gemini-3.1-Pro 均仅使用人口统计描述符而不是图像进行查询,并且更改描述符会系统地改变返回的诊断结果。克劳德高度集中注意力:一位 65 岁的白人询问皮肤痣,几乎每次回答都被诊断为黑色素瘤;一位 32 岁的黑人女性询问她的胸部 X 光检查结果,得到了结节病诊断,其推理是“根据人口统计学和经典模式,疑似”。GPT-5.4 的影响范围更广,遍及我们测试的每个人口统计细胞,最引人注目的是,在胸部 X 光检查中,年轻黑人患者被命名为结节病。两个结构性发现使问题变得更加尖锐,其中散文承认了缺失的图像,而结构化诊断领域却命名了一种疾病,当“皮肤痣”被替换为“皮肤病变”时,克劳德的皮肤病学效果完全崩溃,而 GPT-5.4 则被保留,这表明海市蜃楼是一系列不同的失败模式,而不是临床中值得信赖的 VLM 部署。 pipelines需要直接审计结构化输出通道,探测词敏感度应作为一级评估维度