论文

位置,而不是出处:将医学视觉语言模型中的推理中介与阿谀奉承分开

Position, Not Provenance: Separating Reasoning Mediation from Sycophancy in Medical Vision-Language Models

模型评测模型行为与机制分析

摘要

医学视觉语言模型 (VLM) 在回答临床问题之前生成思维链 (CoT) 推理,但这种推理是否会因果影响预测仍不清楚。我们提出了 CoT-Mediate,一种行为框架,它扰乱模型自身生成的推理中的单个临床有意义的属性,并测量结果预测是否遵循编辑后的推理。我们的框架结合了双臂协议,将重新提示的证据与前缀强制延续进行比较,以及出处控制的干预,该干预仅改变相同推理的归因来源,以将推理调解与阿谀奉承分离开来。我们分别在 1,000 个 VQA-RAD 样本上评估 LLaVA-Med 和 MedGemma。前缀强制延续始终比重新提示产生更高的中介 忠实性,而来源分析揭示了不同的特定于模型的遵从行为。在这两种模型中,删除视觉证据会增加对注入推理的依赖,而偏侧性是最不忠实跟踪的临床属性。这些结果表明,用于注入推理的机制会显着影响测量的 忠实性,并且上下文位置(而不是声明的出处)是医学 VLM 是否使用其生成的推理的主要决定因素。