论文
当正确的决策隐藏内部压力时:多模态语言模型中的决策状态探测
When Correct Decisions Hide Internal Stress: Decision-State Probing in Multimodal Language Models
摘要
多模态语言模型通常通过外部行为进行评估:选择正确的图像-文本匹配、拒绝不支持的标题或正确回答视觉查询。然而,仅正确的行为并不能表明模型的内部决策状态在受控语义压力下保持稳定。我们通过 S$^3$E(结构化语义压力评估)来研究这一差距,这是一个用于分析多模态语言模型中行为内部解耦的框架。 S$^3$E 使用正锚定 A/B 强制选择设置,其中图像支持的标题与原始选项顺序和交换选项顺序下的语义重音候选进行对比,而隐藏状态在预回答决策状态下提取。我们专注于严格正确的试验,其中模型在两个订单中始终选择正确的标题。我们没有将任意隐藏状态变化视为不稳定的证据,而是衡量语义冲突候选者是否会导致相对于意义保留控制的过度决策状态位移。在 Qwen3VL、Gemma3 和 InternVL3 中,尽管有正确的强制选择行为,语义重音始终会产生相对于词汇控制的正选择层过度位移,而与随机负数的比较则依赖于模型。我们将其解释为范围决策状态压力敏感信号,而不是下游失败或幻觉的证据。我们的结果表明,仅强制选择正确性并不足以证明内部决策几何不变。