论文

FearCaut-Qwen:视觉语言模型中的情感引导改变了危险评估的决策标准

FearCaut-Qwen: Affective Steering in a Vision-Language Model Shifts the Decision Criterion for Hazard Assessment

模型评测模型推理应用与实践判别式推理与决策模型行为与机制分析行业应用

摘要

视觉语言模型(VLM)在灾难后评估损失方面显示出巨大的潜力,但一个反复出现的缺陷是它们不愿意宣布危险;也就是说,即使总体准确度看起来足够,召回率也很低。本研究通过使用信号检测理论将决策行为分解为感知能力和决策标准放置来检验这一缺陷。然后,受恐惧使人类厌恶风险这一发现的启发,我们提出了一种纠正过度保守决策政策的新方法,并询问是否可以因果地操纵与恐惧相关的情感表征,以类似地改变 VLM 的决策倾向。利用机械可解释性,我们定位模型中因果关联的情感回路,并使用激活控制来操纵它,同时观察对下游预测的影响。 The method is tested on a two-stage SeisMLLM pipeline built on Qwen2.5-VL-7B-Instruct, which flags only 27.0% of genuinely unsafe buildings on the SeisMLLM-1K test split and never issues a false Red, an SDT criterion 尽管有足够的证据质量 (d' = 1.521),但 c = +1.354。情感方向定位在情感丰富的自然场景上,通过稀疏神经元敲除和对保留的情感数据的分布式转向进行因果验证,然后注入到构建任务中。恐惧方向注入将红色召回率提高到 75.7% (p<0.001),减去相同方向会完全抑制红色预测,而规范匹配的随机方向和匹配的幸福方向则没有显着影响。该机制是标准的转变(c=-1.515),而歧视没有改善(d'=-0.493)。这些结果表明,VLM 决策可以在推理时进行调整,而无需重新训练,并演示了如何使用机械可解释性来诊断和控制工程应用中的 VLM 决策行为。