论文

用于消除大型视觉语言模型中的虚假相关性的分区感知取消学习

Partition-Aware Unlearning for Removing Spurious Correlations in Large Vision-Language Models

模型训练模型编辑与遗忘

摘要

大型视觉语言模型 (LVLM) 在许多多模式任务中实现了出色的性能;然而,他们经常利用虚假的对象-背景相关性,导致预测由上下文快捷方式驱动,而不是由与对象相关的视觉证据驱动。尽管人们对幻觉和鲁棒性评估越来越感兴趣,但现有基准对模型预测是基于目标对象还是由相关背景线索引起的控制提供有限的控制。在这项工作中,我们介绍了 PURGE(\underline{P}artition-aware \underline{U}nlearning for \underline{R}emoving spurious-correlation \underline{G}enerated \underline{E}rrors),这是一个用于在 LVLM 中构建、基准测试和减轻杂散相关引起的故障的框架。该框架包括: -- (1) 结构化数据集构建,其中我们开发了三种互补的结构化数据构建策略,通过对象相关证据和虚假背景线索对示例进行划分,从而实现捷径依赖的受控诊断; - (2) 分区感知取消学习,它使用这些分区有选择地删除虚假的对象-背景关联,同时保留基于对象的推理。我们在多种基准测试(包括 CHAIR、POPE、Causal-HalBench、MM-SpuBench、AMBER、MMHal 和 Waterbirds)上评估了跨多个 LVLM(包括 LLaVA-1.6-7B、Qwen3-VL-8B-Instruct 和 Qwen3.5-9B)的算法框架,以及作为视觉语言编码器的 CLIP。我们的结果表明,PURGE 持续减少幻觉和杂散相关驱动的错误,同时在大多数评估设置中保持或提高整体性能,为更可靠的 LVLM 提供可重复使用的评估协议和有效的缓解框架。