论文

揭示多模态知识编辑中的实体身份混乱

Uncovering Entity Identity Confusion in Multimodal Knowledge Editing

模型训练模型编辑与遗忘

摘要

多模态知识编辑(MKE)旨在纠正部署后大型视觉语言模型的内部知识,但编辑后模型的行为模式仍未得到充分探索。在本文中,我们确定了编辑模型中的系统性故障模式,称为实体身份混乱(EIC):编辑模型表现出荒谬的行为,其中有关原始实体身份的纯文本查询意外返回有关新实体的信息。为了严格研究 EIC,我们构建了 EC-Bench,这是一个诊断基准,可直接探测编辑前后图像-实体绑定如何变化。我们的分析表明,EIC 源于现有方法无法区分模型中的图像-实体 (I-E) 绑定和实体-实体 (E-E) 关系知识,导致模型过度拟合 E-E 关联作为捷径:图像仍然被视为原始实体,新实体的名称仅充当虚假身份标签。我们进一步探索了潜在的缓解策略,表明对模型的 I-E 处理阶段的限制编辑会鼓励编辑更忠实地对 I-E 绑定进行操作,从而大大减少 EIC。基于这些发现,我们讨论了忠实 MKE 的原则性需求,并为未来的研究提供方法指导。