论文
配对时正确,分割时错误:解耦和编辑 MLLM 中的模态特定神经元
Correct When Paired, Wrong When Split: Decoupling and Editing Modality-Specific Neurons in MLLMs
摘要
尽管知识编辑提供了一种更新多模态 大语言模型 (MLLM) 知识的有效机制,但我们发现当前范式仍然面临一个重要但仍未得到充分研究的问题:编辑解耦失败,当模型被多模态输入(文本-图像查询对)触发时,可以更新实体相关的知识,然而,当成对输入被拆分为单模态输入时,它通常会恢复为过时的预编辑事实。我们深入的实证分析表明,MLLM 中的实体知识并不是以统一的表示形式存储的,而是分布在解开的特定模态路径中。因此,偏向于多模态查询的更新无法有效地传播到单模态电路。为了弥补这一差距,我们提出了 DECODE,它明确地解开并定位特定于模态的神经元组以获得目标知识。大量实验表明,DECODE 在不同模态触发下始终如一地实现有效的知识更新,从而减轻编辑解耦失败。