论文

面向在线递归MLLM编辑的多模态知识编辑范围泛化

Multimodal Knowledge Edit-Scoped Generalization for Online Recursive MLLM Editing

模型训练模型编辑与遗忘

摘要

在线多模态知识编辑要求向多模态大语言模型(MLLM)注入持续的视觉-文本修正流——开销有界且对无关行为扰动最小。既有编辑器主要强调编辑可靠性与长程稳定性——但很少控制每次编辑的语义边界。我们对编辑后行为与内部神经元活动的先导分析揭示可靠编辑背后的范围缺口:实例级成功既不保证迁移到有效的跨模态变体、也不阻止泄漏到无关输入——而编辑相关的跨模态响应集中在更深的语义层。因此,我们形式化编辑范围泛化(Edit-Scoped Generalization)——将在线MLLM编辑从仅纠正实例重新框定为控制每次编辑的传播边界。为此,我们提出ScopeEdit——范围感知的在线编辑器:将每次更新分解为模态局部吸收分支与证据门控的共享泛化分支。局部分支支持稳定编辑吸收——共享分支仅在视觉与文本证据充分对齐时启用跨模态传播。两分支在正交低秩空间执行范围分离的写入几何——经Sherman-Morrison递归维护分支预条件器——产生每编辑常数开销。跨多样基准、长程编辑流、MLLM骨干、真实VLKEB场景与复杂视觉-语言架构的大量实验表明:ScopeEdit持续改善范围内跨模态迁移与范围外局部性之间的权衡——同时保持编辑可靠性、稳定性与在线效率。代码见 https://github.com/lab-klc/ScopeEdit。

面向在线递归MLLM编辑的多模态知识编辑范围泛化:论文配图
图 2:在 LLaVA-v1.5 上使用 M-ORE,对编辑范围泛化及其在在线 MLLM 编辑中的分层出现进行试点分析。 (a) 具有配对图像和文本的示例编辑示例。 (b) 可靠的编辑仍然可能表现出概括不足、过度概括或纠缠失败。 (c) 与编辑相关的跨模式反应主要出现在更深的语言层中,其中文本和视觉证据变得更加同步。 V-F 节提供了有关其他 MLLM 架构的更多讨论。