论文
文本编辑可以推广到视觉生成吗? UMM 中跨模式知识编辑的基准测试
Do Text Edits Generalize to Visual Generation? Benchmarking Cross-Modal Knowledge Editing in UMMs
摘要
统一多模态模型(UMM)已成为通用多模态智能的有前途的范例。当它们部署在现实世界的应用程序中时,有效更新内部知识变得至关重要。虽然纯文本模型的知识编辑已经成熟,但成功修改文本输出的编辑是否也转移到 UMM 中的图像生成仍不清楚。为了研究这个问题,我们引入了 UniKE,这是 UMM 中跨模态知识编辑的第一个基准,包含 2,971 个跨越属性和关系编辑的编辑主题。使用基于 VQA 的视觉验证,我们揭示了显着的模态差距:文本侧功效可以达到约 92%,而直接图像生成下的最佳整体 VQA 准确度仅为 18.5%。我们进一步提出推理增强参数编辑,它在生成之前显式激活编辑的知识,并提高所有评估的模型编辑器对的整体 VQA 准确性,增益高达 18.6 个百分点。机制分析表明,这种差距与编辑的文本表示和视觉生成的调节路径之间的部分对齐有关,其中足以用于文本输出的编辑可能仍然太弱或未对齐,无法引导图像合成。这些发现表明,文本知识编辑不能保证可靠的跨模态传输并激发模态感知编辑方法。我们的代码和数据可在 https://github.com/gxx27/UniKE 获取。