论文
MGDT:MLLM 引导扩散 Transformer 与关系自适应专家混合,用于多模态知识图补全
MGDT: MLLM-Guided Diffusion Transformer with Relation-Adaptive Mixture-of-Experts for Multimodal Knowledge Graph Completion
摘要
多模态知识图补全 (MKGC) 需要从结构、文本和视觉线索中推断缺失的实体。现有的基于扩散的 MKGC 方法通常直接对原始多模态特征进行降噪。这种设计迫使降噪器同时执行关系相关的线索选择、跨模态语义对齐和结构感知实体生成,这会引入噪声和语义不一致的扩散条件,从而导致完成性能不佳。为了解决这个限制,我们提出了 MGDT:带有关系自适应专家混合 (MGDT) 的 MLLM 引导扩散 Transformer,这是一种基于对齐然后扩散范式构建的新型 MKGC 框架。 MGDT 首先采用关系自适应语义路由专家混合 (RASR-MoE) 模块来选择关系相关的多模态语义转换路径并抑制不相关的模态干扰。然后,MGDT 使用冻结的多模态 大语言模型 (MLLM) 作为语义锚,将路由的多模态表示对齐到统一的潜在空间并减少跨模态语义异质性。最后,知识图扩散 Transformer (KGDT) 在对齐空间中执行图条件去噪生成,以生成缺失的实体表示。对三个基准数据集的实验表明,MGDT 始终优于强基线。