论文
通过跨模态Transformer与门控注意力迈向视觉依据对齐的多模态摘要
Towards Visually Grounded Multimodal Summarization via Cross-Modal Transformer and Gated Attention
摘要
多模态摘要要求模型联合理解文本与视觉输入,以生成简洁且语义连贯的摘要。现有方法常常将浅层视觉特征注入深层语言模型,导致表示失配和跨模态接地薄弱。我们提出一个统一框架,联合执行文本摘要与代表性图像选择。我们的系统SPeCTrA-Sum(Sampler Perceiver with Cross-modal Transformer and gated Attention for Summarization)引入两项关键创新。第一,深度视觉处理器(DVP)将视觉编码器与语言模型在对应深度上对齐,实现保持语义一致性的分层逐层融合。第二,轻量的视觉相关性预测器(VRP)通过从行列式点过程(DPP)教师蒸馏软标签来选择显著且多样的图像。SPeCTrA-Sum使用结合自回归摘要、跨模态对齐和基于DPP蒸馏的多目标损失进行训练。实验表明,我们的系统生成了更准确、更贴合视觉的摘要,并选择了更具代表性的图像,证明了深度感知融合与有原则的图像选择对多模态摘要的益处。
