论文
MMLDSum-LLM:结合视觉对齐与关键词感知的多模态长文档摘要
MMLDSum-LLM: Multimodal Long-Document Summarization with Visual-Alignment and Keyword-Aware
摘要
多模态长文档是专业知识的核心载体,其中关键证据稀疏地分布在段落与模态之间。这容易导致多模态LLM在摘要时出现关键信息遗漏和跨模态幻觉。这些问题源于长程依赖建模中的注意力漂移和模态间对齐的缺口。为解决这些问题,我们提出MMLDSum-Bench,一个面向多模态长文档摘要的高质量基准,覆盖多个领域、上下文长度规模和视觉-文本模态分布。我们进一步提出MMLDSum-LLM,一个可复现的两阶段训练框架,将有监督微调与视觉对齐加权损失和关键词感知加权损失相结合,随后进行带多目标奖励(关键词覆盖、图文对齐、ROUGE与长度控制)的GRPO。在MMLDSum-Bench上、在统一评测协议(包括LLM-as-a-judge评分、原子断言精确率/召回率、图文对齐ITA和ROUGE)下,与领先的闭源和开源多模态模型进行的广泛比较表明,我们的方法显著提升了关键信息覆盖与跨模态一致性。
