论文
超越文本衡量关键要素:以质量、对齐与多样性评估多模态摘要
Measuring What Matters Beyond Text: Evaluating Multimodal Summaries by Quality, Alignment, and Diversity
摘要
多模态大语言模型(MLLM)推动了多模态输出多模态摘要(MSMO)的发展,即系统从多模态来源生成简洁的文本摘要并配以突出的视觉内容。然而,当前的MSMO评估仍然碎片化:文本质量、图文对齐和视觉多样性通常用单模态指标孤立评估,难以捕捉各模态是否共同支撑了一个忠实且有用的摘要。为填补这一空白,我们提出MM-Eval,一个整合文本质量、跨模态对齐和视觉多样性评估的统一评估框架。MM-Eval包含三个组件:(1) 文本质量,用OpenFActScore衡量事实一致性,用G-Eval衡量连贯性、流畅性和相关性;(2) 图文相关性,通过MLLM作为评审的方式评估;(3) 图像集多样性,用Truncated CLIP Entropy量化。我们通过在mLLM-EVAL新闻基准上训练的学习型聚合模型来校准MM-Eval,使各组件的贡献与人类偏好对齐。我们的分析揭示了该场景下的文本主导层级:事实一致性是感知整体质量的关键决定因素,而视觉相关性和多样性提供补充信号。MM-Eval优于启发式聚合基线,并为多模态摘要的比较评估提供了一个可解释、弱依赖参考的框架。
