论文
IMUG-Bench:统一多模态模型在交错理解与生成上的基准
IMUG-Bench: Benchmarking Unified Multimodal Models on Interleaved Understanding and Generation
摘要
近年来,统一多模态模型(UMM)的出现,支持在单一框架内进行理解和生成。掌握动态、多轮交错的图像文本对话是 UMM 在实际应用中的一项关键任务。然而,现有的基准测试无法评估这项重要任务,因为它们通常仅限于单轮或静态设置,并且通常忽略多轮交互中的暴露偏差。为了弥补这一差距,我们提出了 IMUG-Bench,这是一个用于 UMM 多轮交错图像文本对话的综合基准,可共同评估它们的理解和生成能力。我们的 IMUG-Bench 包括三个类别:静态空间、时间因果和混合,涵盖 3,113 个样本和 12,034 个交互回合。它还包括动态理解问题,从而支持更好地反映现实世界多轮交互场景的评估。 IMUG-Bench上的大规模实验系统地评估了主流开源和闭源UMM,揭示了它们的能力边界和故障模式,并揭示了多轮交互中生成侧明显的暴露偏差。我们进一步探索了几种测试时间扩展策略,包括思想链、自我验证和 Best-of-N 采样,这些策略可以有效提高生成精度并减轻生成任务中的暴露偏差。这些发现为增强未来 UMM 的鲁棒性和多轮交互能力提供了见解。
