论文
超越原子布局:通过视觉语言模型理解组合设计
Beyond Atomic Layouts: Compositional Design Understanding with Vision-Language Models
摘要
布局理解或元素组织的解释对于文档分析、用户界面 (UI) 创建和图形设计至关重要。虽然最近的视觉语言模型(VLM)擅长解释由独立元素组成的原子布局,但它们在组合布局方面遇到了困难,因为组合布局需要对分层多层结构中的视觉纠缠元素进行推理。在本文中,我们介绍了一项新任务,即组合布局理解,并提出了 CoDeLayout,这是一个包含约 2 万个真实世界多层布局的 VQA 数据集,并用组合元素对和设计意图进行了注释。通过对 CoDeLayout 的实证分析,我们确定了现有 VLM 的两个关键挑战:文本元数据和视觉内容之间的语义漂移,以及分层元素间关系中的结构模糊性。为了应对这些挑战,我们提出了 MASON,一种集成了多模态对齐(MA)和结构感知(SP)的 后训练 范式。 MA 通过将元数据定义的元素基于其视觉对应元素来增强元素解释,减轻语义漂移,而 SP 则对分层感知的元素间空间关系进行建模,以提高层次理解并减少结构模糊性。实验揭示了现有 VLM 的巨大差距:即使是最强的基线 GPT-o3,也只能达到 79.68% 的准确率,而带有 MASON 的 Qwen2.5-VL 7B 则达到 91.66%。值得注意的是,MASON 仅使用 30% 的训练数据就超越了全数据 Direct Finetune,并且通过附加数据可以更好地扩展。