论文

COMPASS:统一多模态模型中的构图意图引导锚定

COMPASS: Grounding Composition-Intent Guidance in Unified Multimodal Models

模型推理模型架构MoE解码与生成控制

摘要

构图是治理主体摆放与场景组织方式的高级视觉意图——但当前统一多模态模型在细粒度构图识别上仍不可靠——难以把此类意图转为可控生成。我们提出COMPASS——首个把构图意图控制锚定在横跨构图感知与构图引导生成的单一系统中的统一多模态框架——以共享专家token τ_c作为中心意图锚。感知侧——COMPASS以微创方式向MoE骨干注入构图专业知识——并把推断意图蒸馏进τ_c。生成侧——COMPASS复用τ_c作为引导去噪轨迹的全局条件信号——有效把被动构图分析转为显式布局控制。为支撑系统化的指令遵循构图学习与大规模评估——我们构建Comp-11——带11类分类法与推理增广标注的大规模数据集。大量实验表明COMPASS大幅改进类别级构图理解——并交付较强基线更构图一致、更贴提示的生成。

COMPASS:统一多模态模型中的构图意图引导接地:论文配图
图 1:所提出的 COMPASS 的性能:统一系统处理各种构图理解任务,并进一步使用参考图像作为布局意图来合成忠实于文本提示的新内容。