论文

范围:复杂图像生成的结构化分解和条件技能编排

SCOPE: Structured Decomposition and Conditional Skill Orchestration for Complex Image Generation

应用与实践内容创作

摘要

尽管文本到图像模型在视觉保真度方面取得了长足进步,但忠实地实现复杂的视觉意图仍然具有挑战性,因为必须在基础、生成和验证过程中跟踪许多需求。我们将这些要求称为语义承诺,并将其生命周期不连续性形式化为概念裂痕,其中承诺可以在本地解决或检查,但无法在整个生成生命周期中保持可识别为相同的操作单元。为了解决这个问题,我们提出了 SCOPE,一个规范引导的技能编排框架,它在不断发展的结构化规范中维护语义承诺,并有条件地围绕未解决或违反的承诺调用检索、推理和修复技能。为了评估承诺级意图实现,我们引入了 Gen-Arena(一种具有实体级和约束级规范的人工注释基准)以及实体门控意图通过率 (EGIP)(严格的实体优先通过标准)。 SCOPE 大幅优于 Gen-Arena 上的所有评估基线,达到 0.60 EGIP,并进一步在 WISE-V (0.907) 和 MindBench (0.61) 上取得强劲结果,证明了持续承诺跟踪对复杂图像生成的有效性。