论文
CAMEO:有条件且具有质量意识的多代理图像编辑编排器
CAMEO: A Conditional and Quality-Aware Multi-Agent Image Editing Orchestrator
摘要
条件图像编辑旨在根据文本提示和可选的参考指导修改源图像。这种编辑对于需要严格结构控制的场景(即驾驶场景中的异常插入和复杂的人体姿势变换)至关重要。尽管大规模编辑模型(即 Seedream、Nano Banana 等)最近取得了进展,但大多数方法都依赖于单步生成。这种范例通常缺乏明确的质量控制,可能会引入与原始图像的过度偏差,并且经常产生结构伪影或与环境不一致的修改,通常需要手动提示调整才能获得可接受的结果。我们提出 \textbf{CAMEO},一种结构化的多智能体框架,它将条件编辑重新表述为一种质量感知、反馈驱动的过程,而不是一次性生成任务。 CAMEO 将编辑分解为规划、结构化提示、假设生成和自适应参考基础的协调阶段,只有在任务复杂性需要时才会调用外部指导。为了克服现有方法中缺乏内在质量控制的问题,评估直接嵌入到编辑循环中。中间结果通过结构化反馈进行迭代完善,形成一个闭环流程,逐步纠正结构和上下文的不一致。我们在异常插入和人体姿势切换任务上评估 CAMEO。通过多个强大的编辑骨干和独立的评估模型,与多个最先进的模型相比,CAMEO 始终实现平均多出 20% 的胜率,展示了条件图像编辑中改进的鲁棒性、可控性和结构可靠性。