论文
CogCanvas:评估基于多主体参考的图像生成的基准
CogCanvas: A Benchmark for Evaluating Multi-Subject Reference-Based Image Generation
摘要
基于多主体参考的图像生成需要共同保留多个人类身份,绑定每个人的对象和时尚物品,并尊重指定的背景场景,而当前的扩散模型仍然脆弱。现有的基准一次仅评估一个轴,没有一个基准可以联合捕获具有人与物体交互、背景基础和空间合理性的多身份组合。我们引入了 CogCanvas,这是一个由 1,952 个精选参考图像组成的基准,涵盖 100 个名人身份、115 个独特的物体和时尚物品,以及 29 个包括地标在内的现实世界背景场景,从中我们构建了 1,361 个涵盖 2-5 人团体规模的构图提示。管理管道结合了基于 DINOv2 的重复数据删除、两阶段美学过滤以及用作 真值 监督的结构化交互和位置图的自动推导。 CogCanvas 在统一的六轴评估协议下支持三种任务:基于参考的多人体对象生成(初级)、文本到图像合成生成和参考检索。我们引入了两个针对多参考设置量身定制的指标:BG-Sim,它通过 DINOv3 特征相似性对 SAM 3 屏蔽区域的背景保真度进行评分;Attr-VQA,它使用多模态 LLM 来验证每个主题的属性绑定和针对结构化图的人际交互。对五种 SOTA 方法进行基准测试表明,随着小组规模从 2 人增加到 5 人,每个模型都会大幅退化,超过 3 个受试者的物体/时尚绑定几乎完全失败。