论文
SAGE:使用视觉基础表示来发现和生成显着因素
SAGE: Salient Factor Discovery and Generation with Visual Foundation Representations
摘要
给定一个目标数据集(例如戴眼镜的面部)和一个背景数据集(例如不戴眼镜的面部),对比分析将特定于目标的 salient 因素与两者共享的 common 内容分开。我们的目标是捕获每幅图像中特定于目标的细节(例如眼镜的形状、颜色和位置)的显着表示,以便它们在没有子类型标签的情况下揭示子类型,并指导生成已发现的子类型的新示例,即使是没有名称或文本描述的子类型。我们引入了 SAGE,它直接在冻结表示自动编码器的高维空间潜变量中学习这两个因素,并根据学习到的参考图像的显着表示来调节扩散Transformer。在 Digits-ImageNet 和 FFHQ 眼镜上,SAGE 将高保真 reconstruction (rFID 低于 $2$)与无监督 subtype discovery 相结合,比基线更好地恢复数字(探测精度 $0.950$ vs.\ 最多 $0.281$),并揭示眼镜类型、更精细的太阳镜款式和错误标记的图像;显着条件 Generation 提高了 Digits-ImageNet 子类型相对于未分解潜在变量的准确度($90.5\%$ vs.\ $27.7\%$)以及两个数据集的多样性。在视网膜 OCT 上,SAGE 的显着空间仅使用正常/疾病标签来区分三种疾病。