论文
TaxaAdapter:视觉分类模型是生命树上细粒度图像生成的关键
TaxaAdapter: Vision Taxonomy Models are Key to Fine-grained Image Generation over the Tree of Life
摘要
准确地生成生命之树的图像非常困难:地球上有超过 1000 万种不同的物种,其中许多物种的区别仅在于细微的视觉特征。尽管在文本到图像合成方面取得了显着进展,但现有模型通常无法捕获定义物种身份的细粒度视觉线索,即使它们的输出看起来非常逼真。为此,我们提出了 TaxaAdapter,这是一种简单而轻量级的方法,它结合了 BioCLIP 等视觉分类模型(VTM)来指导细粒度物种的生成。我们的方法将 VTM 嵌入注入到冻结的文本到图像扩散模型中,提高物种级别的保真度,同时保留对姿势、风格和背景等属性的灵活文本控制。大量实验表明,TaxaAdapter 凭借更清晰的架构和训练配方,在强基线上持续提高了形态保真度和物种识别准确性。为了更好地评估这些改进,我们还引入了基于多模态 大语言模型 的度量,该度量总结了生成图像和真实图像的特征级描述,提供了更可解释的形态一致性度量。除此之外,我们观察到 TaxaAdapter 表现出强大的泛化能力,能够在具有挑战性的情况下进行物种合成,例如只有少数训练图像的少数物种,甚至在训练期间看不见的物种。总的来说,我们的结果强调了 VTM 是可扩展、细粒度物种生成的关键要素。