论文

FoundYou:个性化细分和检索的统一模型

FoundYou: A Unified Model for Personalized Segmentation and Retrieval

应用与实践视觉感知与空间理解

摘要

个性化分割和个性化检索都旨在跨不同图像识别相同的物理对象。前者将对象定位在目标图像中,而后者则检索对象出现的位置的图像。尽管存在共享的实例级目标,但这两项任务在很大程度上是分开发展的,并通过不同的解决方案来解决。在这项工作中,我们介绍了 FoundYou,这是一个基于对 Segment Anything 2 (SAM 2) 的观察而构建的统一框架,经过训练可以跨视频帧保留对象身份,本质上捕获实例级线索。我们利用此属性来匹配独立图像中的对象,从而使分割和检索成为同一实例对齐过程的两个结果。这种统一的视图解锁了超越传统基准的新功能,包括少量的个性化检索和具有灵活提示的及时个性化分割。大量实验表明,与统一和特定于任务的方法相比,获得了一致的收益,包括 PerMIS 上的 +18.4 mIoU 和 ILIAS 上的 +17.8 mAP。性能随着额外的参考而扩展,并且对于较弱的提示仍然保持稳健。除了个性化之外,FoundYou还在类别级检索基准上取得了最先进的结果。值得注意的是,我们的方法使 SAM 2-small 模型完全冻结,仅添加 5.9 M 可训练参数,产生 52 M 参数模型,其速度比之前唯一的统一解决方案快 75 倍,小 20 倍。代码可在 https://github.com/ga1i13o/FoundYou 获取。