论文
Fursee:用于 Fursuit 身份检索和聚类的混合 YOLO-DINOv3 框架
Fursee: Hybrid YOLO-DINOv3 Framework for Fursuit Identity Retrieval and Clustering
摘要
全球兽装大会产生了大量兽装照片,而手动分类带来了沉重的劳动力成本,并需要自动身份检索和聚类解决方案。一般的多模态模型缺乏针对复杂兽装场景的专门优化,并且不存在用于此任务的公共基准数据集。为了填补这一空白,我们构建了一个专门的兽装图像数据集,并提出了一个用于兽装身份检索和聚类的三阶段混合管道 Fursee。首先,YOLO 检测并裁剪高分辨率兽装头部补丁,以改善小型和重叠目标的定位。其次,ArcFace 优化了 DINOv3 嵌入,以扩大特征超球面上不同身份之间的角度间隔。第三,DBSCAN 执行无监督聚类,轮廓系数驱动的搜索自动选择最佳超参数,而不是固定的手动半径。检索和聚类实验验证,我们的管道在所有评估指标上均优于主流多模态模型,包括 GPT5.5、Claude Opus 4.8 和 Qwen3.7-Plus,在兽装头部检索和分组方面实现了有竞争力的性能。