论文

GKDT:通用关键点检测 Transformer

GKDT: General Keypoint Detection Transformer

应用与实践视觉感知与空间理解

摘要

随着各种预训练视觉和语言模型的出现,计算机视觉正在从窄域识别转向开放域识别。构建更强大且通用的关键点检测(GKD)模型来支持不同的任务在该领域变得越来越重要。为此,我们首先提出了一个名为 MegaKPT 的大规模统一关键点数据集。该数据集由来自 29 个现有数据集的超过 130 万个不同的对象实例组成,并具有高质量的统一注释和关键点文本描述。基于MegaKPT,我们开发了GKDT,一个简单、灵活且强大的基于DINOv3的Transformer模型,用于通用关键点检测。我们的 GKDT 支持视觉提示、文本提示或两者。为了增强 模型训练,我们还提出了一套有用的策略,例如混合模式提示训练和动态重要性采样。通过使用可见或不可见物体测试超过 22 个测试集,我们的单一 GKDT 模型在检测广泛类别的关键点方面显示出强大的性能和通用性,大多数类别的准确率超过 90% PCK@0.1,为现实问题提供了很高的实际适用性。数据集、模型和代码将在 https://github.com/AlanLuSun/General-Keypoint-Detection 发布。