论文

Human-JEPA:一种以人为中心的感知和预测视觉模型

Human-JEPA: A Human-Centric Vision Model that Perceives and Anticipates

模型训练预训练

摘要

理解人类的机器应该感知现在并预测未来。现有的以人为中心的视觉模型是在人类图像上进行预训练的,在静态密集感知中设置了最先进的技术,因此运动和预期是遥不可及的。在这里,我们提出了 Human-JEPA,一种通过锚定预测在视频上训练的以人为中心的视觉模型:密集目标被固定在初始化的冻结副本上,防止密集感知的无声崩溃,块掩模被纯粹的过去到未来的分割所取代,避免了五点行动税和十七点重新识别崩溃。在冻结探针下,Human-JEPA 在姿态和人物重新识别方面领先于像素锚定专家,参数减少了 2.7 倍,承认高分辨率密集解析,并且其发布的预测器头是第一个不会降低预期的头。因此,一个安全适应的模型可以服务于理解人类的两部分。