论文

冻结视觉基础模型中的紧急区域级面部对应

Emergent Region-Level Facial Correspondence in Frozen Vision Foundation Models

模型评测模型行为与机制分析

摘要

冻结的自我监督视觉模型可以对齐通用物体的部分,但目前还不清楚这种对应关系是否扩展到人脸,其中全局布局是共享的,而特定于身份的外观差异很大。我们测试冻结的 DINOv3 特征是否定义了区域级面部坐标系:在该特征空间中,眼睛、眉毛、鼻子、嘴巴、皮肤和头发在不同人和不同时间之间保持可区分,无需进行特定于面部的训练。仅使用 DINOv3 ViT-L/16 补丁嵌入和 FaRL 作为面部部分标记接口,我们在 200 个 CelebDF-v2 真实视频上评估跨身份最近邻匹配和时间标签传播。与 23.0% 的区域加权随机基线相比,DINOv3 在无约束的交叉身份匹配下实现了 83.0% 的区域级语义准确度,并且在没有学习时间模块的情况下实现了 95.5% 的时间跟踪准确度。无 FaRL 控制下降至 0.9%,表明 FaRL 提供语义初始化,而 DINOv3 提供密集的空间对应。最强的对应关系出现在中间层:块 18 给出了 4.93 倍的同区域与跨区域辨别比,而最后块的为 1.48 倍。与 CLIP ViT-L/14 相比,DINOv3 仅显示出很小的总体优势,但在解剖区域上有 +16.8 pp 的增益,这表明图像级对比监督捕获了粗略的面部布局,但不能捕获细粒度的解剖特征。这些结果将冻结的 DINOv3 确立为区域级面部对应的强大零样本表示,并将中间自我监督特征识别为密集面部分析最有用的层。