论文

通过提炼视觉基础模型快速部署设备上眼球追踪

Rapidly deploying on-device eye tracking by distilling visual foundation models

摘要

眼动追踪 (ET) 在增强现实和虚拟现实应用中发挥着至关重要的作用。然而,为新产品快速部署高精度设备上注视估计仍然具有挑战性,因为硬件配置(例如相机放置、相机姿势和照明)通常会随着设备代次的变化而变化。视觉基础模型(VFM)在自然图像基准方面表现出色,并为快速训练和部署提供了一条有希望的途径;然而,我们发现现成的 VFM 仍然难以在专门的近眼红外图像上达到高精度。为了弥补这一差距,我们引入了 DistillGaze,这是一个使用标记的合成数据和未标记的真实数据提取 VFM 的框架,以实现快速、高精度的设备上注视估计。 DistillGaze 分两个阶段进行。首先,我们使用合成注视标签和未标记的真实图像将 VFM 改编为领域专业教师。合成数据提供可扩展的、高质量的注视监督,而未标记的真实数据则弥合了合成与真实领域的差距。其次,我们通过教师指导和自我训练来训练设备上的学生。在涵盖 2,000 多名参与者的大规模众包数据集上进行评估后,DistillGaze 相对于纯合成基线,将中位注视误差降低了 58.6%,同时保持了适合实时设备部署的轻量级 256K 参数模型。更广泛地说,DistillGaze 提供了训练和部署适应硬件变化的 ET 模型的有效途径,以及在设备回归任务中将综合监督与未标记的真实数据相结合的方法。