论文

从像素到隐私:通过词元修剪实现时间一致的视频匿名化以实现隐私保护动作识别

From Pixels to Privacy: Temporally Consistent Video Anonymization via Token Pruning for Privacy Preserving Action Recognition

AI 基础设施AI安全与内容治理基础设施

摘要

大规模视频模型的最新进展显着提高了监控、医疗保健和娱乐等领域的视频理解。然而,这些模型也通过对敏感属性(包括面部身份、种族和性别)进行编码,放大了隐私风险。虽然图像匿名化已被广泛研究,但视频匿名化仍然相对未得到充分研究,尽管现代视频模型可以利用时空运动模式作为生物识别标识符。为了应对这一挑战,我们提出了一种基于实用性和隐私特征的系统解开的新颖的注意力驱动的时空视频匿名化框架。我们的主要见解是,Vision Transformer (ViTs) 中的注意力机制可以明确构建,以将与操作相关的信息与隐私敏感内容分开。基于这一见解,我们引入了两个特定于任务的分类词元,一个动作 CLS 词元和一个隐私 CLS 词元,它们在共享 Transformer 主干中学习互补表示。我们对比它们的注意力分布,以计算每个时空 tubelet 的实用隐私分数,并保留分数最高的 top-k tubelet。这选择性地修剪了以隐私线索为主的小管,同时保留了对动作识别最关键的小管。大量的实验表明,我们的方法保持了与原始视频训练的模型相当的动作识别性能,同时大大减少了隐私泄露。这些结果表明,注意力驱动的时空修剪为隐私保护视频分析提供了有效且有原则的解决方案。