论文
重新加权视频中的逐帧注意力 Transformer 用于面部表情理解
Reweighting Framewise Attention in Video Transformers for Facial Expression Understanding
摘要
了解视频中的面部表情需要在不受约束的条件下对微妙和局部的面部动态进行建模。尽管最近基于 Vision Transformer (ViT) 的视频模型通过大规模自监督预训练表现出了强大的性能,但它们的注意力机制通常强调主导的全局运动和粗略的时间动态,限制了对细粒度面部变化的敏感性。为了解决这个限制,我们提出了 MiRA(边缘引起的注意力重新分配),这是一种用于 ViT 主干的插件框架边缘注意力重新分配框架,它增强了对微妙面部动态的时空选择性,而无需引入额外的可训练参数。 MiRA 从自注意力图导出帧级置信度和帧内浓度统计数据,以估计帧方式的边际重要性并将注意力重新分配到时空局部面部线索。我们首先介绍一种基于 post-softmax 注意力重新分配的原则性精确模式。为了进一步提高效率,我们提出了 flashLite 模式,这是一种轻量级的 pre-softmax 近似,它将帧边缘重新分布集成到 FlashAttention 内核中,同时保留精确公式的有效性。具有挑战性的面部表情识别 (FER) 基准的实验结果表明,与强大的 ViT 基准相比,取得了一致的改进。