论文
使用在线个性化基于能量的缓存进行测试时适应,以实现细粒度视频表情识别
Test-Time Adaptation with Online Personalized Energy-Based Cache for Fine-Grained Video Expression Recognition
摘要
视频中的面部表情识别 (FER) 具有挑战性,因为模型必须识别因个体而异的微妙的、随时间变化的情感状态。尽管视觉语言模型提供了可转移的视觉语义表示,但在独立于主题的数据上训练的模型通常会在推理时因主题特定的分布变化而降级。现有的测试时间自适应(TTA)方法通常会在推理过程中更新模型参数,从而增加计算成本和延迟。基于缓存的方法避免了参数更新,但它们通常需要足够的目标样本来形成可靠的类原型,这在适应早期以及对于很少观察到的类来说是困难的。我们引入了基于能量的缓存个性化 (EB-CaP),这是一种基于主题的视频 FER 在线 TTA 方法,可生成针对每个目标视频进行个性化的特定于类的原型。 EB-CaP 使用轻量级的基于能量的模型从当前未标记的视频中采样原型并在线填充个性化缓存,而无需积累大量目标数据或存储不同的源原型。它的能量函数仅依赖于预训练的 CLIP:目标视频嵌入和类文本嵌入之间的相似性指导原型采样。同时,正缓存和负缓存存储可靠和不确定的目标嵌入。自适应熵门根据不断变化的置信分布控制缓存更新,而多样性门则限制冗余样本。最终预测将缓存导出的分数与当前 CLIP 分数相结合。 BioVid、StressID 和 BAH 上的实验表明,EB-CaP 的性能优于最先进的 TTA 方法,同时保持较低的计算和内存开销。代码可在 https://github.com/MasoumehSharafi/EB-CaP 获取。