论文
TTSD-FAR:测试时 Self-蒸馏 与 Fisher-Anchored 恢复,用于 LVLM 中缺失模态情感识别
TTSD-FAR: Test-Time Self-Distillation with Fisher-Anchored Restoration for Missing-Modality Emotion Recognition in LVLMs
摘要
大型视频语言模型(LVLM)在多模态任务(例如野外多模态情感识别(ER))中表现出了卓越的性能。 ER 本质上是多模式的,需要对面部表情、发声、语言、生物信号和手势的共同理解。然而,现实世界的部署仍然具有挑战性:测试时模式可能会丢失或有噪音。部分观测值可以被视为相对于完整模态分布的分布变化。基于熵最小化或困惑度减少的 SOTA TTA 方法不会转移到自回归 LVLM,而当观察到的模态较弱时,检索增强生成 (RAG) 会退化。由于不存在 真值 监督来验证各个更新,因此一旦模型偏离可靠的解决方案,跨此流的适应就会面临累积漂移和降级的风险。因此,有效的解决方案必须适应任意缺失模态模式,并在持续适应过程中保持有效。我们与 Test-Time Self-蒸馏 (TTSD) 一起解决这两个问题,这是一个参数有效的框架,其中受完整模态训练的冻结教师通过 self-蒸馏 指导自适应低秩学生,仅更新可忽略不计的参数数量。通过费舍尔锚定恢复(FAR)将稳定性内置到同一个循环中,它监视费舍尔信息稳定性以检测收敛与漂移,并在识别分布变化时将学生恢复到教师的锚点。我们在 0%-50% 缺失模式下对 MELD、DFEW 和 BAH 进行的实验表明,这种统一的适应-恢复设计在长期适应范围内始终优于基于熵的适应、RAG 和基于困惑的生成,其中没有恢复的基线逐渐退化,而 TTSD-FAR 保持一致。