论文
Gen2Balance:长尾视频动作识别的生成平衡
Gen2Balance: Generative Balancing for Long-Tailed Video Action Recognition
摘要
我们解决了视频动作识别的长尾数据训练问题。我们建议使用文本到视频生成模型来增强训练集,该模型以基于动作配置文件和训练示例的不同文本提示为条件。我们的方法称为 Gen2Balance,将不平衡的训练集转换为真实视频剪辑和生成视频剪辑的平衡组合。为了有效地从这些数据中学习,我们采用了两阶段训练策略,可以减轻领域转移并产生显着的改进。我们评估标准基准的长尾版本:UCF-101 (UCF-LT) 和动力学的 100 类子集 (K100-LT),选择用于优先考虑暂时具有挑战性的操作。 Gen2Balance 在各自数据集上将长尾学习的最强基线的准确性提高了 5.1% 和 7.0%。对于 RareAct 数据集中的稀有动作(例如,剪切键盘),Gen2Balance 将准确性提高了 31.9%,证明了稀有动作的有效性。通过改变添加的合成数据量,我们表明部分平衡已经在 K100-LT 上以 27% 的计算成本实现了 79% 的性能增益,凸显了 Gen2Balance 的实际可扩展性。