论文

TTA-Vid:视频推理的通用测试时间适应

TTA-Vid: Generalized Test-Time Adaptation for Video Reasoning

模型训练强化学习

摘要

最近的视频推理模型在时间和多模态理解方面显示出了强大的成果,但它们依赖于大规模监督数据和多阶段训练管道,这使得它们的训练成本高昂并且难以适应新领域。在这项工作中,我们利用视频语言数据的测试时强化学习范例,允许在测试时使预训练模型适应传入的视频样本,而无需明确的标签。所提出的视频测试时间自适应方法(TTA-Vid)结合了两个同时工作的组件:(1)测试时间自适应,在多个帧子集的推理时间执行逐步推理。然后,我们使用跨不同帧子集计算的批量感知频率奖励作为伪 真值 来更新模型。它表明,在单个批次甚至数据集中的单个样本上训练的结果模型能够在测试时泛化到整个数据集甚至跨数据集。因为适应完全发生在测试时,所以我们的方法不需要 真值 注释或专门的训练分割。此外,我们提出了一种用于自适应帧选择的多臂老虎机策略,该策略在相同的奖励公式的指导下学习优先考虑信息帧。我们的评估表明,TTA-Vid 在各种视频推理任务中都取得了一致的改进,并且能够超越当前在大规模数据上训练的最先进的方法。这凸显了测试时强化学习在时间多模态理解方面的潜力。