论文
视频分割实时互动训练
Live Interactive Training for Video Segmentation
摘要
交互式视频分割通常需要许多用户干预才能在具有挑战性的场景(例如遮挡、对象分离、伪装等)中获得稳健的性能。然而,即使像 SAM2 这样最先进的模型也仅使用修正来立即修复,而不从反馈中学习,导致用户工作效率低下、重复。为了解决这个问题,我们引入了实时交互式训练(LIT),这是一种基于提示的视觉系统的新颖框架,其中模型还可以在推理时从人类校正中在线学习。我们的主要实例 LIT-LoRA 通过不断动态更新轻量级 LoRA 模块来实现这一点。当用户提供修正时,该模块会根据该反馈快速进行训练,从而使视觉系统能够提高同一视频后续帧的性能。利用 LIT 的核心原理,我们的 LIT-LoRA 实现在具有挑战性的视频分割基准上实现了总校正量平均减少 18-34%,每次校正的训练开销可忽略不计,约为 0.5 秒。我们通过成功地将其应用于其他分割模型并将其扩展到基于 CLIP 的细粒度图像分类来进一步证明其通用性。我们的工作强调了实时适应改变交互工具并显着减少复杂视觉任务中多余的人力的希望。项目:https://youngxinyu1802.github.io/projects/LIT/。