论文
Act2See:用于视频推理的紧急主动视觉感知
Act2See: Emergent Active Visual Perception for Video Reasoning
摘要
视觉语言模型 (VLM) 通常依赖静态初始帧进行视频推理,这限制了它们随着推理过程的发展而整合基本动态信息的能力。使用附加帧信息增强思想链 (CoT) 的现有方法通常表现出次优的 CoT 质量,并且缺乏为假设或反事实场景合成视觉信息的关键能力。我们引入了 Act-to-See (Act2See),这是一种新颖的框架,它通过使 VLM 能够在文本 CoT 中主动交错视频帧来实现主动视觉感知。 Act2See 是通过 Supervised 微调 (SFT) 在由前沿 VLM 生成的高质量推理轨迹数据集上开发的。这些跟踪集成了主动调用以检索现有帧或生成新帧,并根据人工注释的 CoT 进行严格验证以确保质量。这种方法培养了一种新兴能力:在推理时,模型主动确定何时搜索或合成必要的视觉证据。 Act2See 在具有挑战性的基准(包括 VideoEspresso 和 ViTIB)上建立了新的最先进的结果,并且在 Video-MME、EgoNormia 和 VCR-Bench 上优于类似或更大的模型,展示了在使 VLM 具有用于视频推理的主动视觉感知方面的进步。