论文
VideoSeeker:通过本机代理工具调用激励实例级视频理解
VideoSeeker: Incentivizing Instance-level Video Understanding via Native Agentic Tool Invocation
摘要
大型视觉语言模型(LVLM)在视频理解方面取得了显着进展,但在实例级别需要精确时空定位的任务中面临着巨大的挑战。现有方法主要依靠文本提示进行人机交互,但这些提示难以提供精确的空间和时间参考,导致用户体验不佳。此外,当前的方法通常将视觉感知与语言推理分离,将推理集中在语言而不是视觉内容上,这限制了模型主动感知细粒度视觉证据的能力。为了应对这些挑战,我们提出了 VideoSeeker,这是一种通过视觉提示进行实例级视频理解的新颖范例。 VideoSeeker 将代理推理与实例级视频理解任务无缝集成,使模型能够根据需要主动感知和检索相关视频片段。我们构建了一个四阶段的全自动数据合成管道,以高效生成大规模、高质量的实例级视频数据。我们通过冷启动监督和强化学习训练将工具调用和主动感知能力内化到模型中,构建强大的视频理解模型。实验表明,我们的模型在实例级视频理解任务上比基线平均提高了 13.7%,超越了 GPT-4o 和 Gemini-2.5-Pro 等强大的闭源模型,同时在通用视频理解基准上也表现出了有效的可迁移性。相关数据集和代码将公开发布。