论文

SVAgent:通过跨模式多智能体协作进行故事情节引导的长视频理解

SVAgent: Storyline-Guided Long Video Understanding via Cross-Modal Multi-Agent Collaboration

应用与实践通用理解与问答

摘要

视频问答 (VideoQA) 是一项具有挑战性的任务,需要集成空间、时间和语义信息来捕获视频序列的复杂动态。尽管最近的进展引入了各种视频理解方法,但大多数现有方法仍然依赖于定位相关帧来回答问题,而不是像人类那样通过不断发展的故事情节进行推理。人类自然地通过连贯的故事情节来解读视频,这种能力对于做出稳健且基于上下文的预测至关重要。为了解决这一差距,我们提出了 SVAgent,一种用于 VideoQA 的故事情节引导的跨模式多代理框架。故事情节代理根据分析历史失败的细化建议代理建议的框架逐步构建叙事表示。此外,跨模式决策代理在不断发展的故事情节的指导下独立预测视觉和文本模式的答案。然后,它们的输出由元代理进行评估,以调整跨模式预测并增强推理的稳健性和答案的一致性。实验结果表明,SVAgent 通过在视频理解中模拟类人故事情节推理,实现了卓越的性能和可解释性。