论文
通过多级事件语义挖掘实现有效的长视频事件预测
Towards Effective Long-Video Event Prediction via Multi-Level Event Semantics Mining
摘要
准确预测未来事件是各个领域的内容理解和决策的基础。虽然之前的研究主要集中在文本或短视频场景,但以庞大的多模态上下文和更复杂的叙述为特征的长视频事件预测仍未得到充分探索。与此同时,尽管最近基于 大语言模型 (LLM) 和视觉语言模型 (VLM) 构建的长视频语言模型 (LVLM) 在长视频问答和摘要方面显示出了前景,但它们很难推广到事件预测,因为它们既不能精确提取事件相关的细节,也不能对事件发展进行细粒度分析。为了解决这一差距,我们提出了 VISTA,一种用于长视频事件预测的多级事件语义挖掘框架。最初,VISTA应用以字符为中心的视觉提示来精确提取与事件相关的视觉细节,增强细节级语义;随后,它采用知识增强的迭代检索策略,引导LLM逐步构建逻辑连贯的事件链,从而改善事件级叙事;最终,VISTA采用类人的提议-然后检索策略来生成多种面向未来的提议,并整合多层次的线索,产生稳健而准确的预测。对真实世界数据集的大量实验验证了 VISTA 对于长视频事件预测的有效性。