论文

词元高效视频语言模型的持久对象叙述

Persistent Object Narratives for Token-Efficient Video Language Models

上下文与知识上下文工程

摘要

视频大语言模型(Video-LLM)在开放式视频理解方面取得了长足进步。然而,它们的视觉界面仍然是词元密集型的,并且为跨时间链接重复出现的对象证据提供有限的显式结构。我们引入了 SlotNarrative,这是一个基于槽的接口,它将视频组织成由紧凑的对象状态标记表示的持久对象叙述。 SlotNarrative 不是在建立时间对应之前压缩逐帧特征,而是首先将视觉特征分组到类似对象的槽中,然后通过集成多个互补匹配线索的轻量级、无参数内存将重复观察与剪辑级对象条目关联起来。每个保留的条目都序列化为两种词元类型:总结持久对象外观的身份词元和编码段级外观、几何形状、可见性和轨迹信息的一组状态词元。此设计为冻结的 Video-LLM 生成仅包含 144 个分配的视觉词元位置的接口,与采样帧的数量无关。与之前的紧凑型 Video-LLM 接口相比,SlotNarrative 在多个数据集上实现了准确性和视觉标记计数之间的有利权衡。实验结果将持久的对象叙述建立为 Video-LLM 的紧凑、结构化和时间组织的视觉界面。我们的代码将公开。