论文

ProtoKV:使用摘要状态内存进行延迟查询下的流式视频理解

ProtoKV: Streaming Video Understanding under Delayed Query with Summary-State Memory

模型推理KV Cache

摘要

流式视频理解 (SVU) 必须回答异步到达的查询,而视觉标记在严格的 GPU 内存和查询时间延迟预算下连续流式传输。一个关键的挑战是延迟查询:决定性的线索可能会短暂出现,但许多后续更新会在查询到达之前发生,从而增加了这些线索在有限内存下被驱逐或稀释的风险。我们提出了 ProtoKV,一种占用空间恒定的 SVU 存储器,它将远古历史表示为固定容量的摘要状态,而不是保留词元实例。 ProtoKV 保留精确的近窗口 KV 缓存,并将较旧的内容聚合到具有剩余统计信息的语义空间原型库中。在查询时,每个原型都通过有界伪词元接口公开,该接口与标准注意力直接兼容。在匹配的预算和可比的查询时间成本下,ProtoKV 在长延迟情况下比 SVU 基准上的词元保留基线提高了高达 12.5 个百分点的准确性,并且随着查询延迟的增加,收益也会增加。