论文
CapMem:第一视角视频的文字描述情景记忆基准
CapMem: A Benchmark for Caption-Based Episodic Memory in Egocentric Video
摘要
可穿戴助手需要第一视角视频的情景记忆,但当前视觉语言模型受限于帧预算、增长的视觉token成本和长上下文检索失败。在这些实际约束下,我们研究文字描述能否作为可复用情景记忆。我们定义情景记忆视频描述问答任务,并提出人工标注基准CapMem:75段视频共33.7小时,以及覆盖16种场景的1000道多选题。对超过20分钟的长视频,采用30秒和60秒描述窗口的全覆盖CaptionQA分别在12个模型中的10个和8个上优于直接VideoQA。在相同视频子集上,对六个Qwen模型控制输入帧数后,平均准确率增益仍分别为3.22和2.55点。由描述引导的检索与验证Harness进一步最多提高5.3点准确率。结果支持文字描述记忆在长第一视角视频情景推理中的有效性。
