论文
GROVE:来自流视频体验的时间分层记忆的增长和推理
GROVE: Growing and Reasoning over Temporally Stratified Memory from Streaming Video Experience
摘要
可穿戴助手应该既能回答有关其视觉历史的问题,又能识别该历史何时对当前情况有用。现有的视频记忆系统主要支持问题条件回忆,而主动助理通常使用单独的记忆和控制机制。我们引入了 GROVE,这是一种 无需训练 框架,它通过从连续视频流因果增长的一个内存来支持这两种行为。 GROVE 保留细粒度的感知证据,并逐步将其整合为带有时间戳的时刻、连贯的事件和重复出现的跨日模式。每个层都配有尺度原生检索技能,用于定位观察、重播活动或遍历长期规律性。反应式 QA 和主动式协助共享此内存和访问接口,区别在于检索是由用户查询发起还是由当前情况发起。在多个基准测试中,包括具有挑战性的 MM-lifelong 和 EgoServe,GROVE 在比较方法中取得了最佳结果。受控消融表明,时间层及其访问技能是互补的,当证据跨越多天时,模式提供最大的好处。代码可在 https://github.com/SitongGong/GROVE 获取。