论文

APM-Bench:以自我为中心的流媒体视频助手的跨会话持久内存基准测试

APM-Bench: Benchmarking Cross-session Persistent Memory for Egocentric Streaming Video Assistants

模型评测基准与评测资源

摘要

为了充当现实世界的个人助理,流视频模型需要持久内存来保留过去的经验以供以后使用。然而,现有的流媒体基准和方法通常侧重于单个连续视频或短片,而忽略了现实世界的交互通常是间歇性的,并且需要内存在中断时持续存在。为了填补这一空白,我们引入了 APM-Bench,它将现实世界的流媒体交互重新表述为多会话生命轨迹。它包含 549 个会话、104 个轨迹和 2,719 个候选者,涵盖客观问题和开放式问题。每个会话都是带有细粒度注释的视频,并且轨迹内的会话围绕相关活动。然后,模型使用持久记忆来回答有关过去会话的问题并提供主动响应,同时保持实时交互。这就提出了挑战:持久内存必须可存储、有选择地保留信息、在正确的时间注入并保持高效。此外,有限的存储可能导致所需的证据不可用,因此助理应该识别丢失的证据。因此,我们系统地评估了不同存储协议和各种专用流存储系统下的通用视频模型,并测试模型是否承认证据不足。我们的评估揭示了明显的效用-延迟-存储权衡:现有方法仍然难以同时实现可靠的长期召回、低开销和跨会话的有效主动帮助。 APM-Bench 提供了一个全面的测试平台,用于在实际流条件下开发和比较持久内存系统。我们希望它能鼓励未来的工作,共同考虑实用性、延迟和存储,为现实世界的流媒体助手提供更实用的持久内存。