论文

评估连续生命日志场景中的记忆能力

Evaluating Memory Capability in Continuous Lifelog Scenario

模型评测基准与评测资源

摘要

如今,可穿戴设备可以持续记录环境对话,为记忆系统创造大量机会。然而,现有的基准主要关注在线一对一聊天或人机交互,从而忽略了现实场景的独特需求。鉴于公共生活记录音频数据集的稀缺性,我们提出了一个分层综合框架来策划 \textbf{\textsc{LifeDialBench}},这是一个包含两个互补子集的新颖基准:\textbf{EgoMem},基于现实世界的以自我为中心的视频构建,和 \textbf{LifeMem},使用模拟虚拟社区构建。至关重要的是,为了解决传统离线设置中的时间泄漏问题,我们提出了一种严格遵守时间因果关系的在线评估协议,确保以现实的流式传输方式评估系统。我们的实验结果揭示了一个违反直觉的发现:当前复杂的内存系统无法超越基于 RAG 的简单基线。这凸显了当前方法中过度设计的结构和有损压缩的有害影响,强调了生活日志场景高保真上下文保存的必要性。