论文

LSREP:以纵向状态回放评估对话记忆,并审计本地优先架构ICE v2

LSREP: A Longitudinal State-Replay Protocol for Evaluating Conversational Memory, with ICE v2 as an Audited Local-First Architecture

模型评测上下文与知识上下文工程记忆评测方法与指标Agent记忆

摘要

对话记忆在使用中变化,仅终点问答不能说明持久状态如何累积、老化或吸收修订。我们提出纵向状态回放评估协议LSREP,结合有序回放、显式生命周期安排、重复探针、演变参考答案和机制忠实性检查。架构案例ICE v2是本地优先记忆中间件,包含类型化存储、检索融合及动态上下文预算。私有单用户实例含1985轮、219个不同探针,以及52个检查点上的1211次探针观测。在三个普通密度数据集上,ICE v2与向量RAG平均质量差近零,选片段少32%,估计提示token却多6.6%。第四个密集数据集暴露无预算基线的灾难性失效。忠实性审计限制归因:程序式检索有缺陷,多个机制未被触发,图效用未确立。在互补的匹配公开诊断LongMemEval上,ICE v2明显落后纯向量RAG:仅证据理想条件为50.8%对72.8%,full-S为43.0%对69.5%;配对差分别−22.0点,95%区间[−26.6,−17.4],及−26.5点,区间[−31.3,−21.8]。保守弃答伴随严重跨会话和时间推理失败。ICE在此用更少上下文,说明质量成本权衡而非更优效率。回放、机制审计和公开终点评测共同揭示架构描述或汇总分数无法单独识别的失效。