论文

MemUse:将内存评估从直接 QA 转移到长期人类与人工智能对话中的自然集成

MemUse: Moving Memory Evaluation from Direct QA to Natural Integration in Long-Term Human-AI Conversation

模型评测基准与评测资源

摘要

会话 LLM 的记忆系统通常通过有关先前对话的直接、事实寻求问题(直接 QA)来评估:模型能否从先前的对话中回忆起事实 X?我们在 4 个月的部署(40 个用户、1,872 个会话、7 个内存条件)中测试了较高的 Direct QA 准确性是否与较高的用户满意度相关。现有基准直接 QA 在 7 个条件下的变化范围为 19.7% 到 70.1%,但满意度没有变化。我们假设现有的基准和用户满意度正在跟踪不同的功能:基准衡量引发的检索(询问时回忆),而对话需要自然集成(检测相关性并自然地将先前的上下文编织到响应中)。为了检查这一点,我们引入了 MemUse,这是一组从部署中提取的真实用户提示记忆时刻,通过对自然对话响应的集成感知判断进行评分。在模型和上下文固定的情况下,直接 QA 得分为 78.8% 的同一系统仅引用了对话中事实的 7.9%,差距为 71 分。在这些时刻,自然集成与满意度相关,而直接质量检查则不然。我们在 https://github.com/ryuichi-sumida/memuse 上发布了部署语料库和 MemUse 以及所有判断和评分提示。