论文

当用户不询问时:对会话代理中上下文驱动的内存检索进行基准测试

When Users Don't Ask: Benchmarking Context-Driven Memory Retrieval in Conversational Agents

模型评测基准与评测资源

摘要

大语言模型(LLM)越来越多地被部署为长视野会话代理,激发了人们对记忆系统日益增长的兴趣。然而,现有的基准测试主要通过 QA 风格的探测来评估内存,而不是现场对话使用。我们引入了 LOCOMO-CONV,这是一个源自 Lo-CoMo 的会话内存基准测试,具有四种查询样式:对话、隐式、反事实和组合。在五个代表性记忆系统中,我们评估了检索回忆和端到端响应质量。我们的实验表明,会话框架暴露了 QA 基准所忽视的大量检索差距,尤其是在隐式查询和组合查询上,多方面查询重写缩小了原始轮次记忆的范围,但没有缩小抽象记忆的范围。我们进一步发现,强检索并不能完全转化为响应质量,并且隐式查询表现出沉默的基础,其中记忆改善了上下文基础,而没有明确地呈现标准事实。这些结果表明基于推理的记忆阐述是一个有前途的方向,并且我们发布了辅助支持记忆注释,捕获超出原始标准证据的会话有用上下文。