论文
H2HMem:人机交互中代理的多模态记忆基准
H2HMem: A Multimodal Memory Benchmark for Agents in Human-Human Interactions
摘要
大语言模型 代理越来越多地部署在人机交互环境中,例如会议助理和临床文档系统,它们必须观察对话并保留下游查询的信息。与传统的人类助理环境不同,这些环境本质上是多模态的,涉及复杂的话语现象,例如回指和指示语,并且包含来自多个参与者的异步或冲突的信息。然而,现有的内存基准测试主要关注单用户、纯文本交互,未能应对这些挑战。为了解决这一差距,我们引入了 H2HMem,一种人与人之间的多模式记忆基准,用于评估复杂的人与人交互中的记忆能力。 H2HMem 包括具有多模式信息流的二元对话和多方对话,并从三个维度评估智能体:记忆回忆、推理和应用。先进智能体的实验揭示了跨模式、参与者和会话构建、保留和利用记忆的巨大局限性,凸显了下一代 LLM 智能体的巨大改进空间。