论文

MedMemoryBench:个性化医疗保健中的智能体记忆基准测试

MedMemoryBench: Benchmarking Agent Memory in Personalized Healthcare

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

个性化医疗保健智能体的大规模部署要求记忆机制格外精确、安全,并能支持长期临床追踪。然而,现有基准主要聚焦日常开放域对话,未能捕捉真实医疗应用的高风险复杂性。受服务数千万活跃用户的业界领先健康管理智能体的严苛生产需求启发,我们提出MedMemoryBench。我们开发了一个人机协作流水线,基于有临床依据的合成患者原型来合成高度逼真的长程医疗轨迹。该流程产出了大规模、经专家验证的数据集,包含约2,000个会话和16,000轮交互。关键在于,MedMemoryBench突破传统静态评估,首创“边构建边评估”的流式评估协议,精确复现生产环境中动态的记忆积累过程。此外,我们形式化并系统研究了记忆饱和这一关键现象,即持续的信息涌入会主动削弱检索与推理的鲁棒性。全面的基准测试揭示了主流架构的严重瓶颈,尤其是在复杂医疗推理和抗噪能力方面。通过暴露这些根本缺陷,MedMemoryBench为开发鲁棒、可上生产的医疗智能体奠定了重要基础。

MedMemoryBench:个性化医疗保健中的智能体记忆基准测试:论文配图
图 4:MedMemoryBench 评估框架概述。该图总结了用于评估高效和混合设置下的内存方法的流式评估同时构建协议。