论文
LifeSide:将代理商作为终身数字伴侣的基准测试
LifeSide: Benchmarking Agents as Lifelong Digital Companions
摘要
终身数字伴侣必须整合跨会话线索,不断更新对用户的理解,并适应不断变化的隐私边界。现有的评估无法捕捉到这一点,只能单独测试记忆回忆和短期同理心。为了弥补这一差距,我们引入了 \benchmark,一个以多会话 \textit{Memory-Emotion-Environment} 循环为中心的基准测试。通过将用户建模为具有分层配置文件和事件轨迹的持久世界,\benchmark 使用多智能体模拟将环境动态投射到对话中,保留潜在想法和可观察表达之间的关键差距。通过评估内存跟踪、用户理解、隐私控制和情感陪伴方面的 2,000 个角色和 111K 任务,我们的实验结果揭示了一个严峻的现实:即使是饱和当前内存基准的模型也无法长期维持准确的用户理解和真正的陪伴。