论文

RealCompanion:通过纵向现实世界对话的推理对人类理解进行基准测试

RealCompanion: Benchmarking Human Understanding from Reasoning over Longitudinal Real-World Conversations

智能体系统上下文与知识记忆Agent任务评测Agent记忆

摘要

与一个人交谈几个月的同伴应该能够理解他们。它应该记住他们所说的话,推断出他们是谁,并知道过去何时会影响到它前面的信息。测试这一点需要真人的记录,而这些记录是私人的,因此基准会生成人和问题,并提前解决重要的问题。我们发布了 \bench,即与 AI 伴侣的 10 条真实关系:长达 120 天内的 27,218 条消息,以对话形式发布,以及从中派生的四个文件:个人资料、角色、聊天基本事实和问题集,每个文件都引用了其所依赖的消息。每个聊天标签都带有产生它的推理轨迹,并根据对话进行逐步检查。以下是三个发现。首先,过去很少被需要,而且很遥远。汇总测量会产生误导:新近度窗口为 95.9% 的探测器和 2.2% 需要记忆的探测器找到了所需的消息,并且按照自然率,提供记录证据带来的收益中 96% 来自不需要记忆的消息。其次,我们尝试过的任何检测器都无法判断真实消息何时需要记忆,针对相同历史编写的问题会泄露线索,并且将相同消息标记为记忆会将其使用率提高十到十四点。第三,三个Agent系统以相同的 F1 重建角色,成本相差 31 倍。