论文

KnowMe-Bench:面向终身数字伴侣的人物理解基准评测

KnowMe-Bench: Benchmarking Person Understanding for Lifelong Digital Companions

模型评测上下文与知识记忆基准与评测资源Agent记忆

摘要

现有的长程记忆基准大多使用多轮对话或合成的用户历史,这使检索性能成为人物理解的不完美代理指标。我们提出 KnowMe-Bench,一个可公开发布的基准,它由长篇自传式叙事构建,其中行为、背景与内心想法为推断稳定动机和决策原则提供了密集证据。KnowMe-Bench 将每篇叙事重构为闪回感知、时间锚定的流,并以横跨事实回忆、主观状态归因和原则级推理的证据关联问题评测模型。在多样化的叙事来源上,检索增强系统主要提升事实准确性,而在基于时间背景的解释和更高级推理上错误依然存在,凸显了对超越检索的记忆机制的需求。我们的数据见 https://github.com/QuantaAlpha/KnowMeBench。

KnowMe-Bench:面向终身数字伴侣的人物理解基准评测 配图
图 2:多智能体数据集生成流水线概览。该框架通过四个先后阶段将非结构化的原始叙述转化为结构化的 KnowMe-Bench 基准:(A) 分割(Segmentation)、(B) 原子单元(ANU)抽取、(C) 时间线生成(Timeline Generation)以及 (D) 叙事生成(Narrative Generation)。为确保数据保真度,每个生成模块都配有一个专门的检查智能体(Check Agent),强制执行“验证-修订”(Verify-and-Revise)循环,并最终由人类文学专家进行最终校验。