超越记忆排行榜:评估科学记忆作为预算上下文恢复
Beyond Memory Leaderboards: Evaluating Scientific Memory as Budgeted Context Restoration
摘要
长期记忆正在成为 LLM 智能体的核心组成部分,但大多数记忆基准测试评估对话或紧凑摘要,而研究智能体需要从完整的科学论文中恢复证据。我们介绍了两个全文科学记忆基准,公共人工智能记忆(PAIM;81 篇论文,66 个问题)和公共 Transformer(PTr;252 篇论文,98 个问题)。我们评估了八个记忆/检索系统,包括我们自己提出的 Theoria,以及无检索基线。我们的结果表明,如果没有完整的协议,内存排行榜就无法解释:摄取粒度、原始文本保存、检索预算、检索模式、标题审核和判断选择都会影响结果。例如,在 PAIM 上,Graphiti 令人信服地获胜,但每个查询使用 260 万个检索上下文字符,并且在控制检索预算后,领先优势消失。在 PTr 上,对于可以干净地添加 BM25 检索的系统,稀疏-密集混合是最重要的干预措施:Simple RAG、Mem0 和 Theoria 的混合变体在 0.03 分内领先。多位法官和人类并列校准表明,LLM 作为法官的排名在各个前沿法官之间是一致的,并且与人类评估一致,在十分制中有效分辨率约为一分。我们认为,科学记忆应该被评估为预算内的、模态感知的上下文恢复,而不是作为不受约束的架构排行榜,并且我们发布了数据集、利用、原始输出、判断和脚本来重现我们的结果并作为此类评估的工具。我们的代码可在 http://gitlab.com/quantellence/research/scientific-recall-bench 获取,数据集可在 http://huggingface.co/datasets/quantellence/srb-data 获取。