论文
DolphinBench:映射代理内存的帕累托前沿
DolphinBench: Mapping the Pareto Frontier of Agent Memory
摘要
如今,智能体经常根据长期记忆和上下文回忆来采取现实世界的行动。然而,当前大多数内存基准测试都是针对对话式问答格式构建的,其中问题本身表明必须检索某些事实,并且通常是哪个事实。此外,基准测试很少要求提交的准确性之外的任何内容,从而允许内存系统进行不合理的成本/时间权衡以获得更高的分数。我们推出了 DolphinBench,这是一个通过智能体任务完成情况直接评估内存的基准测试。 DolphinBench 包括三个知识工作角色,每个角色包含大约 50 万个用户消息标记,并根据依赖于该历史信息的任务来评估代理。我们通过运行具有或不具有相关历史记录的代理来验证每个角色的所有 200 个任务,要求有该历史记录时成功,没有该历史记录则失败。最后,我们要求所有评估报告总成本和延迟以及准确性,这使我们能够全面评估代理内存系统。现有的内存基准测试还没有结合这三者。数据集和评估代码可从此 https URL 获取。