TencentDB Agent Memory发布短期任务记忆与长期个性化记忆能力
腾讯云Agent Memory节省61% Token提升52%成功率的诀窍:Mermaid无限画布×上下文卸载
概述
TencentDB Agent Memory 把长任务的短期记忆压缩拆为「上下文卸载 + Mermaid 无限画布」两部分:卸载侧把工具返回的完整原文写入 refs/*.md,工具调用级摘要写入 offload-<sessionId>.jsonl,任务步骤级摘要写入 mmds/<task>.mmd(节点含名称、status、summary、时间戳),上下文压力升高时再折叠为仅保留 taskGoal/status/nodeCount/mmFilePath 的 metadata,按需沿 metadata→MMD→JSONL→refs 四级逐级展开找回;画布侧选用 Mermaid Flowchart 而非 StateDiagram 作为载体(实验显示 Flowchart 作为压缩载体效果约好 15%),把离散摘要组织成可导航的任务拓扑。评测刻意把多任务串成超长 Session(SWEbench 50 个 task 同 session 连跑):SWEbench 500 题主 Agent 为 4.5-haiku,无插件完成率 58.4%,加插件后 61.8%–64.2%(相对 +5.82%–9.93%),Token 由 3474.1M 降至 2324.4M–2399.4M(节省 30.93%–33.09%);Toolathlon 20 个复杂长任务主模型 Opus 4.6,通过数 4→6–7、通过率 20%→30%–35%,Token 节省最高 26.18%(样本量小,方向性验证);WideSearch 200 个网页搜索任务,Token 221.51M→85.64M(节省 61.38%),通过率相对提升 51.52%;AA-LCR 800 题中插件/无插件各 400 题,准确率 44.0%→47.5%,主模型 Token 112,029,517→70,944,374(省 36.67%),计入 Offload 模型后总 Token 77,283,611(省约 31%)。消融显示仅上下文卸载时 SWEbench 提升约 5%、Token 省约 15%,叠加 MMD 后提升约 9.9%、省 31%–33%。 TencentDB Agent Memory 除短期任务记忆外提供长期个性化记忆模块,延续渐进式披露思路:不把用户历史一次性塞进上下文,而是把用户偏好、长期目标、任务习惯和历史经验分层沉淀后按需注入。评测方面,在包含 6000+ 条消息、589 道题的 PersonaMem 评测集上,接入后回答准确率相比原生「龙虾」记忆相对提升 59%,从不到 48% 提升到 76%;正文同时指出 PersonaMem 类评测部分场景 Token 节省可接近 90%,但因与真实使用方式差异较大(用户不会一直连续追问个人画像问题),未把该测试集的 Token 节省计入插件效果。可用性上,长期记忆功能已上线 Qclaw、Lighthouse 和 ClawPro 等产品,支持一键启用。文中给出的示例用途(量化交易用户默认考虑交易成本、比较 LSTM/Transformer/Chronos 并输出阈值与收益曲线;研究类任务记住已研究问题与判断框架)为说明性场景,未披露具名用户。