论文
面向个性化智能体记忆的结构化蒸馏:11倍Token缩减且检索性能保持
Structured Distillation for Personalized Agent Memory: 11x Token Reduction with Retrieval Preservation
摘要
与AI智能体的长对话给单个用户带来一个简单问题:历史记录有用,但逐字携带的代价高昂。我们研究个性化智能体记忆:将单个用户与智能体的对话历史蒸馏为一个紧凑的检索层,供日后搜索。每次交流被压缩为一个包含四个字段(exchange_core、specific_context、thematic room_assignments以及正则提取的files_touched)的复合对象。可搜索的蒸馏文本平均每次交流38个token。该方法应用于来自6个软件工程项目的4,182段对话(14,340次交流),将平均交流长度从371个token降至38个token,实现11倍压缩。我们使用201个面向召回的查询、涵盖5种纯搜索模式和5种跨层搜索模式的107种配置、以及5个LLM评分器(214,519个经共识评分的查询-结果对),评估个性化召回能否在压缩后保留。最佳纯蒸馏配置达到最佳逐字MRR的96%(0.717对0.745)。结果依赖于检索机制。经Bonferroni校正后,全部20种向量搜索配置的差异均不显著,而全部20种BM25配置均显著退化(效应量|d|=0.031-0.756)。最佳跨层设置略超最佳纯逐字基线(MRR 0.759)。结构化蒸馏在压缩单用户智能体记忆的同时不会全面牺牲检索质量。以1/11的上下文成本,数千次交流即可容纳于单个提示中,同时逐字原始记录仍可用于深入追查。我们将实现与分析流水线作为开源软件发布。
