论文
忘记改进:设备上 LLM-Agent 通过预算管理内存持续学习
Forget to Improve: On-Device LLM-Agent Continual Learning via Budget-Curated Memory
摘要
设备上的语言模型代理通过积累检索记忆中的经验而不是更新权重来改进。该内存是硬限制且暴露的:它消耗 RAM 和能量,通过薄弱的上行链路到达对等点,并成为攻击面,因为它可以被代理读取的内容写入。现有的系统都涵盖了这个问题的一部分:代理记忆在没有预算的情况下增长,设备上的方法仅通过成功来保留条目,中毒主要作为一种攻击而不是作为内存治理问题来研究。我们提出 \sys{},一个单一的每字节净值分数,用于管理代理的体验记忆生命周期。主要思想是让预算充当策展人:每个条目都按每字节的价值减去危害进行评分,因此由一个统治者决定保留、共享和信任什么。 \sys{} 做出三个决定: (1) \textbf{KEEP} 在 RAM 和能量预算下驱逐低值字节; (2) \textbf{SHARE} 仅当洞察值超过其上行链路成本时才发送洞察; (3) \textbf{TRUST} 按出处控制对等条目。在语言模型代理任务漂移基准测试和具有两个机器人手臂节点和一个集线器的真实异构 Jetson 测试平台上,\sys{} 将内存减少了 $2.7\times$,将上行链路减少了 $2.4\times$,将注入成功率从 0.75 降低到零,并提高了因有毒或陈旧内存而损坏的情况下的准确性。按净值进行策划可减少占用空间、能源、上行链路和注入成功率,而不会降低准确性。在这种情况下,净值遗忘可以改善智能体而不是削弱它。