论文
HiMPO:基于事后信息的记忆策略优化,用于长期代理中较少纠缠的信用
HiMPO: Hindsight-Informed Memory Policy Optimization for Less-Entangled Credit in Long-Horizon Agents
摘要
长程智能体依靠记忆机制来压缩交互历史,但优化记忆写入面临着明显的贡献分配挑战:记忆更新可能会由于下游工具故障、噪声观察或推理错误而不是其自身的贡献而受到奖励或惩罚。我们提出了 HiMPO,一种基于事后信息的记忆策略优化框架,用于为长程代理中的内存写入操作分配较少纠缠的信用。 HiMPO 首先通过比较在相同预写入状态下可从先前存储器和更新存储器恢复的任务相关信息来估计存储器更新的局部效用。然后,它使用事后相关性作为有界回顾性过滤器,当目标结果不支持本地效用时,该过滤器会削弱记忆信用。由此产生的特定于记忆的优势仅适用于记忆词元,而轨迹级奖励则优化代理的其余行为。在基于判断的开放域任务和客观压缩内存 QA 中,HiMPO 改进了强大的基于内存和基于 RL 的基线,同时保留了压缩上下文效率。受控干预和实时重放研究进一步表明,HiMPO 减少了工具引起的错误的责任泄漏,分配与内存写入的功能影响相一致的内存信用,并对嘈杂的训练目标保持鲁棒性。