论文
长期LLM Agent如何从经历中学习思考策略
Learning Situation-Conditioned Thinking Policies for Long-Term LLM Agents
摘要
长期运行的自主Agent必须重用积累的推理经验,而不允许显式历史记忆和 LLM 上下文无限增长。然而,现有的记忆机制主要是检索、总结或压缩过去的内容,并不能直接学习何时应该激活特定类型的思维或从暂时分散的经验中发现新的思维知识。本文提出了一种情境条件思维记忆框架,将历史推理经验转化为轻量级策略,用于预测当前情境下应该思考什么,而将详细推理留给大型语言模型。情况可能代表时间或时空演变而不仅仅是当前状态。还定期分析多个独立事件中的临时经验,以识别重复的长期规律,将其巩固为新的思维知识,并通过轻量级策略进一步内化。实验表明,学习策略在时间规则泛化上实现了 1.000 F1,将 DeepSeek 推理 F1 从 0.789 提高到 0.868,将 30,000 个历史情况下每个查询的在线处理时间从 0.3636 毫秒减少到 0.0382 毫秒,并在足够的重复交叉经验证据后达到 1.000 关系发现 F1 和未来思维准确性。
