论文
从经验中学习状态预测知识
Learning Stateful Predictive Knowledge From Experience
摘要
随着 大语言模型 (LLM) 智能体越来越多地从经验中学习,它们主要依靠轨迹级反射来提取见解。从预测知识的角度来看,我们认为这种方法是基于情景的后见之明而不是预测性的远见,从而产生脆弱的、依赖于路径的启发法。为了解决这个问题,我们提出了状态知识学习(SKL)。 SKL 将智能体的重点从轨迹级总结转移到维护状态知识:锚定到状态的明确的、声明性的预测评估。我们首先演示一个激励性示例,展示有状态知识如何提供粒度、增强泛化并实现知识引导。为了进一步扩展这个想法,我们通过 self-蒸馏 (SKL-SD) 和强化学习 (SKL-RL) 引入了两种算法,训练代理从经验中自主提取基于状态的预测知识,并学习利用它来制定政策。交互式环境(WebShop、ScienceWorld)和复杂推理任务(ChessPuzzles)上的实验表明,为模型配备学习状态预测知识的固有能力明显超过了当前基于反射的训练范例。