论文

从被动复用到主动推理:面向神经符号经验回放的LLM依据对齐

From Passive Reuse to Active Reasoning: Grounding Large Language Models for Neuro-Symbolic Experience Replay

模型训练强化学习

摘要

虽然经验回放对于强化学习 (RL) 中的数据效率至关重要,但标准方法将回放缓冲区视为被动记忆系统,根据数值预测误差而不是其语义意义来对样本进行优先级排序。这种方法与人类学习形成鲜明对比,人类学习通过主动将碎片化的经验抽象为行为规则来加速掌握。为了弥补这一差距,我们提出了神经符号体验重放(NSER),该框架将经验重放从被动的样本重用机制转变为主动的知识构建引擎。具体来说,NSER 通过一种新颖的神经符号基础管道解决了语言推理和数值优化之间的不兼容性。它以零样本的方式利用大语言模型 (LLM),从累积的轨迹中引入候选行为规则,将这些见解转化为可微分的一阶逻辑表示,并利用生成的符号结构动态地重新加权重放分布。通过允许抽象知识直接塑造策略优化,NSER 在反应性、基于规则和程序基准方面实现了一致的卓越样本效率和收敛速度。

从被动复用到主动推理:面向神经符号经验回放的LLM接地:论文配图
图 1:人类学习和强化学习之间差异的说明。人类从有限的经验中快速抽象出有效的行为模式,而强化学习则依赖于广泛的试错过程。