论文
LANTERN:LLM-使用经验门控推理网络增强神经符号转移
LANTERN: LLM-Augmented Neurosymbolic Transfer with Experience-Gated Reasoning Networks
摘要
强化学习 (RL) 中的迁移学习旨在通过利用相关来源的知识来加速新任务的学习。然而,现有的神经符号转移方法通常依赖于手动指定的任务自动机,假设单一源任务,并使用无法适应不同源相关性的固定知识整合机制。我们提出了 LANTERN,一个用于多源神经符号传输的统一框架,它通过三个组件解决这些限制:(i)使用 大语言模型 从自然语言任务描述生成的确定性有限自动机,(ii)通过跨任务相似性加权的多个源策略的基于语义嵌入的聚合,以及(iii)基于时间差异误差和语义不确定性的自适应师生门控。在资源管理、导航和控制等领域,LANTERN 的样本效率比现有基线提高了 40-60%,同时对不一致的源保持稳健。这些结果表明,多源、自适应加权神经符号传输可以提高符号 RL 设置中的可扩展性和鲁棒性。