论文

CARL:面向LLM规划的约束感知强化学习

CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs

模型训练强化学习

摘要

尽管具备强推理能力与广泛世界知识,大语言模型(LLM)频繁生成违反任务约束的计划——损害真实应用的可靠性。缺陷源于生成过程缺乏纳入约束信息的系统机制。既有方法靠外部工具或任务分解缓解,却未增强模型内在的约束意识。为此我们提出约束感知强化学习(CARL):一个旨在强化LLM对约束内在关注的新RL框架。CARL引入约束感知奖励——比较模型在约束与无约束输入下的输出分布——奖励对约束的关注、惩罚忽视。兼容多种RL框架、无需外部求解器或顶级模型,CARL实现可扩展的端到端约束感知规划。BlocksWorld、TravelPlanner与T-Eval上的大量实验显示:CARL显著超越标准强化微调基线与最先进推理模型,对约束的关注明显增强。

CARL:面向LLM规划的约束感知强化学习:论文配图
图1:规划任务的典型案例。上面的方框表明查询可以分解为目标和约束,而下面的方框表明我们的 CARL 更加注重约束,最终在规划方面优于 RFT。