论文
CARL:面向LLM规划的约束感知强化学习
CARL: Constraint-Aware Reinforcement Learning for Planning with LLMs
摘要
尽管具备强推理能力与广泛世界知识,大语言模型(LLM)频繁生成违反任务约束的计划——损害真实应用的可靠性。缺陷源于生成过程缺乏纳入约束信息的系统机制。既有方法靠外部工具或任务分解缓解,却未增强模型内在的约束意识。为此我们提出约束感知强化学习(CARL):一个旨在强化LLM对约束内在关注的新RL框架。CARL引入约束感知奖励——比较模型在约束与无约束输入下的输出分布——奖励对约束的关注、惩罚忽视。兼容多种RL框架、无需外部求解器或顶级模型,CARL实现可扩展的端到端约束感知规划。BlocksWorld、TravelPlanner与T-Eval上的大量实验显示:CARL显著超越标准强化微调基线与最先进推理模型,对约束的关注明显增强。
