论文
思想作为规划:通过强化规划实现思想链优化的潜在世界模型
Thoughts-as-Planning: Latent World Models for Chain-of-Thoughts Optimization via Reinforcement Planning
摘要
大语言模型 (LLM) 在各种 NLP 任务中的成功提高了推理链优化的重要性,作为使模型行为与任务目标保持一致的关键步骤。现有的推理链调整方法通常依赖于黑盒启发式或无梯度搜索,缺乏可解释性、泛化性和样本效率。在这项工作中,我们引入了 \textbf{Thoughts-as-Planning},这是一种新颖的框架,它将推理链优化形式化为潜在语义空间上的顺序决策过程。我们将 LLM 建模为部分可观察的环境,并学习一个潜在世界模型,该模型模拟推理链编辑对下游输出的影响。构建邻近保持嵌入空间来编码推理链响应动态,从而能够通过梯度下降或强化学习进行规划。我们的方法支持多尺度抽象,允许将词元、段和指令级别的推理链编辑集成到统一的规划器中。通过对语言理解和生成任务的大量实验,我们证明了思想作为规划在效率、鲁棒性和泛化方面优于最先进的推理链调整基线,同时通过其结构化规划轨迹提供可解释性。我们的代码可在 https://github.com/FastLM/Thoughts-as-Planning 获取。