论文
有疑虑就规划:面向反应式强化学习的承诺式小语言模型深思
When in Doubt, Plan It Out: Committed Small Language Model Deliberation for Reactive Reinforcement Learning
摘要
强化学习(RL)策略在不熟悉环境中常退化——因为它们缺乏显式深思。我们提出PACT(规划、对齐、承诺、思考)——混合架构——组合快速反应式RL策略与慢速深思式小语言模型(SLM)规划器。PACT异步调用SLM生成并验证候选动作计划。计划经仿真验证为安全、可行且完整后——直接执行——绕过RL策略——而无需重训或修改它。在三个难度递增的FrozenLake配置上评估——PACT以2B参数SLM骨干超越全部基线——表明在此类设定中深思规划与反应执行协力强于任何单独一方。