论文
论LLM规划的泛化差距:测试与验证器奖励强化学习
On the Generalization Gap in LLM Planning: Tests and Verifier-Reward RL
摘要
近期工作表明,微调后的大语言模型(LLM)在 PDDL 规划任务上可达到很高的有效规划率。然而,这是否反映可迁移的规划能力还是领域特定的记忆仍不清楚。在本工作中,我们在来自 10 个 IPC 2023 领域的 40,000 个领域-问题-规划三元组上微调一个 1.7B 参数的 LLM,并评估域内与跨域泛化。模型在域内条件下达到 82.9% 的有效规划率,但在两个未见领域上为 0%。为分析这一失败,我们引入三种诊断干预:(i) 实例级符号匿名化,(ii) 紧凑规划序列化,以及 (iii) 以 VAL 验证器为成功导向强化信号的验证器奖励微调。符号匿名化与紧凑序列化尽管保持规划语义,却导致显著性能下降,揭示了对表面表征的强敏感。验证器奖励微调在一半监督训练轮次内达到性能饱和,但未改善跨域泛化。在所探索的配置下,域内性能在约 80% 处趋平,而跨域性能坍塌,表明我们的微调模型在此设定下严重依赖领域特定模式而非可迁移规划能力。我们的结果凸显基于 LLM 规划的持续泛化差距,并提供研究其成因的诊断工具。
