论文
仔细观察有监督的微调 LLM 规划器中的世界模型恢复
A Close Look At World Model Recovery In Supervised Fine-Tuned LLM Planners
摘要
有监督的 微调 (SFT) 改进了 大语言模型 (LLM) 中的端到端经典规划,但是这些模型是否也学会了表示和推理它们正在解决的规划问题?由于经典规划问题的相对复杂性以及端到端规划生成给LLM带来的挑战,探索这个问题一直很困难。在我们的工作中,我们设计并执行了一系列可解释性实验,通过检查微调后的 LLM 的内部表示和生成能力来全面质疑世界模型的恢复。我们发现:a)有效动作序列上的监督 微调 使 LLM 能够对动作有效性和一些状态谓词进行线性编码。 b) 努力使用输出概率对动作有效性进行分类的模型仍可能学习区分有效动作和无效动作的内部表示。 c) 微调 期间更广泛的状态空间覆盖(例如随机游走数据)可以更准确地恢复底层世界模型。总之,这项工作提供了将可解释性技术应用于规划 LLM 的秘诀,并产生了见解,阐明了有关知识如何在 LLM 中表示的开放问题。