论文
通过结构化推理进行长视野文本世界建模
Long-Horizon Textual World Modeling through Structured Reasoning
摘要
世界模型必须预测环境在一系列行动下如何演变,使智能体能够在行动之前比较可能的未来并推理反事实行动。长期预测通常是通过递归应用一步转换模型来获得的,但中间误差可能会随着时间的推移而复合。相反,多步动态模型以一系列未来行动为条件并直接预测其后果,但随着视野的增长,学习变得更加困难:模型必须跟踪整个轨迹上相互作用的状态变化,端点监督提供弱信用分配,中间预测可以保持合理,同时丢失后续状态所需的信息。我们表明,可以通过将多步过渡的内部演化转化为对文本世界状态的结构化推理来解决这些挑战:对稀疏状态变化的推理减少了状态跟踪的负担,预测增益目标奖励学习的状态,以改进匹配的预测器,而不是以原始历史为条件,中间预测奖励监督轨迹上的每个状态。由于这些中间状态是世界的明确文本表示,因此它们提供了语义上有意义的目标,可以在训练期间检查、评分和纠正。在 ScienceWorld、Jericho 和 CEO-Bench 中,我们的方法相对于直接以原始历史记录为条件的递归和非递归基线实现了最强的平均长期性能,并且在较长的时间范围内收益会增加。在一项受控的反事实研究中,我们的模型也是唯一一个对未来行动具有统计显着敏感性的模型。
