论文
世界模型的文本信念状态:严格中介下的可识别表征学习
Textual Belief States for World Models: Identifiable Representation Learning Under Strict Mediation
摘要
部分观察环境中的世界模型依赖于总结交互历史的潜在表示,但在许多基于 LLM 的现代架构中,由于历史绕过,预测性能无法反映表示质量,从而导致潜在状态无法识别。严格的潜在状态调解,要求预测仅依赖于潜在状态和动作,是解决这个问题的经典原则,但在基于文本的设置中强制执行它是一个开放的挑战:文本潜在状态是离散且不可微分的,排除了变分训练,而富有表现力的 LLM 解码器很容易忽略瓶颈。我们展示了如何在文本领域进行严格的调解工作。我们形式化了为什么它是必要的,表明严格的中介使得表示质量可以通过经验进行测试,而历史泄漏的架构则打破了这种联系。然后,我们引入离散的、可解释的、可变长度的文本潜在状态,以及因式分解 GRPO (fGRPO),这是一种在训练期间强制执行严格调解的树结构强化学习方法。 TextWorld 和 ScienceWorld 上的实验表明,保留了一步预测精度,同时表示质量最多提高57%,轨迹预测性能提高了 98%,并且随着任务复杂性和范围的增加而增加。