论文
世界模型后训练的收益是否来自环境预测能力
Does Learning to Predict the World Help Agents Act? Auditing World-Model Post-Training
摘要
在行动之前预测环境将如何变化是智能体做出更好决策的自然途径。因此,最近的后训练方法要求智能体预测下一个观察结果,并将该预测转化为奖励或直接监督信号,这称为世界模型。现有的下次观察训练方法可以帮助智能体学习环境内容。然而,它们还涉及一个优化过程,除了学习预测世界之外,这可能会带来一些影响。因此,训练过程中的性能增益从何而来仍然是一个悬而未决的问题。我们通过在训练过程中用分布内不匹配的观测值替换真正的下一个观测目标来回答这个研究问题。在两个交互式文本环境中,不匹配的目标相对于地面实况目标而言,预测准确度降低了 15.3-61.6%,但与基本模型相比,仍保留了大量的任务增益。与基础模型相比,经过训练的模型会考虑更多的候选动作并表现出更少的循环。我们还引入了一种设置,用独立的随机信号取代基于预测的奖励。即使奖励不包含环境信息,这种训练也扩大了任务覆盖范围(pass@64)。我们还将这一发现推广到 VisualWebArena,其中随机奖励训练相对于基本模型将 pass@64 提高了 14.3%,而无需观察匹配奖励或外部多模式教师进行奖励构建。