论文

世界行动验证者:通过正逆不对称自我改进世界模型

World Action Verifier: Self-Improving World Models via Forward-Inverse Asymmetry

模型训练强化学习

摘要

通用世界模型承诺可扩展的政策评估、优化和规划,但实现所需的稳健性水平仍然具有挑战性。与主要关注最优动作的策略学习不同,世界模型需要在大量次优动作中保持可靠,而这些次优动作通常在动作标记的机器人交互中代表性不足。为了应对这一挑战,我们提出了世界行动验证器(WAV),这是一个使世界模型能够识别自己的预测错误并自我改进的框架。关键思想是将动作条件状态预测分解为两个独立可验证的因素:状态合理性和动作可达性。我们表明,由于两个潜在的不对称性,验证这些因素比直接前向预测更容易处理:无动作数据的更广泛可用性和与动作相关的特征的维度较低。利用这些不对称性,我们通过(i)从视频语料库获得的多样化子目标生成器和(ii)从状态特征子集推断动作的稀疏逆模型来增强世界模型。通过强制提出的子目标、推断的行动和向前滚动预测之间的循环一致性,WAV 在现有方法经常失败的尚未探索的制度中提供了有效的验证机制。在涵盖 MiniGrid、RoboMimic 和 ManiSkill 的九项任务中,我们的方法实现了 2 倍的样本效率提高,同时将下游策略性能提高了 22% 以上。