论文

超越状态一致性:基于文本的世界模型中的行为一致性

Beyond State Consistency: Behavior Consistency in Text-Based World Models

智能体系统Agent 环境交互

摘要

世界模型已经成为评估交互式代理在在线规划和离线评估中产生的行动后果的关键组成部分。在基于文本的环境中,世界模型通常使用单步指标(例如“精确匹配”)进行评估和训练,旨在提高预测状态与现实世界状态之间的相似性,但此类指标已被证明不足以捕获实际的代理行为。为了解决这个问题,我们引入了一种新的行为一致的训练范例,旨在提高世界模型与真实环境之间的功能一致性。该范例侧重于优化名为行为一致性奖励(BehR)的易于处理的步骤级指标,该指标衡量在冻结参考代理下记录的下一个动作在真实状态和世界模型预测状态之间变化的可能性有多大。 WebShop 和 TextWorld 上的实验表明,基于 BehR 的训练可以改善多种设置中的长期对齐,其中 WebShop 中的收益最明显,并且在接近天花板的情况下移动较少,同时在四分之三的设置中保持或提高单步预测质量。使用 BehR 训练的世界模型在离线代理评估中也实现了较低的误报,并在推理时间前瞻规划方面显示出适度但令人鼓舞的收益。