论文

WPM:用预训练世界知识衡量长程任务的执行进展

World Potential Model: Pretrained World Knowledge as Progress Potentials

模型训练智能体系统强化学习奖励建模与过程监督Agent任务评测Agentic RL

摘要

长程语言Agent往往只从最终任务结果获得监督,缺少区分有效中间行为、停滞及倒退的信号。我们不为每项任务另行学习价值函数或过程奖励模型,而是研究预训练模型能否凭已有世界知识识别任务进展。我们用世界势能模型(WPM)形式化这项能力:它是目标条件评估器,评价Agent环境中相对于任务的已实现进展。在ALFWorld和ScienceWorld中,现成预训练模型无需面向具体任务微调评估器,恢复已实现进展结构的能力就显著高于随机水平。我们进一步用任务特定里程碑锚定这些进展判断,得到标量世界势能,其时间差分为策略优化提供过程敏感的逐步信用。在条件匹配的比较中,WPM引导的优化在全部受测配置上都比仅使用结果奖励的GRPO提高成功率。这些结果初步说明,预训练世界知识能够支持可复用的已实现进展评估,为长程Agent提供有效监督。

WPM:用预训练世界知识衡量长程任务的执行进展:论文原图
图 1:世界潜力模型 (WPM) 及其下游标量化概述。 WPM 从预先训练的世界知识中引出与任务相关的已实现进度结构,以顺序进度判断作为其主要界面。对于下游使用,这些判断可以参考特定于任务的进度锚来获取标量世界潜力,其时间差异为策略优化提供过程敏感的信用。