论文
WPM:用预训练世界知识衡量长程任务的执行进展
World Potential Model: Pretrained World Knowledge as Progress Potentials
摘要
长程语言Agent往往只从最终任务结果获得监督,缺少区分有效中间行为、停滞及倒退的信号。我们不为每项任务另行学习价值函数或过程奖励模型,而是研究预训练模型能否凭已有世界知识识别任务进展。我们用世界势能模型(WPM)形式化这项能力:它是目标条件评估器,评价Agent环境中相对于任务的已实现进展。在ALFWorld和ScienceWorld中,现成预训练模型无需面向具体任务微调评估器,恢复已实现进展结构的能力就显著高于随机水平。我们进一步用任务特定里程碑锚定这些进展判断,得到标量世界势能,其时间差分为策略优化提供过程敏感的逐步信用。在条件匹配的比较中,WPM引导的优化在全部受测配置上都比仅使用结果奖励的GRPO提高成功率。这些结果初步说明,预训练世界知识能够支持可复用的已实现进展评估,为长程Agent提供有效监督。
