ProgressCompass:如果没有正确的背景,具体的进度奖励模型就会丢失
ProgressCompass: Embodied Progress Reward Models Are Lost Without the Right Context
摘要
具身Agent现在承担着越来越长的任务。对于长期任务,仅知道任务最终是成功还是失败并没有什么意义。一路走来的步骤很重要。进度奖励模型 (PRM) 对任务每一步的进展情况进行评分,并充当密集奖励、验证者和监控者。然而,在长期任务中,仅当前框架通常无法判断任务已经进行了多远,因为进度取决于之前发生的事情。我们称这个问题为上下文相关的进度估计。现有的进度估计基准主要集中在短期任务上,这些任务的进度可以从当前的观察中读取,而 PRM 是否可以在需要上下文时估计进度仍有待探索。因此,我们构建了 ContextProgress-Bench,其中包含 120 个情节的 24 个操作任务。该基准涵盖三种设置:(i) 状态召回,其中进展所需的信息较早出现,但不在当前框架中; (ii) 顺序跟踪,其中步骤遵循固定顺序,因此进度需要知道哪些步骤已完成以及接下来是哪些步骤; (iii) 重复消歧,相似的帧处于非常不同的进度。然后我们运行配对诊断:每个 PRM 在两次运行中都保持相同的输入格式,并且在一次运行中其指令集成了正确的上下文。即使阅读整个历史记录的 PRM 也会在估计进度时迷失方向,但在正确的背景下,相同的五个模型将进度误差减少了 77-82%。因此,具体的 PRM 并非无法估计进度,而是在没有正确上下文的情况下丢失了。因此,我们提出了 ProgressCompass,这是一个自主的 Agentic 循环,它可以重新定向现有的 PRM 并使用当前的通用 VLM 来提供 PRM 所需的上下文。包裹在循环中,相同的冻结 PRM 将其进度误差减少了 63%,并将其排名一致性提高了 76%。有了这样的指南针,PRM 就能更好地估计更长、更复杂任务的进度。