论文
做完了但不确定:从自我终止中解耦世界完成度的具身智能体评估
Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents
摘要
标准的具体评估不会独立地评估智能体是否在情节结束时正确承诺完成任务,我们将这种能力称为最终承诺。行为上不同的失败——从未完成任务、完成任务但未能停止、在没有足够证据的情况下报告成功——都会陷入相同的基准失败。我们引入了 VIGIL,一个使最终承诺可独立衡量的评估框架。在 VIGIL 的默认协议下,智能体仅观察以自我为中心的 RGB,不接收任何动作成功信号,并且必须以针对隐藏世界状态进行确定性检查的语义报告结束每个情节。这会产生两个单独的分数:世界状态完成度 (W) 和基准成功度 (B),其中 B 还需要正确的最终报告。这种解耦使得四种结果类别变得可区分:执行失败、成就后漂移、不受支持的承诺和经过验证的成功。在 1,000 个冻结事件的 20 个模型中,具有可比 W 的系统在 B 中相差高达 19.7 pp:一个模型将实现的状态转换为正确的报告,而另一个具有几乎相同执行的模型则在没有关闭的情况下超出了目标。行动反馈干预进一步测试了这种分离:面向执行的信号广泛地改善了 W,但承诺失败仍然存在于尚未将终端报告置于已实现状态的模型中。 VIGIL 提供了一个协议,使终端承诺独立可见且可评分。
