论文
ENCP:用于视觉和语言导航的情节归一化保形预测
ENCP: Episode-Normalized Conformal Prediction for Vision-and-Language Navigation
摘要
视觉语言导航(VLN)模型的不确定性估计是一项关键任务,因为它可以帮助识别模糊且不可靠的预测,使代理能够做出更安全的导航决策。作为最先进的不确定性估计框架之一,保形预测(CP)为 VLN 中的不确定性估计提供了一种有前景的方法。然而,鉴于 VLN 代理需要一系列步骤,保形预测中的标准校准无法提供其在依赖的、可变长度 VLN 事件上所承诺的覆盖保证。为此,我们提出了插值归一化保形预测(ENCP),它通过策略的剩余置信度重新调整不符合分数,并校准每个插值的一个最大分数。在可交换校准和测试情节下,这种结构以至少 $1 - α$ 的概率覆盖每一步的基本事实,同时允许情节内步骤之间的依赖关系。在 R2R 和 REVERIE 数据集上的四项 VLN 政策和三项不合格分数中,ENCP 满足所有报告的关于可见到不可见评估的经验步骤覆盖目标。这些结果表明,ENCP 可以提供与模型无关的不确定性估计,这可能有助于确定 VLN 代理何时应该服从更强大的预测器(包括人工协助)。