论文

安全行动还不够:视觉语言行动策略的可行未来解码

A Safe Action Is Not Enough: Feasible-Future Decoding for Vision-Language-Action Policies

模型推理解码与生成控制

摘要

安全的行动不一定是可行的。在冻结的视觉-语言-动作 (VLA) 策略下,动作可能是本地可接受的,但不会留下策略支持的安全完成任务的路线。我们称之为可行性-可能性差距:可能性对当前行动进行排序,而可行性则取决于其之后的未来。我们推导出受限于安全任务完成的历史条件策略环境轨迹定律的精确下一个块边缘。该推导揭示了具有两个作用的候选相关可行未来质量:其支持记录在冻结延续过程下是否仍然可能安全完成,其大小衡量保留了多少加权安全完成质量。精确的在线评估是不切实际的,因此我们开发了一种选择性的有限候选近似,导出恢复最佳保留的可行候选的条件,并将其实例化为警报触发的无需训练重新排序器。在 Safety-CHORES 上,VICS-G 在六种设置中将平均累积安全成本降低了 1.9%-57.5%,同时与成功的策略采样保持在 2.5 个百分点以内,平均事件长度保持在 0.82 步以内。生成的解码器与精确的策略相关安全完成目标绑定,但既不需要重新训练基础策略,也不需要重新训练在线轨迹执行轨迹。

安全行动还不够:视觉语言行动策略的可行未来解码的原论文方法或结果图
图 1:当进展停滞时,找到前进的方向。在选定的 ObjectNav 片段(导航到苹果)中,策略采样失败,成本为 $23$,而本地鲁棒性解码器 RCD 提前结束,成本为 $3$。 VICS-G打破了失败重试的循环,以$11$的代价达到目标。圆圈标记了前进失败的区域。这三者都会产生安全成本;完整的轨迹和干预轨迹见附录 A。