论文

SafeInferCom:通过验证者引导的中代干预进行机器人任务规划的安全推理时间计算

SafeInferCom: Safe Inference-Time Compute via Verifier-Guided Mid-Generation Intervention for Robotic Task Planning

模型推理应用与实践推理验证与自校正测试时计算扩展机器人

摘要

大型推理语言模型 (LRLM) 支持机器人任务规划的多步推理,但持续推理可能会覆盖有效的中间计划或导致约束违规未解决,从而降低规划可靠性并浪费推理时间计算。我们开发了一个推理时间监视器,可以在不破坏原始解码轨迹的情况下公开和验证中间计划。在此监视器的基础上,我们提出了 SafeInferCom,这是一个正式的验证者引导框架,可保留有效的中间计划并在生成过程中指导错误纠正。跨多个 LRLM 和规划领域的实验揭示了一次性推理下的推理响应不一致和有限的自我纠正。相对于一次性推理,SafeInferCom 提高了规划成功率并加速了错误纠正。当与迭代细化相结合时,与单独细化相比,它可以进一步提高成功率,同时减少token使用。我们还在 VirtualHome 中评估 SafeInferCom 并提供真实的机械臂演示。