当推理有助于行动时:监控和指导愿景-语言-行动政策中的思想链
When Reasoning Helps Action: Monitoring and Steering Chain-of-Thought in Vision-Language-Action Policies
摘要
支持推理的 VLA 策略公开了思想链 (CoT) 跟踪,这些跟踪似乎可以解释和指导其操作,从而通过推理监控和纠正为运行时安全创建潜在的接口。在这项工作中,我们定义并实施了两个评估轴,用于评估该界面何时可以改善具体行为:可纠正性,衡量在生成过程中是否可以检测和改进不可靠的推理,以及可操作性,衡量推理纠正是否会在预期方向上产生行为上有意义的变化。为了实现可纠正性,我们引入了实用引导思想链(TRUST)的词元级奖励,这是一种离线训练的价值模型,可以根据部分前缀预测最终推理的正确性,并使用这些估计来监控和选择性地引导冻结 VLA 策略中的推理生成。在 Alpamayo 1.5 驾驶 VLA 上,TRUST 以 88.9% 的准确度监控正确性,并将推理正确性从 75.9% 提高到 90.0%。在 AlpaSim 中基线定义的挑战性子集上,相对于非转向策略,TRUST 将碰撞率降低了 30.4%,最大轨迹误差降低了 11.5%,性能优于计算匹配的 Best-of-4 基线。在 DeepThinkVLA 操纵 VLA 上,TRUST 将掌握状态声明的正确性从 69.3% 提高到 90.2%,将动作选择声明的正确性从 68.8% 提高到 85.9%,但 LIBERO-Plus 上的闭环任务性能基本保持不变。实证分析揭示了 Alpamayo 1.5 中意图一致的行为影响,但 DeepThinkVLA 中的影响有限,有助于解释这些不同的任务级别结果。总之,我们的结果表明,推理正确性的提高并不自动意味着体现性能的提高,从而在使用 CoT 作为运行时安全接口时激发对可纠正性和可操作性的评估。