论文

MPCoT:用于测试时间可扩展视觉-语言-动作的奖励引导多路径潜在推理

MPCoT: Reward-Guided Multi-Path Latent Reasoning for Test-Time Scalable Vision-Language-Action

模型推理推理搜索与路径规划

摘要

视觉-语言-动作(VLA)策略在长视野控制中仍然很脆弱,其中一次性动作解码提供有限的推理时间审议。显式的思想链增加了推理深度,但会导致词元生成延迟和间接的文本到操作接口。我们提出了 MPCoT,一种奖励引导的多路径潜在推理框架,具有可配置的深度 K 和宽度 M。MPCoT 初始化 M 个潜在假设,针对 K 个权重绑定步骤对其进行细化,并在动作解码之前对它们进行软聚合。仅训练路径偏好目标结合了专家轨迹一致性、冻结的 Qwen3-VL 进度分数和端点一致性反馈来监督路径评分器。在LIBERO和CALVIN上的匹配协议下,MPCoT提高了长视野性能;消融支持深度、宽度、软聚合和奖励监督的贡献。在五项现实世界的 ALOHA Mini 双手任务中,与匹配的 OpenVLA-OFT 基线相比,平均成功率从 71.3% 增加到 82.0%。这些结果支持潜在审议作为改进执行的一种手段,同时保留操作界面并且不生成推理标记。