论文

视觉-语言-行动模型真的如其所说吗?论忠实性在具身推理中的作用

Do Vision-Language-Action Models Mean What They Say? On the Role of Faithfulness in Embodied Reasoning

模型训练奖励建模与过程监督

摘要

体现思想链已成为一种有前景的机制,可增强黑盒视觉语言动作(VLA)模型中的机器人决策和可解释性。然而,这种口头表达的思想链是否真实反映了政策的基本决策过程仍然知之甚少。我们区分功能推理和忠实推理,其中推理可以提高任务绩效,而忠实推理则真实地反映了策略的内部决策过程。我们认为,SoTA 对齐策略提供了 忠实性 的必要但不充分的概念,承认推理的中间步骤可以通过混杂因素掩盖行动预测中的因果关系(例如,在环境中没有根据、内部不连贯或不一致的推理),从而限制了政策的泛化。我们通过对自动驾驶 SoTA 推理模型的人工评估来研究这一差距,揭示推理质量与下游轨迹改进之间的不一致耦合。然后,我们通过博学的批评家 Pinocchio 来操作体现 忠实性 的行为代理,对观察证据一致性和逐步连贯性进行评分,并使用该批评家作为 后训练 中的密集奖励信号,这是一种具有强化学习的体现策略。在保留的驾驶基准中,我们经过训练的规划器将 忠实性 分别比 SoTA 对齐和轨迹误差 后训练 基线提高了 4% 和 18%,同时保持了具有竞争力的下游任务性能。最后,在合成的分布外测试集上,忠实性 的 后训练 将策略对罕见反事实场景的响应能力提高了 SoTA 策略的 1.6 倍,这表明忠实的推理痕迹有助于更强大、可泛化和可解释的体现智能。项目页面:https://mjf-su.github.io/pinocchio/