论文

视觉-语言-行动模型的动态执行承诺

Dynamic Execution Commitment of Vision-Language-Action Models

智能体系统Agent 动作执行与治理

摘要

视觉-语言-动作(VLA)模型主要采用动作分块,即在单个前向传递中预测并提交短期的连续低级动作,以分摊大规模主干的推理成本并减少每步延迟。然而,将这些多步骤预测提交给现实世界的执行需要平衡成功率和推理效率,这一决策通常由每个任务调整的固定执行范围决定。这种启发式方法忽略了预测可靠性的状态依赖性质,导致动态或分布外环境中的性能脆弱。在本文中,我们介绍了 A3,一种自适应动作接受机制,它将动态执行承诺重新构建为自推测的前缀验证问题。 A3 首先通过分组抽样计算行动的轨迹共识分数,然后选择一个有代表性的草案并优先考虑下游验证。具体来说,它强制执行:(1)共识有序的条件不变性,通过判断低共识行为在以高共识行为为条件重新解码时是否保持一致来验证低共识行为; (2) 前缀封闭顺序一致性,它通过仅接受从头开始的最长连续的已验证操作序列来保证物理转出完整性。因此,执行范围成为满足内部模型逻辑和顺序执行约束的最长可验证前缀。跨不同 VLA 模型和基准测试的实验表明,A3 消除了手动水平调整的需要,同时实现了执行鲁棒性和推理吞吐量之间的卓越权衡。