论文
知道何时停止:通过 VLA 中的内部交叉注意力动态进行自适应动作分块
Knowing When to Stop: Adaptive Action Chunking via Internal Cross-Attention Dynamics in VLAs
摘要
动作分块是现代视觉-语言-动作(VLA)框架中的标准执行策略,但固定的执行范围会在效率和准确性之间进行权衡。短块需要频繁的推理,并可能导致振荡行为,而长块可能会与新观察到的状态不一致。我们通过基于动作专家内部交叉注意力动态的自适应动作分块方法来解决这一限制。我们观察到,随着预测范围的延伸,行动到观察的交叉注意力变得越来越分散,并且其熵上升到稳定状态。这种模式与较高的动作预测误差相关,并提供了一个在线信号,表明当前观察为进一步的开环执行提供了有限的基础。基于这一观察,我们引入了一种 无需训练 截断机制,该机制可以检测持续的高熵平台并在推理过程中动态选择执行范围。该方法使用策略已经计算出的注意力权重,并且引入的额外开销可以忽略不计。对 RoboTwin 2.0、LIBERO 和三个现实世界操作任务的 $π_{0.5}$ 和 X-VLA 的评估表明,与固定水平和自适应分块基线相比,平均任务成功率有所提高,同时保持高效的闭环控制。这些结果表明,交叉注意力动态可以为 VLA 中的自适应动作执行提供实用的内部信号。