论文

CereVLA:受小脑启发的后果意识残差治理,实现高效的视觉-语言-行动执行

CereVLA: Cerebellum-Inspired Consequence-Aware Residual Governance for Efficient Vision-Language-Action Execution

智能体系统Agent 动作执行与治理

摘要

动作块视觉语言动作(VLA)策略提高了推理效率,但提交的动作块内的有限反馈可能会导致累积的执行错误。残差适应可以纠正此类偏差,而无需重新训练 VLA;然而,现有的校正通常针对参考操作一致性进行优化,而没有明确考虑其下游后果。为了解决这一限制,我们提出了受小脑启发的结果感知残差治理(CereVLA),这是一个统一的框架,它将轻量级残差细化和预测结果评估集成到冻结的 VLA 执行中。首先通过基于流的残差细化生成纠正措施,然后通过循环状态空间模型和历史感知分类器评估其短期和区间范围后果。预计不利的剩余修正会被轻量级调节器选择性地抑制。与 LIBERO-10 和 LIBERO-GOAL 上最先进的方法的比较证明了 CereVLA 的有效性。在 SO-101 上,相对于冻结的 SmolVLA 基线,CereVLA 将任务成功率从 57.5% 提高到 90.0%,并将成功试验中的平均控制步骤减少 19.6%。