论文
ReCAPA:缓解级联失败的分层预测式纠正
ReCAPA: Hierarchical Predictive Correction to Mitigate Cascading Failures
摘要
视觉-语言-动作(VLA)系统在多模态环境中遵循指令执行多步任务。近期的VLA方法通常依赖事后纠正机制,或在固定的任务分解与对齐方案下运行。然而一旦中间步骤被错误指定,局部误差会沿后续步骤传播并最终累积成级联失败。为缓解这种复合效应,我们提出预测对齐与规划架构(Predictive Alignment and Planning Architecture),一个利用预测与对比在动作、子目标和轨迹三个层面调整偏差的框架。使用基于Sinkhorn的模块和Score-field模块在所有层面强制语义对齐。预测纠正与对齐在训练期间联合更新动作生成器,使其能够调整细粒度步骤以与整体意图保持一致。我们进一步引入两个新指标来量化任务中的误差传播与恢复过程,捕捉错误在长程执行中如何扩散与消退。实验表明,ReCAPA在VisualAgentBench、MineDojo和AI2-THOR等具身智能体基准上取得有竞争力的结果,超越强大的专有和开源大语言模型基线。
