论文

ReCAPA:缓解级联失败的分层预测式纠正

ReCAPA: Hierarchical Predictive Correction to Mitigate Cascading Failures

智能体系统Agent 规划

摘要

视觉-语言-动作(VLA)系统在多模态环境中遵循指令执行多步任务。近期的VLA方法通常依赖事后纠正机制,或在固定的任务分解与对齐方案下运行。然而一旦中间步骤被错误指定,局部误差会沿后续步骤传播并最终累积成级联失败。为缓解这种复合效应,我们提出预测对齐与规划架构(Predictive Alignment and Planning Architecture),一个利用预测与对比在动作、子目标和轨迹三个层面调整偏差的框架。使用基于Sinkhorn的模块和Score-field模块在所有层面强制语义对齐。预测纠正与对齐在训练期间联合更新动作生成器,使其能够调整细粒度步骤以与整体意图保持一致。我们进一步引入两个新指标来量化任务中的误差传播与恢复过程,捕捉错误在长程执行中如何扩散与消退。实验表明,ReCAPA在VisualAgentBench、MineDojo和AI2-THOR等具身智能体基准上取得有竞争力的结果,超越强大的专有和开源大语言模型基线。

ReCAPA:缓解级联失败的分层预测式纠正:论文配图
图 1:ReCAPA 框架概述。 LLM首先通过任务分解生成智能体的原始计划。分层预测校正模块执行任务并产生细粒度的校正信号来指导执行更新。