论文
ChunkFlow:迈向连续性一致的分块策略学习
ChunkFlow: Towards Continuity-Consistent Chunked Policy Learning
摘要
视觉语言动作(VLA)模型越来越多地采用分块动作头来满足实时约束;然而,这会引入边界抖动:连续块之间的重叠区域通常会产生不一致的预测,从而降低时间一致性和任务成功率。现有的方法,例如推理时间混合,只是重新加权不匹配的建议,而不纠正潜在的错误,导致在有偏差或嘈杂的历史下出现残留积累。我们提出了 ChunkFlow,一种用于分块策略的无缝感知训练和执行框架,使块结构与边界执行保持一致。它将每个块划分为冻结、可编辑和未来区域,在执行时应用确定性重叠混合,并使用接缝以及一阶和二阶连续性损失训练原始预测。历史损坏和计划采样提高了对执行历史错误的鲁棒性,而 AWAC 微调 阶段可以在不删除这些结构正则化器的情况下调整策略。在温和平滑度假设下,预混合接缝差异可证明随着重叠的增加而衰减。 CALVIN、LIBERO 和真实机器人上的实验表明,成功与稳定性之间的权衡与低延迟推理得到了改善。项目页面:https://cytoderm-ai.github.io/chunkflow。