论文

PhysReflect-VLA:可靠视觉-语言-行动策略的物理可行性和自我反思调节

PhysReflect-VLA: Physical Feasibility and Self-Reflective Regulation for Reliable Vision-Language-Action Policies

智能体系统Agent 动作执行与治理

摘要

长视距机器人操作对物理上不可行的转换、接触引起的干扰以及执行过程中缺乏有效的自我纠正高度敏感。尽管视觉-语言-动作(VLA)模型通过多模态学习提供了强大的任务基础,但它们通常以前馈方式生成动作,而无需明确检查物理可行性或在线诊断执行错误。我们提出了 PhysReflect-VLA,这是一种即插即用的执行时可靠性框架,它通过闭环控制管道中的物理可行性评估和结构化自我反思来增强 VLA 策略。可行性运算符评估候选操作是否会导致动态一致的状态转换;动作解释操作符验证转换一致性;基于 LLM 的反射模块分析状态差异,为后续操作生成纠正指导。两阶段训练过程稳定了可行性建模并将反射集成到控制回路中。多阶段、接触丰富的现实世界操作任务的实验表明,与代表性 VLA 基线相比,阶段稳定性和整体任务成功率得到了持续改善,平均增益为 5.4%。消融结果进一步表明,可行性检查和基于反射的校正都有助于提高执行鲁棒性。这些结果凸显了嵌入物理一致性检查和在线自我反思对于可靠的长视野机器人操作的重要性。