论文
诊断智能体编排的视觉-语言-动作技能组合中的语义切换失败
Diagnosing Semantic Handoff Failures in Agent-Orchestrated Vision-Language-Action Skill Composition
摘要
长期的家务劳动要求机器人掌握许多语言条件技能,但连续技能之间的界限很少是明确的。一项技能可以满足其自身的后置条件,同时使机器人、物体或摄像机视图处于下一个技能无法可靠启动的状态。我们通过代理编排的视觉-语言-动作执行工具来研究 BEHAVIOR-1K 中的语义切换问题。该工具调用从干净的 BEHAVIOR-1K 演示中训练的基于 $π_{0.5}$ 的技能检查点,分配每个技能类型的参数和步骤预算,并使用多视图视觉语言模型验证来决定执行是否应该推进、重试或重新计划。为了将孤立的技能能力与长期组合稳健性分开,我们在两个初始状态分布下评估相同的检查点:干净的技能边界快照和由先前技能产生的链式终端状态。在人工审核的验证下,选定的导航、抓取、放置和开门技能从干净的快照中获得了 77--100% 的成功,但组合的执行轨迹仍然经常因连锁状态而停滞。由此产生的跟踪将失败归因于下一个技能准备情况、目标落地和控制执行,将接近零的任务成功转化为 VLA 技能库接下来必须学习的可操作诊断:对清晰演示所代表的混乱链式状态分布的鲁棒性。