论文
揭秘 VLA 在接触丰富的任务中失败的时间和原因以及如何修复它们
Demystifying When and Why VLAs Fail in Contact-Rich Tasks and How to Fix Them
摘要
我们解决了理解视觉-语言-动作模型何时以及为何难以应对需要精确物理交互的接触丰富的操作任务的问题。之前的工作主要集中在通过力增强架构和训练时间正则化器来解决接触故障,但这些故障的根本原因仍未得到充分探索。我们确定了这一差距背后的两种不同的故障模式。精度失败的根源在于流程匹配策略训练不匹配,而力量失败则源于力量信号的独特结构。我们通过有针对性的机制来解决每种故障模式,并将其合并到 FACT 中,在对近 2,500 次真实执行轨迹的评估中,五项接触丰富的任务的平均成功率为 66%,而最佳先前基线的平均成功率为 41%。