论文

AgenticTactileVLA:接触引导执行时监督,用于无需VLA重新训练的通用灵巧操作

AgenticTactileVLA: Contact-Guided Execution-Time Supervision for Generalizable Dexterous Manipulation without VLA Retraining

智能体系统Agent 动作执行与治理

摘要

视觉语言动作策略可以预测可转移的操作策略,但无法在遇到的对象上可靠地实现它:与相同抓握兼容的对象在几何形状和顺应性方面有所不同,并且视觉反馈在闭合遮挡下会降低。 AgenticTactileVLA被视为执行时监控器,它将部分特定于对象的适应从预测转移到物理交互。固定VLA提供接近目标和手部目标;主管决定是否保持透明、改善手指弯曲、保留或释放纠正的配置、将控制权返回给VLA进行重试,或选择兼容的手控机制。它使用手指位置和运动力度反馈作为本体感觉接触证据,既不需要触觉传感器,也不需要VLA重新训练。在配备 BrainCo Revo2 手的 Unitree G1 上,对五个对象排除于VLA训练进行随机匹配块评估,基本VLA完成率为 61.3%,无条件接近失速控制完成率为 72.0%,共享预算下主管完成率为 84.0%;每个物体的增益都是正的,并且在适度的姿态扰动下持续存在。 消融表明,增益不能仅通过延长闭合来解释,并且选择性触发将校正次数减少了 65.7%,而未检测到完成度变化。保留审核显示,在 88.9% 的留出案例中,接受预测会保留,而合规对象会暴露保守的错误拒绝。薄壁杯研究展示了到合规控制的上下文路由,与始终合规的参考相匹配。这些结果表明,接触引导的执行时间调整可以通过调整物理实现而无需特定于对象的重新训练来改进固定VLA到留出对象的对象级泛化。

AgenticTactileVLA:接触引导执行时监督,用于无需VLA重新训练的通用灵巧操作的原论文方法或结果图
图2:AgenticTactileVLA的系统架构。固定VLA提供名义操纵策略,而执行管理器监视其物理实现并仅在需要调整时进行干预。