论文

仅在需要时思考:视觉-语言-动作操纵中选择性慢路径干预的及时权威控制

Think Only When Needed: Prompt-Authority Control for Selective Slow-Path Intervention in Vision-Language-Action Manipulation

上下文与知识上下文工程

摘要

检索可以高效且有效地增强冻结的视觉-语言-动作(VLA)策略,而无需重新训练,但检索到的文本一旦进入执行的提示,就成为控制干预。在匹配审核中,原始附加文本将平均成功率从 92.47\% 降低到 3.00\%,而有意义和长度匹配的无意义附加在所有 500 个状态上均失败。这个结果表明\emph{提示形式崩溃}:改变指令形式,而不是添加有用的语义,可以主导执行。我们引入了 TOWN-VLA(仅在需要时思考),这是一个提示权限界面,它将候选人生成与更改策略输入的权限分开。固定的兼容性规则授权规范的紧凑指令;否则界面将完全恢复原来的Base提示符。在 900 条审计路由中,每条路由都遵循此契约:525 条路由使用匹配的哈希值恢复 Base,并且所有 375 条授权提示都保留任务签名。在匹配的 $4\times7$ LIBERO-Plus 评估中,每种方法 10{,}030 集,成功率从 69.5\% 上升到 73.1\%($+362$ 集;95\% CI 1.89--5.45 点),在六个扰动轴和所有四个套件上都有所改进。在具有冻结 \pizero Five{} 检查点的物理 PiPER 手臂上,每种方法经过 150 次试验,成功率从 52.7\% 上升到 78.7\% ($p=3.16\times10^{-6}$)。对于冻结的控制者,可以立即执行授权;无预言机准入校准是下一个部署目标。