论文
TapSampling:使用任务进度理解验证器进行机器人操作的推理时间采样
TapSampling: Inference-Time Sampling with a Task-Progress-Understanding Verifier for Robotic Manipulation
摘要
现有的体现控制研究表明,通过扩展训练数据和模型大小可以显着提高性能。相反,我们探索推理时间策略作为替代轴。非确定性生成模型,例如扩散模型和自回归模型,已在体现控制领域得到广泛采用。然而,单次推理范式限制了它们的性能。在本文中,我们提出了 \textbf{TapSampling},一种用于推理时间采样的即插即用框架。首先,我们引入了一个 Action-VAE,它通过将策略生成的初始动作映射到压缩的后验分布来表示低维潜在空间中的动作,从中可以提取任意数量的潜在样本并将其解码为近似真实动作分布的候选动作。其次,我们将动作验证制定为任务进度结果预测,使用机器人数据集的内在顺序结构来训练基于语义的验证器以进行可解释的动作选择。此外,TapSampling 是一个与策略无关的框架。在模拟和现实环境中进行的大量实验表明,我们的方法大大改进了多种通用策略,而无需进一步进行策略微调。代码和模型可在项目页面获取。