论文

E-TTS:一种新的机器人操作测试时间缩放框架

E-TTS: A New Embodied Test-Time Scaling Framework for Robotic Manipulation

模型推理测试时计算扩展

摘要

最近,一些工作已经做出了早期尝试来研究具体任务的测试时间缩放。然而,仍有两大挑战尚未解决:(1)推理可以有效提高策略的性能,但其扩展机制很少被研究; (2) 历史信息至关重要,因为具体任务本质上是长期的和连续的,由于缺乏历史背景的利用,仅仅依靠当前的观察来衡量行动规模是不够的。为了应对这些挑战,我们引入了 E-TTS,这是一种模块化、即插即用的体现测试时间缩放框架,它通过视觉语言验证器的历史感知迭代细化,统一了机器人操作的推理和动作缩放。为了支持联合推理-动作缩放,E-TTS 以成对的方式执行推理-动作联合采样和评分。为了更好地利用历史信息,E-TTS 使用历史缓冲区来存储历史上下文,然后推理和动作验证器使用历史上下文来评估采样的候选者。与传统的开环TTS方法不同,E-TTS在采样过程中引入反馈生成,形成闭环迭代细化机制,提高推理效率和环境适应性。每个组件都充当独立且可组合的模块,允许根据任务要求进行灵活和自适应的配置。为了评估我们框架的优势,我们在 4 个不同的基准、6 个环境、3 个实施例和 4 个基本视觉-语言-动作模型中进行了实验。实验结果表明,在不需要额外的专家数据收集或重新训练的情况下,E-TTS 持续提高性能,在模拟中实现高达 33.14% 的提升,在现实场景中实现高达 26.62% 的提升。