论文

DIRECT:您应该何时何地在体现规划器中分配测试时间计算?

DIRECT: When and Where Should You Allocate Test-Time Compute in Embodied Planners?

模型推理测试时计算扩展

摘要

视觉语言模型 (VLM) 越来越多地被部署为实体代理的高级规划器,并采用扩展测试时计算以提高能力的新兴策略。然而,我们观察到,这样做会增加延迟、词元使用和失败,同时产生不均匀的结果,通常会减少下游成功的收益,从而限制了具体代理的部署位置。我们认为,选择何时何地进行测试计算对于将前沿性能带入现实世界至关重要。我们引入了 DIRECT,这是一个路由框架,它使用多模式场景上下文来为每个提示分配计算,从而提高了固定模型选择的成功成本 Pareto 边界。在三个主要的缩放轴上,即思想链深度、模型大小和内存历史,我们在 VLABench 和 RoboMME 上的实验表明,测试时计算并不是一个统一的杠杆:不同的轴产生性质不同的能力增益。我们在 DROID 设置中的物理 Franka 手臂上验证了这些见解,涵盖零样本操作和长范围链接,其中我们的路由器匹配或超过了更强大模型的成功率,平均延迟降低了 65%。最终,我们的结果表明,天真地扩展测试时间计算是浪费的,而 DIRECT 可以以一小部分成本在机器人系统中提供前沿级的具体规划。项目页面可以在 jadee-dao.github.io/direct/ 找到。