论文
表格基础模型可以指导机器人策略学习的探索吗?
Can Tabular Foundation Models Guide Exploration in Robot Policy Learning?
摘要
机器人高维连续控制的策略优化仍然是一个具有挑战性的问题。主要方法本质上是局部的,通常需要广泛的调整和精心选择的初始猜测才能获得良好的性能,而更全局和对初始化不太敏感的搜索方法通常会产生高昂的部署成本。我们提出了 TFM-S3,这是一种表格混合局部全局方法,用于以有限的部署成本改进机器人策略学习的全局探索。我们将高频本地更新与间歇性全局搜索交织在一起。在每一轮搜索中,我们通过 SVD 构建动态更新的低维策略子空间,并在该空间内执行迭代代理引导细化。预训练的表格基础模型可以从小型上下文集中预测候选人的回报,从而以有限的部署成本实现大规模筛选。连续控制基准的实验表明,在相同的部署预算下,与 TD3 和基于群体的基准相比,TFM-S3 持续加速了早期收敛并提高了最终性能。这些结果表明,基础模型是一种强大的新工具,可用于创建样本高效的策略学习方法,以实现机器人的持续控制。