论文
RoboIRS:推理时通才机器人策略的内部表示转向
RoboIRS: Inference-Time Internal Representation Steering for Generalist Robot Policies
摘要
尽管保留了部分任务能力,视觉语言动作(VLA)和世界动作模型(WAM)在分布外任务变化下通常会退化。为了恢复这种能力,我们提出了 RoboIRS,一种推理时内部表示转向方法,该方法使用成功和失败的执行轨迹来训练线性分类器,选择与结果相关的干预位置,并导出特定于任务的转向方向,而无需更新策略参数。在使用冻结的 $π0.5$ 策略的 15 个模拟任务中,RoboIRS 将平均成功率从 44.4% 提高到 66.2%,优于替代推理时干预基线,同时几乎不增加推理时间。我们使用相同的 $π0.5$ 策略进一步在真实机器人操作上验证 RoboIRS,并证明其对世界动作模型 Cosmos 策略的适用性,其中平均成功率从 35.4% 提高到 55.4%。这些结果表明,直接引导内部机器人策略表示可以提高机器人策略在推理时的性能。项目网站可访问https://rollingoat.github.io/roboirs/.
