论文

RoboIRS:推理时通才机器人策略的内部表示转向

RoboIRS: Inference-Time Internal Representation Steering for Generalist Robot Policies

模型推理解码与生成控制

摘要

尽管保留了部分任务能力,视觉语言动作(VLA)和世界动作模型(WAM)在分布外任务变化下通常会退化。为了恢复这种能力,我们提出了 RoboIRS,一种推理时内部表示转向方法,该方法使用成功和失败的执行轨迹来训练线性分类器,选择与结果相关的干预位置,并导出特定于任务的转向方向,而无需更新策略参数。在使用冻结的 $π0.5$ 策略的 15 个模拟任务中,RoboIRS 将平均成功率从 44.4% 提高到 66.2%,优于替代推理时干预基线,同时几乎不增加推理时间。我们使用相同的 $π0.5$ 策略进一步在真实机器人操作上验证 RoboIRS,并证明其对世界动作模型 Cosmos 策略的适用性,其中平均成功率从 35.4% 提高到 55.4%。这些结果表明,直接引导内部机器人策略表示可以提高机器人策略在推理时的性能。项目网站可访问https://rollingoat.github.io/roboirs/.

RoboIRS:推理时通才机器人策略的内部表示转向的原论文方法或结果图
图 2:所提出的 RoboIRS 框架概述。 (a) RoboIRS 通过向选定的残差流表示添加缩放的引导向量来干预变压器块之间,而不更新策略参数。 (b) 为了构建引导向量,从成功和失败的执行轨迹中收集残差流表示,并用于训练线性分类器。分类器权重提供在推理期间注入残余流的转向方向。