论文
PRTS:基于对比表征的基元推理与任务系统
PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations
摘要
视觉-语言-动作(VLA)模型凭借强大的视觉-语言先验推动机器人控制发展。然而,现有VLA主要将预训练框定为监督式行为克隆,忽视了机器人学习的根本性质——一个需要理解时间性任务进程的目标达成过程。我们提出PRTS(Primitive Reasoning and Tasking System),一个通过目标条件强化学习重构预训练的VLA基础模型。通过将语言指令视为目标并采用对比强化学习,PRTS学习一个统一嵌入空间:状态-动作与目标嵌入的内积近似对数折扣目标占据度,即从当前状态-动作到达语言指定目标的概率,从而在静态语义匹配之外定量评估物理可行性。PRTS直接从离线轨迹获取这种密集的目标可达性监督而无需奖励标注,并通过角色感知因果掩码将其融入VLM主干,相较朴素行为克隆的开销可以忽略。这一范式赋予高层推理系统内在的目标可达性感知,衔接语义推理与时间性任务进程,并进一步惠及目标条件动作预测。在167B token的多样操作与具身推理数据上预训练后,PRTS在LIBERO、LIBERO-Pro、LIBERO-Plus、SimplerEnv以及包含14个复杂任务的真实世界套件上达到最先进性能,在长程、接触密集与零样本新指令设定下收益尤为显著,证实注入目标可达性感知能显著提升通用机器人基础策略的执行成功率与长程规划能力。
