论文

PRTS:基于对比表征的基元推理与任务系统

PRTS: A Primitive Reasoning and Tasking System via Contrastive Representations

模型训练强化学习

摘要

视觉-语言-动作(VLA)模型凭借强大的视觉-语言先验推动机器人控制发展。然而,现有VLA主要将预训练框定为监督式行为克隆,忽视了机器人学习的根本性质——一个需要理解时间性任务进程的目标达成过程。我们提出PRTS(Primitive Reasoning and Tasking System),一个通过目标条件强化学习重构预训练的VLA基础模型。通过将语言指令视为目标并采用对比强化学习,PRTS学习一个统一嵌入空间:状态-动作与目标嵌入的内积近似对数折扣目标占据度,即从当前状态-动作到达语言指定目标的概率,从而在静态语义匹配之外定量评估物理可行性。PRTS直接从离线轨迹获取这种密集的目标可达性监督而无需奖励标注,并通过角色感知因果掩码将其融入VLM主干,相较朴素行为克隆的开销可以忽略。这一范式赋予高层推理系统内在的目标可达性感知,衔接语义推理与时间性任务进程,并进一步惠及目标条件动作预测。在167B token的多样操作与具身推理数据上预训练后,PRTS在LIBERO、LIBERO-Pro、LIBERO-Plus、SimplerEnv以及包含14个复杂任务的真实世界套件上达到最先进性能,在长程、接触密集与零样本新指令设定下收益尤为显著,证实注入目标可达性感知能显著提升通用机器人基础策略的执行成功率与长程规划能力。

PRTS:基于对比表征的基元推理与任务系统:论文配图
图 1:PRTS 概述。 PRTS 基于 Qwen3-VL-4B-Instruct 构建,涉及两个训练阶段。 (i) 在预训练阶段,主干网消耗多视图视觉标记(Qwen ViT)、文本本体感受状态标记、语言指令标记和 FAST 标记化 AR 动作标记的统一标记序列,然后是两个辅助块 <CRL_action> 和 <CRL_goal>,其中最后的可学习标记 <|action_end|> 和 <|goal_end|> 通过轻量级 MLP 头传递(右)产生状态-动作表示 ψ⁡(st,𝐚t)\phi(s_{t},\mathbf{a}_{t}) 和目标表示 ψ⁡(l)\psi(l)。角色感知因果掩码(左下)可防止五个令牌角色之间的信息泄漏: <CRL_action> 令牌仅关注视觉和本体感觉; <CRL_goal> token仅参与其自己的区块; AR 动作token保持标准的因果注意力。所有三个输出 - 离散动作 logits、 phi⁡(st,𝐚t)\phi(s_{t},\mathbf{a}_{t}) 和 ψ⁡(l)\psi(l) - 均在单次前向传递中生成,并在具有时间加权和下一个令牌交叉熵损失的双向对比 (InfoNCE) 损失下联合训练,以便ψ​(st,𝐚t)⊤​ψ​(l)≈log⁡Qlπ​(st,𝐚t)\phi(s_{t},\mathbf{a}_{t})^{\top}\psi(l)\approx\log Q^{\pi}_{l}(s_{t},\mathbf{a}_{t})。行动专家在此阶段缺席。 (ii) 在训练后阶段,附加一个新初始化的基于 DiT 的流程匹配动作头,并通过 ℒFM\mathcal{L}_{\text{FM}} 进行微调,以产生连续的动作块。