论文

DTRC:面向离线视觉控制的定向时间表征

Directed Temporal Representations for Offline Visual Control

模型训练智能体系统应用与实践参数高效训练Agent 规划机器人

摘要

预测世界模型为控制提供紧凑的视觉表示。控制需要与时间可达性相一致的潜在几何形状,而不仅仅是预测相似性。我们引入了控制的定向时间表示(DTRC),它从冻结的 LeWorldModel(LeWM)特征之上的离线视觉轨迹学习这样的几何形状。 DTRC 在学习的控制表示上构建有向时间准度量。短程时间偏移校准距离尺度。自举目标将时间可达性扩展到更长的视野。动作条件一致性使表示与局部转换动态保持一致。由此产生的距离估计时间到达成本,并且它在转换过程中的变化定义了与目标相关的时间进度。我们使用这个进展信号作为直接目标条件策略学习的时间Critic。模型辅助目标在行为支持和动态一致性约束下提供了额外的训练时间细化。在十个视觉控制任务中,DTRC 相对于规划和直接策略基线实现了强大的目标条件控制性能。对四个 LeWM 任务的持续诊断显示出一致的短程时间校准、任务相关的远程和方向结构以及积极的过渡级进展。时间监督改进了所有四个 LeWM 任务中相同的流策略参数化,而结果策略在测试时直接起作用,无需迭代轨迹搜索。

DTRC:面向离线视觉控制的定向时间表征:论文原图
图 1:定向时间表示学习和策略训练概述。 (a) 离线视觉轨迹在冻结的 LeWM 特征之上提供时间监督。 (b) DTRC 学习具有定向时间准度量的控制表示。对称度量组件定义基本几何形状,顺序敏感残差表示方向状态目标成本。 (c) 时间距离缩短衡量目标相关进展。由此产生的时间优势权重记录了直接政策学习的延续。