论文
TERRA:学习可跨状态复用的机器人潜动作
TERRA: Learning Transportable Latent Actions through Temporal Effect Representation and Relational Alignment
摘要
潜在动作使用从视觉转换推断出的类似动作的代码来监督机器人策略,它们的有用性取决于两个问题:代码从转换中保留什么,以及在不同的初始状态下重用时它是否仍然意味着相同的事情。第一个是时间上的张力:端点差异忽略了运动如何展开,而完整的序列则允许令人讨厌的变化。第二个是通过重构而开放的,它只观察潜伏及其来自的状态。我们认为这两个问题可以在同一个地方得到回答。 TERRA(时间效应表示和关系对齐)通过紧凑的时间效应、其净特征变化以及低阶窗口内动态分量来描述过渡,并从该效应中学习连续的潜在特征。然后,相同的效果空间可用作重用的参考:效果锚定传输 (EAT) 解码其他初始状态中的潜在变量,并将所得效果锚定到在其源处观察到的效果,以便潜在变量由其在上下文中所做的操作决定,而不仅仅是由其来自的转换决定。凭借冻结的线性读取器,TERRA 比 UniVLA 和 LAPA 式基线更准确地预测动作,在视觉干扰下降解得更慢,并且随着接收者上下文移得更远,传输的过渡忠实于捐赠者的动作;相同的预算控制表明,这些收益主要来自 EAT。在匹配的预训练规模下,整个系统在 LIBERO 上的平均成功率达到 93.4%,而 UniVLA 的平均成功率为 91.8%。