论文

RRDF:视觉运动模仿的寄存器路由延迟融合

Register-Routed Delayed Fusion: Rewiring Shortcut-Prone Observation Fusion in Visuomotor Imitation

摘要

视觉运动模仿策略把高维视觉观测与本体感受等紧凑信号结合,其融合拓扑决定两流何时及经由哪些token交互。稠密token融合中,视觉token可能从第一编码器层就直接关注紧凑token,使动作预测性的紧凑线索在空间视觉表示形成早期就施加影响。我们追问控制这条路由是否改善视觉响应与策略行为。我们提出寄存器路由延迟融合(RRDF):屏蔽直接紧凑-视觉注意力,把跨模态交互经学习到的寄存器工作区分阶段进行。其隔离-收集-路由调度保护早期分流前缀,稍后只允许寄存器介导的交换,同时紧凑条件化仍对原生动作生成器可用。五个仿真任务与三个真机任务上,RRDF在标称条件下匹配或改进稠密ACT;四个仿真任务的外观偏移评估与三个真机任务的留出位置评估也偏好RRDF。相位匹配输入探针显示实测的状态-图像敏感度更低,消融表明仅加寄存器不能复现全部增益。结果支持在保留紧凑动作条件化的同时控制跨模态传播。