论文
条件轨迹峰值:单通道多模式策略优于动作块
Conditional Trajectory Peaks: Single-Pass Multimodal Policies over Action Chunks
摘要
多模式模仿学习需要在相同的观察下实现不同的可执行未来,并在重新规划周期中保持一致的行为。我们提出了条件轨迹峰值(CTP),这是一个单通道策略框架,可以联合预测完整的动作块候选、概率质量和轨迹尺度。分布感知峰值专业化 (DAPS) 使用轨迹级后验责任以及质量和尺度调制的重叠约束来专业化轨迹峰值。证据门控轨迹置信传输 (ETBT) 通过可交换候选集之间的几何对应关系保持跨块一致性,同时允许当前的策略证据覆盖历史约束。 CTP在Push-T上的覆盖率达到91.40%; D3IL 避免、对齐和排序 2 的成功率分别为 100.0%、79.72% 和 84.44%。在 LIBERO 上,CTP 的平均成功率为 97.25%。在现实世界的双臂实验中,CTP 在双板任务中保留了两种放置模式,在所有 50 次试验中均取得成功。在瓶子直立和将笔放入支架中时,它保持了与 $π_{0.5}$ 相当的成功率,同时将策略推理延迟从 218.24 毫秒减少到 75.80 毫秒。这些结果表明,单通道轨迹建模可以结合多模态行为、闭环一致性和高效推理。
