论文
FlexLAM:解决潜在行动学习中的瓶颈权衡
FlexLAM: Resolving the Bottleneck Trade-off in Latent Action Learning
摘要
潜在动作在无动作视频和下游决策之间提供了一个紧凑的接口,但现有的潜在动作模型 (LAM) 迫使每次转换都通过固定容量瓶颈。我们确定了一个瓶颈权衡:过于严格的代码可能会丢弃动作对齐所需的转换线索,而过于宽松的代码则保留额外的转换变化,当对齐标签稀缺或分布狭窄时,必须解决这些变化。 FlexLAM 将这种固定容量替换为由嵌套 dropout 训练的可变长度潜在动作,生成前缀有效的代码,首先捕获紧凑的转换结构,仅在需要时添加细节,而不会产生新的架构或损失。在标准稀缺标签监督和低回报单任务对齐压力测试下,单个 FlexLAM 在每个评估的 词元预算 上都匹配或超过单独训练的固定容量 LAM,这表明 FlexLAM 不仅可以在推理时进行调整,而且可以在同一 词元预算 上学习更好的潜在动作接口。同一模型支持推理时间词元预算调整而无需重新训练,并且 FlexLAM 改进了 Ego4D 转换重建。这些结果表明,可变长度潜在动作是对潜在动作模型、潜在动作世界模型和视频预训练动作接口中固定容量瓶颈的无架构、直接升级。