论文

方向盘上睡着了:JEPA 在评估新驾驶数据方面的局限性

Asleep at the Wheel: JEPA's Limitations in Evaluating Novel Driving Data

模型评测鲁棒性、公平性与可信度评测

摘要

现代自动驾驶车队记录的视频数量远多于人类审核人员可以检查的数量。这就激发了对自动剪辑分类机制的需求,以显示稀有且值得审查的剪辑,以便可以对驾驶模型进行微调,以更好地处理不理想的情况。我们测试了一种无标签方法,该方法通过自监督联合嵌入预测架构(JEPA)的预测误差“新颖性”对片段进行评分;冻结的 V-JEPA 视频编码器与轻量级预测器头配对,以重建屏蔽剪辑嵌入,并且嵌入难以预测的剪辑被标记为有趣。在一个现实的协议下进行评估,该协议在一个数据集上进行训练并针对其他数据集进行测试,这种方法似乎非常有效。我们证明,这种明显的成功实际上是领域转移的结果:在从单个数据集得出的公平基准上,这种机制崩溃了,并且与简单的无训练基准相当。对相同冻结嵌入进行轻度监督的探测会导致平均精度几乎翻倍,这表明瓶颈确实是自监督目标,而不是表示。我们将此作为一项评估自我监督学习有效性的研究,其中跨数据集协议可以默默地奖励领域分离而不是新颖性。