论文
SceneMiner:用于统一 BEV 场景挖掘的身份保护多任务 微调
SceneMiner: Identity-Preserving Multi-Task Fine-Tuning for Unified BEV Scene Mining
摘要
从驾驶日志中挖掘困难的、安全关键的场景因缺乏难度标签而受到瓶颈,并且没有单一代理、碰撞风险、轨迹模糊性或语义稀有性足以单独找到此类场景。我们推出了 SceneMiner,这是一个统一的、仅包含相机的鸟瞰管道,它在一次前向传递中从冻结的视觉语言主干发出互补的挖掘信号,没有 LiDAR 或雷达:用于文本提示场景搜索的检索嵌入、多标签场景标签分布和基于物理的连续风险评分(运动预测是副产品,而不是贡献)。构建这样的多头模型揭示了我们的中心发现,即一种我们称之为跨任务干扰的故障模式:添加或升级一个头会改变共享激活流并降低权重冻结的兄弟头的性能,因此仅冻结参数是不够的。我们的贡献是身份保留多任务 微调,通过对每个新子模块进行零初始化并冻结提供共享流的每个参数来消除这种干扰。因此,在仅训练约 102k 参数的同时,挖矿头保持位相同。通过将每个场景池化为 32 个视觉标记,标记头在 20 个场景标签上达到 mAP 0.4614(micro-F1 0.5557),并且嵌入头支持文本提示检索,并经过定性验证。代码位于:https://anonymous.4open.science/r/sceneminer_anonymous-64E5