用于厘米级洪水深度估计的视觉语言模型的机械可解释性引导选择性 微调
Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation
摘要
城市洪水对交通基础设施造成的威胁不断升级,但没有操作系统能够提供厘米分辨率的实时街道级洪水深度估计。本文提出了三种针对街道图像连续洪水深度估计进行微调的视觉语言模型:FloodLlama-Dense(完全微调的 QLoRA 基线)以及 FloodLlama-MI5 和 FloodLlama-MI6(可解释性引导的稀疏变体),它们分别仅微调通过机械可解释性分析确定的前五个和前六个因果相关的交叉注意层。训练使用虚幻引擎 5 中生成的 281 万张图像合成语料库中的约 61 万张图像子集。该数据集结合了深度增量为 5 厘米的单车辆子集和深度增量为 1 厘米的混合车辆子集,涵盖七种车辆类型、四种天气条件以及 0 到 40 厘米的洪水深度。 FloodLlama-Dense 的 MAE 为 0.40 cm,RMSE 为 1.97 cm,Acc@5cm 为 97.59%。结合线性探测、logits 透镜、中心核对齐 (CKA) 和交叉注意熵的机械可解释性分析揭示了一种两阶段适应模式:L13-L22 层重构视觉表示,而深度优先在 L23 层变得可线性解码。 FloodLlama-MI5 和 FloodLlama-MI6 利用 微调 的这一见解,仅在八个交叉注意力层中的五到六个层中实现了可训练参数减少 86-88%(6.55-786 万与 5440 万),同时精度损失最小。在现实世界基准中,FloodLlama-MI6 的准确率达到 98.62%,而已发布的 STURM-FloodDepth 基准的准确率为 86.61%。