论文
通过偏好优化与可解释视觉语言推理实现可靠的多模态灾害严重程度评估
Towards reliable multimodal disaster severity assessment through preference optimization and explainable vision-language reasoning
摘要
可靠的灾害损失评估需要模型能够提供准确的预测和透明的解释。然而,现有的多模态方法受到注释数据稀缺和推理质量评估不足的限制。本研究提出了一个两阶段训练框架,将监督微调(SFT)和直接偏好优化(DPO)集成在统一的数据构建管道中。从单个人机在环 (HITL) 注释工作流程中,派生出两个互补的数据集,即 ReasoningSet(包含经过验证的 SFT 基本原理)和 PreferenceSet(包含基于 DPO 的对齐的成对基本原理)。该框架使用自动指标、基于模型的评分和人工排名来评估分类性能和解释质量。实验结果表明,与基线相比,SFT 的准确率从 73.64% 提高到 78.29%,Macro-F1 提高了 29%,同时解释质量提高了约 25%。随后的 DPO 对齐进一步增强了 PreferenceSet 的可解释性。 InternVL-3-8B 和 LLaVA-1.5-7B 的交叉模型验证证明了该方法的稳健性和通用性。所提出的框架改进了对代表性不足的轻度损坏案例的检测,减少了高风险的错误分类,并加强了模型推理和人类判断之间的一致性。总体而言,它提供了一种可重复的途径来开发可靠的多模态系统,为应急管理提供可审计、可操作的灾难见解。