论文
集成检索增强推理、目标感知与损伤分析的多模态AI系统
Integrated Multimodal AI System for Retrieval-Augmented Reasoning, Object Sensing, and Damage Analysis
摘要
本工作提出一个用于损伤评估的统一多模态AI系统,整合了检索增强生成(RAG)模型、热频谱感知、视觉基础模型流水线以及探索性无线信号感知。系统开发了RAG组件,将本地部署的语言模型锚定于项目专用文档,包括专门的损伤等级分类标准,以缓解推理过程中的幻觉。与静态少样本提示的受控对比表明,动态检索改善了锚定效果与事实一致性。我们进一步将基于向量的RAG与通过实体-关系抽取构建的知识图谱变体进行比较,结果显示图检索在需要跨文档推理的损伤评估查询上产生更强的回答,这启发采用稠密、稀疏与图感知相结合的混合检索。为弥补EO(对地观测)影像在不利光照与天气条件下的局限,系统采用红外(IR)/热感知进行目标检测与分割。我们的检测器生成候选检测结果,实现了对广泛目标的更优分割。红外与可见光谱的配对跟踪实验揭示了失效模式,促使采用多模态融合以实现稳健的目标检测与损伤分析。系统还利用视觉基础模型与视觉-语言模型生成合成损伤图像,并高准确率地分类损伤严重程度,支撑下游损伤评估模型的训练与验证。最后,探索性的无线感知展示了在EO与红外感知均失效的场景中探测人员存在、运动及事后环境变化的潜力。
