论文
GeoArbiter:遥感多模态的可验证性引导证据对齐 LLM
GeoArbiter: Verifiability-Guided Grounding for Remote-Sensing Multimodal LLMs
摘要
遥感多模态 大语言模型 (MLLM) 通常断言图像无法确定的事实,例如设施的身份或功能。坐标键控地理检索可以提供这些缺失的知识,将三个开放 MLLM 的 fMoW 土地利用精度提高 12.06--17.19 点。然而,检索到的记录也可能与可见证据相矛盾,我们发现即使图像具有决定性,模型也经常遵循记录。因此,我们认为来源信任应该依赖于\emph{跨模式可验证性}:地理记录对于图像无法验证的属性最有用,而当它们对视觉上可验证的属性提出异议时最危险。我们引入了 GeoArbiter,这是一个 无需训练 管道,它通过仅注入图像无法验证的地理事实来实现这一原理。与跨属性类型泄漏和偏向是/否响应的仲裁提示不同,内容级过滤保留了 84.69--87.15\% 的完整检索精度增益,在源盲判断下将声明级幻觉减少了 9.58--26.34\%,并提高了对所有三个模型中冲突记录的鲁棒性。这些结果表明,以可验证性为导向的内容选择是一种简单、有效的机制,可以将遥感 MLLM 扎根于易出错的地理知识中。