论文
RS-OPSD:用于超高分辨率遥感 VQA 的可靠特权策略自蒸馏
RS-OPSD: Reliable Privileged On-Policy-Self-Distillation for Ultra-High-Resolution Remote Sensing VQA
摘要
超高分辨率 (UHR) 遥感视觉问答 (VQA) 需要模型来解析极大图像中的小视觉证据。现有方法通常依赖于推理时的标记修剪、视觉搜索或工具增强推理。相反,我们研究放大视觉特权的好处是否可以内化到模型中。我们引入了 RS-OPSD,这是一种用于 UHR 遥感 VQA 的可靠的特权on-policy自蒸馏 (OPSD) 框架。为了提供高质量的特权信息和明确的问题相关证据,我们构建了 GeoEvidence-6K,其中包含跨七个任务类别的 6,750 个 VQA 样本,并带有证据区域注释,并开发了用于可扩展注释的人工反馈引导技能细化 (HF-SR)。为了解决因裁剪区域紧张而导致的上下文丢失以及来自不完美教师的相互冲突的信号,RS-OPSD 引入了上下文保留视觉特权 (CPVP) 和正确性对齐蒸馏 (CAD)。在推理时无需任何额外的视觉搜索或工具调用,RS-OPSD 在 XLRS-Bench、MME-RealWorld-RS 和 LRS-VQA 上实现了最先进的 (SOTA) 性能,比之前同等规模的 SOTA 模型平均高出 4.0 个百分点。此外,我们的 2B 变体 RS-OPD-Lite 超越了大多数 8B 规模模型,同时实现了最快的测量推理速度。我们的代码 GeoEvidence-6K 以及 RS-OPSD 和 RS-OPD-Lite 的模型权重均已公开。