论文
先文本后视觉:分阶段知识注入对超高分辨率遥感理解中的 Agentic RLVR 至关重要
Text Before Vision: Staged Knowledge Injection Matters for Agentic RLVR in Ultra-High-Resolution Remote Sensing Understanding
摘要
超高分辨率(UHR)遥感(RS)的多模态推理通常受限于视觉证据获取:模型需要在海量像素空间中定位与任务相关的微小区域。尽管使用放大工具的带可验证奖励的 Agentic 强化学习(RLVR)提供了一条前进路径,我们发现标准强化学习在缺乏结构化领域先验时难以在这些广阔视觉空间中导航。本文研究训练后范式之间的相互作用:在 UHR RS 基准上比较冷启动监督微调(SFT)、RLVR 与 Agentic RLVR。我们的对照研究得出一个反直觉发现:高质量的地球科学纯文本问答(QA)是 UHR 视觉推理提升的主要驱动力。尽管不含图像,领域特定文本注入了引导视觉证据检索所必需的概念、机理解释和决策规则。基于此,我们提出一种分阶段知识注入配方:(1) 用可扩展的、经知识图谱验证的地球科学文本问答进行冷启动,以注入推理结构;(2) 在 SFT 期间对同一批困难的 UHR 图文样本进行“预热”,以稳定并放大后续基于工具的强化学习。该方法在 XLRS-Bench 上取得 60.40% 的 Pass@1,显著优于更大的通用模型(如 GPT-5.2、Gemini 3.0 Pro、Intern-S1),并确立了新的最优水平。
