WeaveAgent:分开遥感工具路由与视觉回答
WeaveAgent: A Two-Stage Tool-Routing Agent for Ultra-High-Resolution Remote Sensing Imagery
摘要
问题。具有模糊用户意图的超高分辨率(UHR)遥感有两个瓶颈:视觉标记昂贵,工具调用必须格式可靠(预训练模型在零样本设置下不发出工具调用)。方法。 WeaveAgent 是一个两阶段工具路由代理,它将路由与视觉感知解耦。 A 阶段是路由优先:工具调用行为通过训练习得,而非仅靠提示诱导。 B 阶段有条件执行:内在查询进入视觉回答(全场景缩略图;WeaveEarth 风格的证据板作为可选的固定预算,大约 5k token压缩接口);外部查询对原始全分辨率图像执行工具调用,并在第二轮观察屏蔽轮中根据工具观察结果进行回答。训练:对齐 SFT,然后在奖励 R_WA2 下对齐 GRPO。结果。对齐 SFT 将外部路由从 0% 提升至 80.75% (323/400); GRPO 抑制了 9 种内在查询中的错误工具调用,同时工具选择不变。经过训练的 2B 系统总体上没有击败零样本 8B 基线(0.263 与 0.250),这是一种诊断贡献。 Oracle 归因将两个修复成分分开:将观察加载到上下文中,在无标记交叉模式返回下将外部答案准确性从 0.025 提升到 0.425,两轮 SFT 阶段以较小的路由成本进一步增加了 +9.3 点至 0.518。 +/- 图像消融显示工具调用抑制在视觉上是有基础的,查询语体矩阵显示 LLM 重写的查询训练检查点的成本为 2-11 点。范围。所有训练和评估均使用 5,000 / 3,273 / 1,000 条记录的 VagueUHR 语料库(600 个内在 + 400 个工具需求;基础种子合成,不用于优化)。单通道证据构建在 RTX 4090 上每张图像的运行时间为 7.31 秒。代码、数据和评估协议将被发布。
