论文
RS-Claw-Evolution:长视野任务中轻量级遥感代理的环境反馈驱动的进化
RS-Claw-Evolution: Environment-Feedback-Driven Evolution for Lightweight Remote Sensing Agents in Long-Horizon Tasks
摘要
大型语言模型驱动的遥感(RS)代理提供了一种有前景的自动化地理空间分析方法。然而,由于长视野状态的丢失、环境反馈利用效率低下以及优化信号稀疏,基于紧凑语言模型的轻量级 RS 智能体在处理多步交互任务时遇到了困难。我们提出了 RS-Claw-Evolution,这是一种环境反馈驱动的框架,通过三个阶段逐步改进轻量级代理。交互演化使用可执行代码来控制观察、维护中间状态并减少上下文冗余。体验进化将故障感知轨迹生成与错误转向屏蔽相结合,从信息丰富的故障恢复经验中学习,而无需模仿错误操作。决策进化利用具有多维环境奖励和回合级优势保护的强化学习来优化工具使用行为并改善长序列中的信用分配。在 Earth-Bench 上,基于 Qwen3-4B 的优化代理在自主规划模式下实现了 65.9% 的准确率,优于未经训练的 Qwen3-32B 基线 (43.8%) 和 DeepSeek-V3.1 (60.8%),同时接近 GPT-5 (71.6%)。这些结果表明,从环境反馈中学习可以改进轻量级智能体,并缩小其在长视野 RS 任务中与大型模型的性能差距。