论文

RS-Claw:面向遥感智能体的基于层次化技能树的渐进式主动工具探索

RS-Claw: Progressive Active Tool Exploration via Hierarchical Skill Trees for Remote Sensing Agents

智能体系统Agent 工具调用

摘要

多模态大语言模型(MLLM)的兴起正在推动遥感(RS)智能从“看”走向“行动”,OpenClaw风格的框架使智能体能够自主操作海量RS图像处理工具以完成复杂任务。现有RS智能体在工具调用上采用被动选择范式,依赖全量工具注册(Flat)或检索增强生成(RAG)。然而,在海量且多源异构的RS工具生态中,这类被动机制难以在整个任务推理过程中动态平衡“上下文负载”与“工具集完备性”,因而存在固有局限:全量工具注册会在长程任务中引发上下文空间不足,而RAG检索可能在关键步骤遗漏关键工具。为突破这些瓶颈,本文重新定义工具选择,主张智能体应作为工具空间中的主动探索者。基于这一视角,我们提出RS-Claw,一种新颖的RS智能体架构。该架构利用工具端的Skill封装技术对工具描述进行层次化组织,使智能体能够按需执行顺序决策:先仅阅读工具摘要选择相关技能分支,再动态加载详细描述,最终实现精确调用。这一主动范式不仅显著释放了智能体的上下文空间,还有效保证了长程推理中关键工具的准确命中率。在Earth-Bench基准上的系统实验表明,RS-Claw的主动探索机制能有效过滤语义噪声并大幅释放推理空间,输入token压缩率最高达86%,并在复杂推理评测中全面超越现有Flat和RAG基线。

RS-Claw:面向遥感智能体的基于层次化技能树的渐进式主动工具探索:论文配图
图 1:代理工具选择范例的比较。 (a)被动范式:现有方法将代理定义为被动工具接收者。具体来说,“Flat”策略全局注入所有工具,导致上下文空间溢出,严重压缩推理空间; “RAG”策略尽管释放了一些空间,但很容易导致在长期推理过程中遗漏关键工具。 (b) 主动范式:RS-Claw 将代理定义为主动工具浏览器。利用分层技能树,代理通过顺序决策逐步发现并按需加载工具。这种机制将动态工具加载与 ReAct 推理交织在一起,同时确保充足的上下文推理空间和准确的工具命中率。