论文

AnyAct:自我进化Agent的通用行动

AnyAct: Universal Action for Self-Evolving Agents

智能体系统Agent 工具调用智能体互操作协议MCP

摘要

随着大语言模型 (LLM) 的进步,人工智能Agent越来越多地部署在开放世界环境中,以处理复杂的顺序任务(例如文档处理、跨应用程序协作),严重依赖从 GUI 操作到语义 API 等各种操作。然而,仍然存在三个核心挑战:超过LLM上下文窗口的大规模工具生态系统的“规模困境”、由于更新或中断而导致的工具质量的“非平稳性”,以及造成信息孤岛的反馈格式(像素、文本、结构化数据)的“异质性”。为了解决这些问题,我们提出了 AnyAct,这是一个通用操作层,它将可用的功能统一到一个自我进化的操作空间中,使Agent能够在大规模、动态的工具生态系统中高效、可靠地运行。 AnyAct的核心设计侧重于两个目标:通过分层渐进检索(过滤与任务相关的动作)和测试时可靠性演化(修剪不可靠的动作)构建此动作空间,并通过统一多模态反馈的异构观察基础模块实现可靠性感知动作编排。此外,它定义了一个混合动作空间(原始+语义动作)并优化任务成功率和执行成本之间的平衡。对 LiveMCPBench 和 OSMCP(我们为多粒度动作协作开发的新基准)的评估展示了最先进的性能。 AnyAct 在 LiveMCPBench 上的各种 LLM 基础模型上比基准方法提供了显着的性能提升,并且对于本地功能受限的模型而言,改进尤其显着。在 OSMCP 上,它仅用 50 个步骤就获得了 77.27% 的总体成功率,这是大多数竞争对手所需步骤的一半。