论文
ATLAS:通过 LLM 引导抽象和自动机学习发现代理策略
ATLAS: Discovering Agent Strategies through LLM-Guided Abstraction and Automata Learning
摘要
基于 大语言模型 (LLM) 的代理越来越多地用于软件测试和网络安全评估等复杂任务。虽然这些智能体展示了令人印象深刻的能力,但它们的行为很难理解、解释和分析。现有的评估主要关注任务成功和执行轨迹,对代理所采用的策略提供的了解有限。我们提出了 ATLAS(用于智能体轨迹分析和策略发现的自动学习),这是一种从智能体轨迹中恢复可解释行为模型的方法。 ATLAS 将跟踪抽象与自动机学习相结合,以推断捕获观察到的代理与环境交互策略的有限状态模型。这些模型提供人类可解释的见解,并支持对重复行为、决策点、成功任务完成路径和失败循环的自动分析。作为概念证明,我们将 ATLAS 应用于基于 LLM 的渗透测试代理生成的轨迹。由此产生的模型揭示了利用易受攻击的机器的高级行为策略,这些机器很难仅从原始执行跟踪中识别出来。我们讨论学习的行为模型如何支持代理系统的可解释性、模型引导的探索、审计和分析。我们进一步演示了从强大的前沿模型到紧凑语言模型的基于符号模型的知识迁移。此外,我们还展示了模型转换如何在包含 12 台易受攻击的机器的渗透测试案例研究中得出代理行为的简明解释。 ATLAS 强调了模型驱动工程的新机遇:将智能体轨迹转换为明确的行为模型,从而能够系统地理解和分析原本不透明的人工智能智能体。