论文
如何解读智能体行为
How to Interpret Agent Behavior
摘要
Claude Code和Codex这类自主智能体现在可以连续运行数小时甚至数天。理解它们的运行时行为,对于诊断低效、修复缺陷和保障更好监督等下游任务已变得至关重要。获得这种理解的主要方式,是分析这些智能体产生的推理轨迹和执行痕迹。然而这类数据仍是非结构化的自然语言形式,人类难以规模化解读。我们提出ACT*ONOMY(Action与Taxonomy的组合词),一个用于描述和分析智能体运行时行为的分类体系。ACT*ONOMY包含两个组成部分:(1) 分类体系本身,通过扎根理论(Grounded Theory)开发,结构化为包含10个动作、46个子动作和120个叶子类别的三级层次;(2) 一个开放仓库,托管这个持续演化的分类体系,提供将其应用于智能体轨迹分析的自动化分析流水线,并定义了用于定制与扩展的扩展协议。我们的实验表明,ACTONOMY能够跨智能体比较行为画像,并刻画单个智能体在多样轨迹上的行为,浮现指向失败模式的规律。通过提供共享词汇,ACT*ONOMY帮助研究者、智能体设计者和终端用户更一致地解读智能体行为,实现更好的监督与控制。
