论文

如何解读智能体行为

How to Interpret Agent Behavior

模型评测模型行为与机制分析

摘要

Claude Code和Codex这类自主智能体现在可以连续运行数小时甚至数天。理解它们的运行时行为,对于诊断低效、修复缺陷和保障更好监督等下游任务已变得至关重要。获得这种理解的主要方式,是分析这些智能体产生的推理轨迹和执行痕迹。然而这类数据仍是非结构化的自然语言形式,人类难以规模化解读。我们提出ACT*ONOMY(Action与Taxonomy的组合词),一个用于描述和分析智能体运行时行为的分类体系。ACT*ONOMY包含两个组成部分:(1) 分类体系本身,通过扎根理论(Grounded Theory)开发,结构化为包含10个动作、46个子动作和120个叶子类别的三级层次;(2) 一个开放仓库,托管这个持续演化的分类体系,提供将其应用于智能体轨迹分析的自动化分析流水线,并定义了用于定制与扩展的扩展协议。我们的实验表明,ACTONOMY能够跨智能体比较行为画像,并刻画单个智能体在多样轨迹上的行为,浮现指向失败模式的规律。通过提供共享词汇,ACT*ONOMY帮助研究者、智能体设计者和终端用户更一致地解读智能体行为,实现更好的监督与控制。

如何解读智能体行为:论文配图
图1:为什么我们需要Act·onomy? Act·onomy 可用于用人类可读的动作标签来标记代理轨迹;我们使用 13 圈 SWE 工作台轨迹作为运行示例。顶部: pylint-dev/pylint-5859 上轨迹的阶段概述,用颜色编码区域标记不同的转弯。中:用 Act·onomy 子操作标签注释的三个关键回合:第 4 回合(确认)验证错误并转向代码本地化;第 6 回合(绊倒)检测到失败的修复并使用新的搜索策略进行恢复;第 9 回合(精确定位)将正则表达式中的 \b 识别为根本原因。底部:第 9 回合的句子级放大,将每个标签置于代理的 Observation→\toThought→\toAction 循环的特定引用范围内。