论文
AIP:面向学习与治理智能体技能的图表示
AIP: A Graph Representation for Learning and Governing Agent Skills
摘要
如今的座席技能主要由自由散文组成,要求座席在每次会话中阅读、解释并重新推导出如何行动。这带来了两种复合成本:实施繁重任务的可靠性降低,以及技能创建和改进的困难,因为编辑散文是人类和智能体都在努力应对的脆弱过程,特别是对于模型训练中代表性不足的特定领域的程序知识。代理指令协议 (AIP) 通过将技能建模为定向执行图来解决这两个问题:离散步骤作为节点,由确定性脚本或自然语言描述支持,通过显式类型化输入/输出边缘连接,并由模式验证的 YAML 规范进行管理。编译器元技能将现有的人类编写的技能转换为这种形式。好处是双重的。首先,将人工编写的技能编译为 AIP 将 Claude Sonnet 的平均任务奖励从 0.60 提高到 0.71,在 SkillsBench 的 27 项真实代理任务中通过率从 53% 提高到 67%——统计上显着的增益(Wilcoxon 符号秩 p = 0.011),以 13 平局的方式赢得 12 比 2 的任务——通常在更短的挂钟时间内。该图向代理提供经过审查的、可运行的单元,而不是要求它从自然语言重新派生代码、命令和工具调用。其次,在创建和改进方面,由于每项技能都是经过模式验证的、功能可测试的、可逐节点寻址的,因此可以精确地诊断和修复故障。两次创作技能失败可追溯到脚本级别。调整 AIP 规范并重新编译后,两者都以零回归恢复(一项任务从 0/5 到 5/5),将技能改进转变为可测量的调整循环,而不是散文重写。同样的图结构支持语料库级别的治理和技能内省,并为技能强化学习提供自然的行动空间。
