论文

AIP:面向学习与治理智能体技能的图表示

AIP: A Graph Representation for Learning and Governing Agent Skills

智能体系统模型训练强化学习Agent SkillsAgentic RL

摘要

如今的座席技能主要由自由散文组成,要求座席在每次会话中阅读、解释并重新推导出如何行动。这带来了两种复合成本:实施繁重任务的可靠性降低,以及技能创建和改进的困难,因为编辑散文是人类和智能体都在努力应对的脆弱过程,特别是对于模型训练中代表性不足的特定领域的程序知识。代理指令协议 (AIP) 通过将技能建模为定向执行图来解决这两个问题:离散步骤作为节点,由确定性脚本或自然语言描述支持,通过显式类型化输入/输出边缘连接,并由模式验证的 YAML 规范进行管理。编译器元技能将现有的人类编写的技能转换为这种形式。好处是双重的。首先,将人工编写的技能编译为 AIP 将 Claude Sonnet 的平均任务奖励从 0.60 提高到 0.71,在 SkillsBench 的 27 项真实代理任务中通过率从 53% 提高到 67%——统计上显着的增益(Wilcoxon 符号秩 p = 0.011),以 13 平局的方式赢得 12 比 2 的任务——通常在更短的挂钟时间内。该图向代理提供经过审查的、可运行的单元,而不是要求它从自然语言重新派生代码、命令和工具调用。其次,在创建和改进方面,由于每项技能都是经过模式验证的、功能可测试的、可逐节点寻址的,因此可以精确地诊断和修复故障。两次创作技能失败可追溯到脚本级别。调整 AIP 规范并重新编译后,两者都以零回归恢复(一项任务从 0/5 到 5/5),将技能改进转变为可测量的调整循环,而不是散文重写。同样的图结构支持语料库级别的治理和技能内省,并为技能强化学习提供自然的行动空间。

AIP:面向学习与治理智能体技能的图表示:论文配图
图 2. 已编译的 AIP 技能(外行星工作流程)作为定向执行图,投影到 Neo4j 中。粉红色的技能节点带有名称和描述;青色节点是过程步骤;步骤之间的箭头是键入的输入/输出边缘(例如 lc 路径、字符串、检测、对象),使数据流变得明确且可检查。运行边将步骤绑定到确定性脚本(橙色);参考边缘附有散文参考(黄色),用于需要判断的步骤。相同类型的结构使得技能节点可寻址和可查询(第 6.1 节)。