论文

FRAMES:企业政策约束工作流中Agent的受控双目标技能演化

FRAMES: Guarded and Dual-Objective Skill Evolution for Agents in Policy-Governed Enterprise Workflows

智能体系统Agent Skills

摘要

智能体代理越来越多地执行受政策约束的企业工作流程,如文档审计,其中它们必须一致应用规则,确保每项价值,并保持可审计性。改善这些代理是一项艰巨的任务:操作反馈稀少且未标记,对规则的任何修改都可能导致无关的案例退化,而准确度必须在不增加推理成本或失去可审计性的情况下提高。我们提出了FRAMES,这是一个闭环框架,从现有的资产中冷启动可部署的技能,并通过共识性变异、基于准确性和成本的帕累托选择以及抗退化保证,逐步进化这些技能,同时保留可审计性。在我们的内部生产系统上部署后,FRAMES在基准线中取得了最佳的准确性和成本权衡,与tau-bench上的收益相同。

FRAMES:企业政策约束工作流中Agent的受控双目标技能演化:论文配图
图 2:FRAMES 的演化循环,它维持候选人技能集的帕累托前沿,并权衡通过率和成本。每次迭代都会从前沿抽取一个父级,并让一组诊断人员并行分析针对它的反馈;他们的建议被合并到一个编辑计划中,该计划将父集重写为子集。孩子必须首先清除每个类别的非回归门(等式2),根据当前案例和累积先前解决案例的回归池子集进行评估,然后在帕累托优势中生存(等式3)进入前沿;然后循环继续进行下一次迭代。一旦满足停止标准,最佳技能集将被提交回技能库,并且其已解决的案例会加入回归池。