论文

RELIC:多智能体规划中经披露原则学习可解释可组合技能

RELIC: Revealed Principles for Learning Interpretable Composable Skills in Multi-Agent Planning

智能体系统上下文与知识记忆Agent 协作Agent SkillsAgent记忆

摘要

当智能体必须改进专用决策技能、同时保持其可执行实现私有化时,多智能体规划显著变难。这一设定出现在独立开发的智能体暴露异构接口、观测与能力,却必须在共享团队目标下协调时。现有方法通常依赖集中式优化、共享策略访问或共同技能表示——这些假设在函数签名不同的情况下限制知识复用。我们提出RELIC,一个通过披露原则学习可解释、可组合程序化技能的框架:每个智能体在本地改进自己的可执行技能,同时把有用的决策逻辑与协调模式蒸馏为紧凑的文本原则;这些抽象不要求直接交换程序,可在智能体各自的接口下重新实例化、在不兼容的实现空间之间复用。共享的原则记忆积累可迁移知识,并促进那些反复提升团队级表现的抽象。这种分离让一个智能体的发现能引导其他智能体,同时保留本地可执行实现与去中心化执行。RELIC因此支持跨异构角色与同构角色协作团队的战略迁移。在路由、调度、组合优化与分布式协调设置上的大量实验证明RELIC相对独立与联合LLM搜索方法的有效性,并在不同任务结构与LLM底座上取得一致收益。

RELIC:多智能体规划中经披露原则学习可解释可组合技能:论文配图
图 1:RELIC 学习周期概述。 (1) 编排器从环境流接收下一个任务批次。 (2)私有树搜索选择一个代理程序进行修改。 (3) 大语言模型应用 Lift、Bridge 或 Reflect 来生成签名兼容的候选人。 (4) 候选者取代该智能体的现有程序并与当前队友一起执行。 (5) 协调者从最终的团队行为中获得角色感知的信用和文本洞察。 (6) 上下文团队评估更新私有节点和运营商统计数据并接受改进的候选者。 (7) 成功的行为和跨代理的见解被提炼成公共树中的可转移原则。 (8) 当一项公共原则的下游使用提高了团队效用时,该原则就会得到认可。 (9) 修剪低效用叶子以保持共享内存紧凑。信封、代码框和圆圈分别表示本地档案、可执行程序和文本原则。