论文

AgentPSO:经多智能体粒子群优化演化智能体推理技能

AgentPSO: Evolving Agent Reasoning Skill via Multi-agent Particle Swarm Optimization

智能体系统Agent 协作Agent Skills

摘要

多智能体推理通过允许多个智能体探索不同的推理路径,有望提高大语言模型解决问题的能力。然而,大多数现有的多智能体方法依赖于推理时间辩论或聚合,这可能容易受到不正确的同行影响和有偏见的共识。此外,智能体本身保持静态,因为它们的潜在推理技能不会随着任务的不同而发展。在本文中,我们介绍了 AgentPSO,这是一种受粒子群启发的框架,用于发展多智能体推理技能。 AgentPSO 将每个智能体视为一个类似粒子的推理器,其状态是自然语言技能,其速度是语义更新方向,迭代地使智能体向更强的技能状态移动,以提高个体和集体的推理性能。在训练迭代中,每个智能体通过结合其先前的速度、个人最佳技能、全局最佳技能以及从同伴推理轨迹得出的自我反思方向来更新其技能。这使得智能体能够从自己的经验和群体发现的最强技能中学习可重用的推理行为,而无需更新主干语言模型的参数。数学和一般推理基准的实验表明,AgentPSO 比静态单智能体技能和仅测试时间的多智能体推理基准有所改进。进化后的技能进一步跨基准转移到另一个骨干模型,这表明 AgentPSO 捕获可重用的推理过程,而不仅仅是优化基准特定的提示。代码在 https://github.com/HYUNMIN-HWANG/AgentPSO/ 上开源。

AgentPSO:经多智能体粒子群优化演化智能体推理技能
图 1:AgentPSO 概述。每个智能体都用其当前的技能独立地解决训练批次问题,产生答案和推理痕迹。同伴观察总结了其他智能体的推理轨迹和正确性,每个智能体从中得出技能改进的自我反思方向。该方向通过类似 PSO 的更新与个人最佳和全球最佳技能的指导相结合。